Søgning
2 briefing-resultat(er) for »linear-attention«
Sliding-window attention slår lineær attention – og kræver ingen træning
Ny forskning viser, at sliding-window attention med sinks klarer sig 2-10 gange bedre end lineær attention på lang-kontekst opgaver, uden post …
GLM-5.3-Flash: 320B parametre, 1M kontekst og hybrid attention
Den officielle megatråd bekræfter, at modellen har 320B parametre (18B aktive), 1M tokens kontekstvindue og en ny hybrid sparse/linear attention. Den er trænet …