Søgning
1 research-rapport(er) for »sliding-window-attention«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Modellen har en 1.048.576-token kontekstudvidelse (1 million), blanding af sliding window og global attention (48 lag i 1:3 forhold), og …
1 briefing-resultat(er) for »sliding-window-attention«
Sliding-window attention slår lineær attention – og kræver ingen træning
Ny forskning viser, at sliding-window attention med sinks klarer sig 2-10 gange bedre end lineær attention på lang-kontekst opgaver, uden post …