Søgning
2 briefing-resultat(er) for »sparse-attention«
GLM-5.3-Flash: 320B parametre, 1M kontekst og hybrid attention
Den officielle megatråd bekræfter, at modellen har 320B parametre (18B aktive), 1M tokens kontekstvindue og en ny hybrid sparse/linear attention. Den er trænet …
Opfølgning: DeepSeek V4 Flash 12x hurtigere på M3 Ultra med optimerede kernels
En bruger opnår 1,6 sekunder pr. chat-turn via sparse attention-optimeringer og KV-cache-prewarming. [briefingen 6. august](/archive/2026-08-06)