Søgning
6 briefing-resultat(er) for »n-gram«
Diskussion: Hvilke radikale arkitekturændringer er på vej?
Ud over kendte forbedringer som N-gram og MTP peges på MAMBA-lignende arkitekturer og hybrid-modeller. Spørgsmålet er hvor langt man kan gå …
N-gram-tabel på SSD streamet i SGLang – uden performance-tab?
En bruger spørger, om nogen har testet at offloade Qwen 3.8 Flash Nexts n-gram-opslagstabel til SSD og streame den i SGLang …
Opfølgning: Er Qwen3.8 Flash Next værd at køre på 4x3090?
Bruger frustreret over 27B-modellens ubeslutsomhed overvejer Flash Next på 4x3090 med n-gram på SSD. Spørger om arkitekturen er klar nok til local …
N-gram vs. MoE: Qwen4-arkitekturen skifter fokus fra regning til genkald
En dybdegående analyse forklarer, at Qwen4s n-gram-tabel lagrer vektorer for korte fraser og aktiveres via token-hash, hvilket reducerer beregningsbyrden. MoE'er …
Qwen3.8-Flash-Next: 125B MoE med n-gram-tabel kan blive local-friendly
Arkitekturen har ~6B aktive parametre og en sparsom n-gram-tabel på 51B, hvilket gør 4-bit kvantisering på ~82 GB mulig – ideel til …
Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test
Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på …