Søgning
8 briefing-resultat(er) for »speculative-decoding«
Opfølgning: Tips til draft acceptance med MTP i llama.cpp
Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).
Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test
Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på …
Llama.cpp får DSpark PC Tree – op til 29,5 % hurtigere inferens
En implementering af Parent-Conditioned Drafting Tree giver op til 72 % acceptrate på Qwen 3.0, med størst gevinst ved summarisering. Første udkast, men …
Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090
Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)
Qwen 3.8-27B op til 3× hurtigere på Apple Silicon med mlx-dspark
Et nyt værktøj udnytter spekulativ dekodning til at accelerere modellen markant på M4 Pro. 8-bit kvalitet opnås med hastighed over 20 tok/s.
Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090
Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp …
Opfølgning: DSpark draft-model giver kun 1-2 tok/s – MTP langt hurtigere
En bruger oplevede, at DSpark draft-modellen til DeepSeek V4 Flash var ekstremt langsom (1-2 tok/s) sammenlignet med MTP's 30-40 …
Opfølgning: DSpark giver DeepSeek V4 Flash op til 2x hastighed på A40
TensorSharp benchmark viser 1,5-2x speedup med spekulativ dekodning. 10K-token dokumenter kører 2,03x hurtigere. [Se tidligere briefingen 1. august](/archive/2026 …