News-Tracker

Søgning

AI & LLM · daglig briefing


8 briefing-resultat(er) for »speculative-decoding«

Opfølgning: Tips til draft acceptance med MTP i llama.cpp

Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).

mandag 7. september 2026 · Værktøjer & produkter llama.cppmtpdraft-modelqwen-3.6

Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test

Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på …

søndag 23. august 2026 · Værktøjer & produkter dflash2speculative-decodingqwen3.8-27bllama.cpplivecodebench

Llama.cpp får DSpark PC Tree – op til 29,5 % hurtigere inferens

En implementering af Parent-Conditioned Drafting Tree giver op til 72 % acceptrate på Qwen 3.0, med størst gevinst ved summarisering. Første udkast, men …

lørdag 22. august 2026 · Forskning & arkitektur llama.cppdsparkspeculative-decodingpc-tree

Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090

Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)

onsdag 19. august 2026 · Værktøjer & produkter dflash2qwen-3.8llama.cppspeculative-decoding

Qwen 3.8-27B op til 3× hurtigere på Apple Silicon med mlx-dspark

Et nyt værktøj udnytter spekulativ dekodning til at accelerere modellen markant på M4 Pro. 8-bit kvalitet opnås med hastighed over 20 tok/s.

lørdag 15. august 2026 · Værktøjer & produkter qwen-3.8apple-siliconspeculative-decodingmlx

Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090

Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp …

tirsdag 11. august 2026 · Nye modeller muse-glimmerspeculative-decodingperformancertx-5090

Opfølgning: DSpark draft-model giver kun 1-2 tok/s – MTP langt hurtigere

En bruger oplevede, at DSpark draft-modellen til DeepSeek V4 Flash var ekstremt langsom (1-2 tok/s) sammenlignet med MTP's 30-40 …

søndag 9. august 2026 · Forskning & arkitektur deepseek-v4-flashspeculative-decodingdsparkmtp

Opfølgning: DSpark giver DeepSeek V4 Flash op til 2x hastighed på A40

TensorSharp benchmark viser 1,5-2x speedup med spekulativ dekodning. 10K-token dokumenter kører 2,03x hurtigere. [Se tidligere briefingen 1. august](/archive/2026 …

mandag 3. august 2026 · Forskning & arkitektur deepseek-v4-flashdsparkspeculative-decoding