Søgning
5 briefing-resultat(er) for »dspark«
Llama.cpp får DSpark PC Tree – op til 29,5 % hurtigere inferens
En implementering af Parent-Conditioned Drafting Tree giver op til 72 % acceptrate på Qwen 3.0, med størst gevinst ved summarisering. Første udkast, men …
Qwen 3.8-27B op til 3× hurtigere på Apple Silicon med mlx-dspark
Et nyt værktøj udnytter spekulativ dekodning til at accelerere modellen markant på M4 Pro. 8-bit kvalitet opnås med hastighed over 20 tok/s.
Opfølgning: DSpark draft-model giver kun 1-2 tok/s – MTP langt hurtigere
En bruger oplevede, at DSpark draft-modellen til DeepSeek V4 Flash var ekstremt langsom (1-2 tok/s) sammenlignet med MTP's 30-40 …
Opfølgning: DeepSeek V4 Flash kører med 1M kontekst på en enkelt RTX 5090 + DDR5
En reddit-bruger får fuld 1M kontekst til at køre på en RTX 5090 med 256 GB DDR5 ved hjælp af CPU/RAM-offloading …
Opfølgning: DSpark giver DeepSeek V4 Flash op til 2x hastighed på A40
TensorSharp benchmark viser 1,5-2x speedup med spekulativ dekodning. 10K-token dokumenter kører 2,03x hurtigere. [Se tidligere briefingen 1. august](/archive/2026 …