Søgning
4 briefing-resultat(er) for »dflash2«
Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache
Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).
Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test
Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på …
Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2
En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …
Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090
Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)