Søgning
3 briefing-resultat(er) for »expert-cache«
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4
llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …
Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning
… En anden PR cacher "hot" MoE-eksperter på GPU, hvilket giver 33→56 tok/s på 8GB VRAM. [Se tidligere briefingen](https://www.reddit …