Søgning
17 briefing-resultat(er) for »kv-cache«
K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design
K2 Horizon-modellerne scorer højt på Artificial Analysis, men kræver uforholdsmæssigt meget RAM til kontekst. Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre …
Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090
Ny fork leverer 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab …
Opfølgning: Formel for maksimal tokens/sekund ud fra VRAM-båndbredde
Decode-hastigheden kan estimeres som båndbredde divideret med vægt plus KV-cache; eksempel: 637 GB/s over 16,8 GB giver teoretisk 38 tok …
Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?
… 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent KV-cache-VRAM. [Tidligere briefing](/archive/2026-08-28).
Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache
Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).
Opfølgning: Ny beellama-fork optimerer KV-cache til 76% hurtigere generation
En ny fork af beellama forbedrer kvarn-kvanters ydeevne ved høj kontekstdybde og giver op til 76% hurtigere token generation. Læs baggrunden i [briefingen …
Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU
… 50 tok/s via beellama.cpp og kvarn5/kvarn4 KV-cache. Nøglen er en specialbygget hybrid-kvantisering og Jinja-skabelon, der reducerer tænketokens. [briefingen …
Opfølgning: Qwen 3.8 27B QAT Q2 kører i kun 13-14 GB RAM med minimal kvalitetsnedgang
En bruger rapporterer, at QAT-kvantiseret Qwen 3.8 27B i Q2 med DFlash og Q5 KV-cache bruger 13-14 GB RAM og …
Opfølgning: $100 benchmark af Qwen3.8-27B quants
En bruger planlægger at bruge $100 på cloud-GPU'er for at teste kvantiseringsniveauer, KV-cache-præcision og kontekst-afvejninger på Qwen3.8-27B.
ConvRot-kvantisering nu i llama-cpp-turboquant
… Metoden lover at genvinde kvalitet tabt i turbo-quants og understøtter også MoE-cache til modeller større end VRAM.
Hvad hvis Chain-of-Thought var reversibelt?
… cyklisk konsistens giver fejldetektion uden ekstra model, Bennett-stil uncomputation kan reducere KV-cache fra O(N) til O(log N), og billig backtracking …
Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer
Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).
Opfølgning: DeepSeek V4 Flash 12x hurtigere på M3 Ultra med optimerede kernels
En bruger opnår 1,6 sekunder pr. chat-turn via sparse attention-optimeringer og KV-cache-prewarming. [briefingen 6. august](/archive/2026-08-06)
Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090
En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …
Apple Silicon-inference: "Softwarestakken er et rod"
To ugers test viser, at ingen framework samler prefix-caching, spekulativ afkodning og paged KV-cache på Apple Silicon. vLLM-metal er tættest, mens …
Opfølgning: Debat om KV-cache-kvantisering på Qwen 3.6
På r/LocalLLaMA diskuteres afvejningen mellem VRAM-besparelser og kvalitetstab ved kvantisering af KV-cache under Q8. Se [briefingen 19. juli](/archive/2026-07 …
Opfølgning: 192 GB RAM – hvad kører fællesskabet på store modeller?
Brugeren fortæller om erfaringer med Qwen3.5-397B på M2 Ultra og arbejdet med at fikse KV-cache i llama.cpp. Se [briefingen 17 …