News-Tracker

Søgning

AI & LLM · daglig briefing


17 briefing-resultat(er) for »kv-cache«

K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design

K2 Horizon-modellerne scorer højt på Artificial Analysis, men kræver uforholdsmæssigt meget RAM til kontekst. Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre …

tirsdag 15. september 2026 · Nye modeller k2-horizonkv-cachelocal-llmartificial-analysis

Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090

Ny fork leverer 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab

søndag 6. september 2026 · Forskning & arkitektur tinkerkv-cacheyarnqwen-3.8

Opfølgning: Formel for maksimal tokens/sekund ud fra VRAM-båndbredde

Decode-hastigheden kan estimeres som båndbredde divideret med vægt plus KV-cache; eksempel: 637 GB/s over 16,8 GB giver teoretisk 38 tok …

lørdag 5. september 2026 · Værktøjer & produkter tokens-per-secondmemory-bandwidthllama.cppkv-cache

Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?

… 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent KV-cache-VRAM. [Tidligere briefing](/archive/2026-08-28).

lørdag 5. september 2026 · Værktøjer & produkter ggufkv-cachevramqwen3.8-27b

Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache

Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).

onsdag 2. september 2026 · Forskning & arkitektur qwen-3.8r9700mxfp4inference-speed

Opfølgning: Ny beellama-fork optimerer KV-cache til 76% hurtigere generation

En ny fork af beellama forbedrer kvarn-kvanters ydeevne ved høj kontekstdybde og giver op til 76% hurtigere token generation. Læs baggrunden i [briefingen …

tirsdag 1. september 2026 · Værktøjer & produkter beellamakvarnkv-cachellama.cpp

Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU

… 50 tok/s via beellama.cpp og kvarn5/kvarn4 KV-cache. Nøglen er en specialbygget hybrid-kvantisering og Jinja-skabelon, der reducerer tænketokens. [briefingen …

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8llama.cpp16gbkv-cache

Opfølgning: Qwen 3.8 27B QAT Q2 kører i kun 13-14 GB RAM med minimal kvalitetsnedgang

En bruger rapporterer, at QAT-kvantiseret Qwen 3.8 27B i Q2 med DFlash og Q5 KV-cache bruger 13-14 GB RAM og …

fredag 28. august 2026 · Værktøjer & produkter qwen-3.8quantizationqatgguf

Opfølgning: $100 benchmark af Qwen3.8-27B quants

En bruger planlægger at bruge $100 på cloud-GPU'er for at teste kvantiseringsniveauer, KV-cache-præcision og kontekst-afvejninger på Qwen3.8-27B.

tirsdag 25. august 2026 · Forskning & arkitektur qwenquantizationbenchmarkkv-cache

ConvRot-kvantisering nu i llama-cpp-turboquant

… Metoden lover at genvinde kvalitet tabt i turbo-quants og understøtter også MoE-cache til modeller større end VRAM.

mandag 24. august 2026 · Forskning & arkitektur convrotquantizationllama.cppturboquant

Hvad hvis Chain-of-Thought var reversibelt?

… cyklisk konsistens giver fejldetektion uden ekstra model, Bennett-stil uncomputation kan reducere KV-cache fra O(N) til O(log N), og billig backtracking …

søndag 23. august 2026 · Forskning & arkitektur chain-of-thoughtreversible-logickv-cachelocal-llm

Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer

Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).

fredag 21. august 2026 · Værktøjer & produkter qwen-3.8inference-optimizationrtx-3090tps

Opfølgning: DeepSeek V4 Flash 12x hurtigere på M3 Ultra med optimerede kernels

En bruger opnår 1,6 sekunder pr. chat-turn via sparse attention-optimeringer og KV-cache-prewarming. [briefingen 6. august](/archive/2026-08-06)

onsdag 19. august 2026 · Værktøjer & produkter deepseek-v4m3-ultrasparse-attentionkv-cache

Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090

En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …

mandag 17. august 2026 · Værktøjer & produkter qwen-3.8rtx-3090vllmoptimization

Apple Silicon-inference: "Softwarestakken er et rod"

To ugers test viser, at ingen framework samler prefix-caching, spekulativ afkodning og paged KV-cache på Apple Silicon. vLLM-metal er tættest, mens …

søndag 16. august 2026 · Værktøjer & produkter apple-siliconmlx-lmvllm-metalinference

Opfølgning: Debat om KV-cache-kvantisering på Qwen 3.6

På r/LocalLLaMA diskuteres afvejningen mellem VRAM-besparelser og kvalitetstab ved kvantisering af KV-cache under Q8. Se [briefingen 19. juli](/archive/2026-07 …

mandag 20. juli 2026 · 🗣️ Stemmer qwen-3.6kv-cachequantizationlocal-llm

Opfølgning: 192 GB RAM – hvad kører fællesskabet på store modeller?

Brugeren fortæller om erfaringer med Qwen3.5-397B på M2 Ultra og arbejdet med at fikse KV-cache i llama.cpp. Se [briefingen 17 …

søndag 19. juli 2026 · Værktøjer & produkter qwen3.5-397blocal-modelsllama.cppkv-cache