News-Tracker

Søgning

AI & LLM · daglig briefing


11 briefing-resultat(er) for »prefill«

Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en

En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmexpert-cacheprefill-optimization

Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund

… RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s. Prefill når 334 tokens/sekund, hvilket gør selv store modeller brugbare på beskedent …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmrtx-3060quantization

Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next

Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3qwen3.8-flash-nextcpu-offloadinference

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

MLX på Mac M5: Er det overflødigt?

Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.

torsdag 3. september 2026 · Værktøjer & produkter mlxllama.cppapple-siliconqwen-3.8

Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?

Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.

onsdag 2. september 2026 · Forskning & arkitektur vllmprefillinference-enginellama.cpp

Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf

Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …

tirsdag 1. september 2026 · Værktøjer & produkter llama.cppqwen-3.8memoryperformance

Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp

… På en Ryzen 7 7700 opnås 639 tok/s prefill og 25,9 tok/s generation – hurtigere end llama.cpp. [briefingen 25. august](/archive …

fredag 28. august 2026 · Værktøjer & produkter gemma-4c-implementationcpu-inference

Bærbar datacenter-rig kører Qwen3.8-27B BF16 med 262K kontekst

FormD T1 med RTX Pro 6000 Blackwell og 96 GB RAM håndterer 175K tokens prefill på 102 sekunder. Brugeren foretrækker BF16 frem for kvantisering …

onsdag 26. august 2026 · Værktøjer & produkter portable-rigrtx-pro-6000bf16local-llm

Opfølgning: Parallelle agenter i llama.cpp – decode er fin, men prefill stopper alle andre

En bruger tester 3-5 parallelle agenter i llama.cpp og opdager, at decode kører flydende, men én agents prefill af et websearch-resultat …

tirsdag 11. august 2026 · Forskning & arkitektur llama.cppparallel-agentsprefillbottleneck

Opfølgning: DeepSeek V4 Flash kører med 1M kontekst på en enkelt RTX 5090 + DDR5

… Opnår ~800 t/s prefill og 15+ t/s decode. [Se tidligere briefingen](/archive/2026-07-24)

onsdag 5. august 2026 · Forskning & arkitektur deepseek-v4-flash1m-contextrtx-5090local-llm