Søgning
11 briefing-resultat(er) for »prefill«
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund
… RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s. Prefill når 334 tokens/sekund, hvilket gør selv store modeller brugbare på beskedent …
Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next
Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
MLX på Mac M5: Er det overflødigt?
Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.
Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?
Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.
Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf
Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …
Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp
… På en Ryzen 7 7700 opnås 639 tok/s prefill og 25,9 tok/s generation – hurtigere end llama.cpp. [briefingen 25. august](/archive …
Bærbar datacenter-rig kører Qwen3.8-27B BF16 med 262K kontekst
FormD T1 med RTX Pro 6000 Blackwell og 96 GB RAM håndterer 175K tokens prefill på 102 sekunder. Brugeren foretrækker BF16 frem for kvantisering …
Opfølgning: Parallelle agenter i llama.cpp – decode er fin, men prefill stopper alle andre
En bruger tester 3-5 parallelle agenter i llama.cpp og opdager, at decode kører flydende, men én agents prefill af et websearch-resultat …
Opfølgning: DeepSeek V4 Flash kører med 1M kontekst på en enkelt RTX 5090 + DDR5
… Opnår ~800 t/s prefill og 15+ t/s decode. [Se tidligere briefingen](/archive/2026-07-24)