Søgning
11 briefing-resultat(er) for »cpu-inference«
Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next
Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp
Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.
50 PRs fra hurtigere CPU-inference i llama.cpp
En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …
Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp
En udvikler har skrevet en komplet inferens-runtime til Gemma 4 E2B i 700 linjer C. På en Ryzen 7 7700 opnås 639 tok …
FreeToken: Kør frontlinje-MoE på din gaming-PC
FreeToken muliggør 39 tok/s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B …
Opfølgning: C-baseret BitNet-inference når 36 tok/s på Xeon CPU
… Viser potentialet for CPU-only inferens. Se [briefingen 3. august](/archive/2026-08-03).
Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0
… gen-CPU'er, hvor AVX-512 er slået fra. Se [briefingen d. 5. august](/archive/2026-08-05).
Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090
… Løsningen koster omkring 6.000 dollars og viser, at CPU-GPU-hybridarkitekturer kan være et alternativ til dyr unified memory.
Opfølgning: Kimi K3 kører på én CPU med 8 GB RAM – 33 sekunder per token
En C99-inference engine streamer eksperter fra NVMe. 176 KB binary, ingen GPU. Ikke praktisk, men imponerende ingeniørarbejde. [Se tidligere briefingen 30. juli](/archive …
Opfølgning: 29x kernel-hastighed gav kun 6–10 % reel gevinst
En udvikler optimerede en matmul-kernel til BitNet 29x isoleret set, men end-to-end-forbedringen var minimal pga. hukommelsesflaskehals. En vigtig lektion i …