News-Tracker

Søgning

AI & LLM · daglig briefing


11 briefing-resultat(er) for »cpu-inference«

Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next

Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3qwen3.8-flash-nextcpu-offloadinference

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp

Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3llama.cppqwen-3.8inference

50 PRs fra hurtigere CPU-inference i llama.cpp

En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …

søndag 30. august 2026 · Værktøjer & produkter llama.cppcpu-inferenceoptimizationprs

Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp

En udvikler har skrevet en komplet inferens-runtime til Gemma 4 E2B i 700 linjer C. På en Ryzen 7 7700 opnås 639 tok …

fredag 28. august 2026 · Værktøjer & produkter gemma-4c-implementationcpu-inference

FreeToken: Kør frontlinje-MoE på din gaming-PC

FreeToken muliggør 39 tok/s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B …

tirsdag 25. august 2026 · Forskning & arkitektur freetokenmoeedge-inferencecpu-gpu

Opfølgning: C-baseret BitNet-inference når 36 tok/s på Xeon CPU

… Viser potentialet for CPU-only inferens. Se [briefingen 3. august](/archive/2026-08-03).

søndag 9. august 2026 · Forskning & arkitektur bitnet1.58-bitcpu-inferencec-engine

Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0

… gen-CPU'er, hvor AVX-512 er slået fra. Se [briefingen d. 5. august](/archive/2026-08-05).

lørdag 8. august 2026 · Nye modeller llama.cppq2_0x86-vnnicpu-inference

Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090

… Løsningen koster omkring 6.000 dollars og viser, at CPU-GPU-hybridarkitekturer kan være et alternativ til dyr unified memory.

tirsdag 4. august 2026 · Nye modeller deepseek-v4-flashinferencertx-3090cpu-gpu

Opfølgning: Kimi K3 kører på én CPU med 8 GB RAM – 33 sekunder per token

En C99-inference engine streamer eksperter fra NVMe. 176 KB binary, ingen GPU. Ikke praktisk, men imponerende ingeniørarbejde. [Se tidligere briefingen 30. juli](/archive …

mandag 3. august 2026 · Forskning & arkitektur kimi-k3cpu-inferencenvme

Opfølgning: 29x kernel-hastighed gav kun 6–10 % reel gevinst

En udvikler optimerede en matmul-kernel til BitNet 29x isoleret set, men end-to-end-forbedringen var minimal pga. hukommelsesflaskehals. En vigtig lektion i …

lørdag 25. juli 2026 · Forskning & arkitektur bitnetavx-512kernel-optimizationcpu-inference