News-Tracker

Søgning

AI & LLM · daglig briefing


6 briefing-resultat(er) for »inference-engine«

Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air

Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …

fredag 11. september 2026 · Forskning & arkitektur qwen-3.8apple-siliconinferenceoptimization

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?

Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.

onsdag 2. september 2026 · Forskning & arkitektur vllmprefillinference-enginellama.cpp

Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2

En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …

torsdag 20. august 2026 · Nye modeller qwen-3.8dflash2inferenceoptimizationrtx-3090

Opfølgning: C-baseret BitNet-inference når 36 tok/s på Xeon CPU

En open source-motor i ren C kører 1.58-bit ternære modeller med 95% af teoretisk hukommelsesbåndbredde. Viser potentialet for CPU-only inferens …

søndag 9. august 2026 · Forskning & arkitektur bitnet1.58-bitcpu-inferencec-engine

Opfølgning: Kimi K3 kører på én CPU med 8 GB RAM – 33 sekunder per token

En C99-inference engine streamer eksperter fra NVMe. 176 KB binary, ingen GPU. Ikke praktisk, men imponerende ingeniørarbejde. [Se tidligere briefingen 30. juli](/archive …

mandag 3. august 2026 · Forskning & arkitektur kimi-k3cpu-inferencenvme