News-Tracker

Søgning

AI & LLM · daglig briefing


7 briefing-resultat(er) for »inference-optimization«

Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air

Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …

fredag 11. september 2026 · Forskning & arkitektur qwen-3.8apple-siliconinferenceoptimization

50 PRs fra hurtigere CPU-inference i llama.cpp

En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …

søndag 30. august 2026 · Værktøjer & produkter llama.cppcpu-inferenceoptimizationprs

Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer

Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).

fredag 21. august 2026 · Værktøjer & produkter qwen-3.8inference-optimizationrtx-3090tps

Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2

En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …

torsdag 20. august 2026 · Nye modeller qwen-3.8dflash2inferenceoptimizationrtx-3090

Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090

En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …

mandag 17. august 2026 · Værktøjer & produkter qwen-3.8rtx-3090vllmoptimization

OpenAI sænker prisen på GPT-5.6 Luna med 80 %

OpenAI har brugt GPT-5.6 Sol til at optimere inferenskerner og sænke omkostningerne. Luna koster nu $0,20/mio. input-tokens – billigere end …

fredag 31. juli 2026 · Nye modeller gpt-5-6openaiprice-dropinference-optimization

Opfølgning: 29x kernel-hastighed gav kun 6–10 % reel gevinst

En udvikler optimerede en matmul-kernel til BitNet 29x isoleret set, men end-to-end-forbedringen var minimal pga. hukommelsesflaskehals. En vigtig lektion i …

lørdag 25. juli 2026 · Forskning & arkitektur bitnetavx-512kernel-optimizationcpu-inference