News-Tracker

Søgning

AI & LLM · daglig briefing


3 briefing-resultat(er) for »avx-512«

50 PRs fra hurtigere CPU-inference i llama.cpp

AVX-512, MoE expert-caching, streamede vægte og tiled mul_mat. Community håber på markante hastighedsforbedringer inden årets udgang.

søndag 30. august 2026 · Værktøjer & produkter llama.cppcpu-inferenceoptimizationprs

Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0

… gen-CPU'er, hvor AVX-512 er slået fra. Se [briefingen d. 5. august](/archive/2026-08-05).

lørdag 8. august 2026 · Nye modeller llama.cppq2_0x86-vnnicpu-inference

Opfølgning: 29x kernel-hastighed gav kun 6–10 % reel gevinst

En udvikler optimerede en matmul-kernel til BitNet 29x isoleret set, men end-to-end-forbedringen var minimal pga. hukommelsesflaskehals. En vigtig lektion i …

lørdag 25. juli 2026 · Forskning & arkitektur bitnetavx-512kernel-optimizationcpu-inference