Søgning
3 briefing-resultat(er) for »avx-512«
50 PRs fra hurtigere CPU-inference i llama.cpp
… AVX-512, MoE expert-caching, streamede vægte og tiled mul_mat. Community håber på markante hastighedsforbedringer inden årets udgang.
Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0
… gen-CPU'er, hvor AVX-512 er slået fra. Se [briefingen d. 5. august](/archive/2026-08-05).
Opfølgning: 29x kernel-hastighed gav kun 6–10 % reel gevinst
En udvikler optimerede en matmul-kernel til BitNet 29x isoleret set, men end-to-end-forbedringen var minimal pga. hukommelsesflaskehals. En vigtig lektion i …