Søgning
2 briefing-resultat(er) for »gpu-sampling«
Opfølgning: Dual 3090-opsætning firedobler prompt-hastigheden i llama.cpp
… En konkret gevinst fra den nye GPU-sampling. [Briefingen 5. august](/archive/2026-08-05).
Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning
En PR til llama.cpp rykker CPU-sampling til GPU og giver 8% flere tok/s med MTP aktiveret. En anden PR cacher "hot …