Søgning
4 briefing-resultat(er) for »prompt-processing«
Opfølgning: Ollama ROCm matcher næsten llama.cpp Vulkan på RX 7900 XTX
… Ollama mod 35,8 i llama.cpp; Ollama var bedst til prompt processing ved 64K kontekst. AMD-brugere kan beholde Ollama uden stort tab …
Opfølgning: Over 200.000 tokens kontekst på 16 GB VRAM med Qwen 3.8 27B
… Prompt processing falder til 400 tk/s, men kvaliteten er stadig god. [briefingen 17. august](/archive/2026-08-17)
ROCm 7.14 i llama.cpp giver 50% hurtigere prompt-processing på Radeon 780M
Opgraderingen til ROCm 7.14 tilføjer officiel understøttelse af Radeon 780M iGPU. Benchmarks viser markant forbedring for tætte modeller sammenlignet med Vulkan, men MoE …
Opfølgning: Dual 3090-opsætning firedobler prompt-hastigheden i llama.cpp
Ved at flytte prompt processing til GPU'erne steg ydeevnen fra 400 til 1600 tokens/s på Qwen 3.6 27B. En konkret gevinst …