Søgning
2 briefing-resultat(er) for »inference-speed«
Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache
Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).
Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er
En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …