Søgning
3 research-rapport(er) for »mtp«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… På DGX Spark måler fællesskabet 28–33 tokens per sekund med NVFP4 via vLLM 0.24.0, mens Apple Silicon med MTPLX v2 når …
Qwen 3.8 27b
… 1.010.000), og den er trænet med multi-step prediction (MTP). Udgivelsen fokuserer på stabilitet og agentisk kodning. ⚠ De to kilder dækker forskellige …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… 75) på LiveCodeBench på en Tesla V100, mens **Qwen3.6-27B-MTP Q4_K_M** opnår 53,3% (40/75) – en forskel på 25 …
9 briefing-resultat(er) for »mtp«
Opfølgning: Tips til draft acceptance med MTP i llama.cpp
Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).
Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4
llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …
Diskussion: Hvilke radikale arkitekturændringer er på vej?
Ud over kendte forbedringer som N-gram og MTP peges på MAMBA-lignende arkitekturer og hybrid-modeller. Spørgsmålet er hvor langt man kan gå …
Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork
… vLLM's MTP-acceptance falder til nul ved 262K; NInfer holder ~55-60% helt til 1M. [briefingen 17. august](/archive/2026-08-17)
MTP nu understøttet i GLM-4.5-Air via llama.cpp
Multi-Token Prediction (MTP) er tilføjet til GLM-4.5-Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til …
Apple Silicon-inference: "Softwarestakken er et rod"
… vLLM-metal er tættest, mens mlx-lm dropper MTP-heads ved konvertering af Qwen-modeller.
Qwen3.8-27B one-shot en Super Mario-klon lokalt
… Langsom, men ekstremt kompetent til nattejobs – og MTP-varianter venter på test.
Opfølgning: DSpark draft-model giver kun 1-2 tok/s – MTP langt hurtigere
En bruger oplevede, at DSpark draft-modellen til DeepSeek V4 Flash var ekstremt langsom (1-2 tok/s) sammenlignet med MTP's 30-40 …
Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning
En PR til llama.cpp rykker CPU-sampling til GPU og giver 8% flere tok/s med MTP aktiveret. En anden PR cacher "hot …