News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »mtp«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… På DGX Spark måler fællesskabet 28–33 tokens per sekund med NVFP4 via vLLM 0.24.0, mens Apple Silicon med MTPLX v2 når …

fredag 7. august 2026 · research

Qwen 3.8 27b

… 1.010.000), og den er trænet med multi-step prediction (MTP). Udgivelsen fokuserer på stabilitet og agentisk kodning. ⚠ De to kilder dækker forskellige …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… 75) på LiveCodeBench på en Tesla V100, mens **Qwen3.6-27B-MTP Q4_K_M** opnår 53,3% (40/75) – en forskel på 25 …

torsdag 30. juli 2026 · research

9 briefing-resultat(er) for »mtp«

Opfølgning: Tips til draft acceptance med MTP i llama.cpp

Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).

mandag 7. september 2026 · Værktøjer & produkter llama.cppmtpdraft-modelqwen-3.6

Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4

llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …

fredag 4. september 2026 · Værktøjer & produkter llama.cppqwen3expert-cachemoe

Diskussion: Hvilke radikale arkitekturændringer er på vej?

Ud over kendte forbedringer som N-gram og MTP peges på MAMBA-lignende arkitekturer og hybrid-modeller. Spørgsmålet er hvor langt man kan gå …

mandag 31. august 2026 · Forskning & arkitektur mambaarchitectureinnovationtransformer

Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork

… vLLM's MTP-acceptance falder til nul ved 262K; NInfer holder ~55-60% helt til 1M. [briefingen 17. august](/archive/2026-08-17)

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8tinker1m-contextrtx-5090

MTP nu understøttet i GLM-4.5-Air via llama.cpp

Multi-Token Prediction (MTP) er tilføjet til GLM-4.5-Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til …

mandag 24. august 2026 · Værktøjer & produkter glm-4.5-airmtpllama.cppmoe

Apple Silicon-inference: "Softwarestakken er et rod"

… vLLM-metal er tættest, mens mlx-lm dropper MTP-heads ved konvertering af Qwen-modeller.

søndag 16. august 2026 · Værktøjer & produkter apple-siliconmlx-lmvllm-metalinference

Qwen3.8-27B one-shot en Super Mario-klon lokalt

… Langsom, men ekstremt kompetent til nattejobs – og MTP-varianter venter på test.

søndag 16. august 2026 · Nye modeller qwen3.8-27bggufcodinglocal-llm

Opfølgning: DSpark draft-model giver kun 1-2 tok/s – MTP langt hurtigere

En bruger oplevede, at DSpark draft-modellen til DeepSeek V4 Flash var ekstremt langsom (1-2 tok/s) sammenlignet med MTP's 30-40 …

søndag 9. august 2026 · Forskning & arkitektur deepseek-v4-flashspeculative-decodingdsparkmtp

Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning

En PR til llama.cpp rykker CPU-sampling til GPU og giver 8% flere tok/s med MTP aktiveret. En anden PR cacher "hot …

onsdag 5. august 2026 · Forskning & arkitektur llama.cppgpu-samplingspeed-boostmoe