News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »vllm«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… På DGX Spark måler fællesskabet 28–33 tokens per sekund med NVFP4 via vLLM 0.24.0, mens Apple Silicon med MTPLX v2 når …

fredag 7. august 2026 · research

16 briefing-resultat(er) for »vllm«

Lorivo: Serverless LoRA-hosting på delte GPU'er

Platformen lader mange LoRA-adaptere dele én GPU-server per basismodel og giver OpenAI-kompatible endpoints. Qwen 3.5 4B er gratis.

søndag 13. september 2026 · Værktøjer & produkter loravllmserverlessfine-tuning

Opfølgning: vllm med P2P-driver vs. llama.cpp til Qwen 3.8 27B

Bruger med fire RTX 4090'er overvejer om P2P-patch gør vllm bedre end llama.cpp til MoE-modeller. [briefingen 30. august](/archive/2026 …

mandag 7. september 2026 · Værktøjer & produkter vllmllama.cppp2pqwen-3.8

2x R9700 og 64 GB DDR5 – en "beast" til lokal inferens

Bruger rapporterer gode resultater med Qwen 3.8 27B og Flash Next på et ASUS ProArt-kort med to Radeon AI Pro R9700.

mandag 7. september 2026 · Værktøjer & produkter r9700qwen-3.8vllmradiance

Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?

Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.

onsdag 2. september 2026 · Forskning & arkitektur vllmprefillinference-enginellama.cpp

Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork

… tokens kontekst på to 5090'er – 119 tok/s med MTP. vLLM's MTP-acceptance falder til nul ved 262K; NInfer holder ~55-60 …

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8tinker1m-contextrtx-5090

Nyt værktøj: auto-annotér datasæt lokalt med LLM

"llmog" lader dig bruge lokale LLM'er (llama.cpp, vLLM) til automatisk at annotere datasæt og reklassificere YOLO-datasæt – helt uden cloud. Open source …

lørdag 29. august 2026 · Værktøjer & produkter auto-annotationllmyoloopen-source

Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er

En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …

lørdag 22. august 2026 · Værktøjer & produkter vllmqwen3.8-27brtx-3090inference-speed

Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090

En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …

mandag 17. august 2026 · Værktøjer & produkter qwen-3.8rtx-3090vllmoptimization

Apple Silicon-inference: "Softwarestakken er et rod"

… prefix-caching, spekulativ afkodning og paged KV-cache på Apple Silicon. vLLM-metal er tættest, mens mlx-lm dropper MTP-heads ved konvertering af …

søndag 16. august 2026 · Værktøjer & produkter apple-siliconmlx-lmvllm-metalinference

Ling 3.0 Flash overgår Qwen-122b på Strix Halo i vLLM

På AMD Strix Halo med vLLM ROCm/HiP og 4-bit komprimering slår Ling 3.0 Flash Qwen-122b i hastighed. Tool calling virker …

tirsdag 11. august 2026 · Nye modeller ling-3.0-flashstrix-halovllmperformance

Opfølgning: MiniMax H3 leverer 2K-video med stereo lyd på open weights

Efter fem dages test viser MiniMax H3 imponerende kvalitet med 2K ved 24fps og lydstyret video. Men lokal kørsel på forbruger-GPU er langsom …

mandag 10. august 2026 · Nye modeller minimax-m3open-weightsvideo-generationstereo-audio

PCI-E P2P på forbrugergrafikkort giver markant ydelsesløft i VLLM

At slå P2P til mellem to forbrugergrafikkort (4x5060 Ti) gav op til 2x højere tokens per sekund i VLLM – en overset optimering.

søndag 9. august 2026 · Værktøjer & produkter pci-ep2pvllmmulti-gpu

Opfølgning: DeepSeek V4 Flash kører på 2x DGX Spark – RAM-hovedpine

En bruger serverer 304B DeepSeek V4 Flash på tværs af to DGX Spark med 128 GB unified memory hver, men kæmper med OS-hukommelse …

lørdag 8. august 2026 · Værktøjer & produkter deepseek-v4-flashdgx-sparkvllmlocal-inference

Opfølgning: DeepSeek V4 Flash kører med 1M kontekst på en enkelt RTX 5090 + DDR5

… med 256 GB DDR5 ved hjælp af CPU/RAM-offloading og vLLM. Opnår ~800 t/s prefill og 15+ t/s decode. [Se tidligere …

onsdag 5. august 2026 · Forskning & arkitektur deepseek-v4-flash1m-contextrtx-5090local-llm

Opfølgning: DeepSeek V4 Flash når 105 t/s på to 4090D – Blackwell-kerner genimplementeret i Triton

En udvikler har skrevet alle Blackwell-eksklusive kernels om i Triton, så DeepSeek V4 Flash kører på Ada GPU'er. Resultatet er 2-3x …

fredag 24. juli 2026 · Forskning & arkitektur deepseek-v4-flashtritonvllmada-gpu