Søgning
1 research-rapport(er) for »vllm«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… På DGX Spark måler fællesskabet 28–33 tokens per sekund med NVFP4 via vLLM 0.24.0, mens Apple Silicon med MTPLX v2 når …
16 briefing-resultat(er) for »vllm«
Lorivo: Serverless LoRA-hosting på delte GPU'er
Platformen lader mange LoRA-adaptere dele én GPU-server per basismodel og giver OpenAI-kompatible endpoints. Qwen 3.5 4B er gratis.
MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden
… GGUF fra 1,56 GB kører i vLLM, llama.cpp og MLX.
Opfølgning: vllm med P2P-driver vs. llama.cpp til Qwen 3.8 27B
Bruger med fire RTX 4090'er overvejer om P2P-patch gør vllm bedre end llama.cpp til MoE-modeller. [briefingen 30. august](/archive/2026 …
2x R9700 og 64 GB DDR5 – en "beast" til lokal inferens
Bruger rapporterer gode resultater med Qwen 3.8 27B og Flash Next på et ASUS ProArt-kort med to Radeon AI Pro R9700.
Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?
Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.
Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork
… tokens kontekst på to 5090'er – 119 tok/s med MTP. vLLM's MTP-acceptance falder til nul ved 262K; NInfer holder ~55-60 …
Nyt værktøj: auto-annotér datasæt lokalt med LLM
"llmog" lader dig bruge lokale LLM'er (llama.cpp, vLLM) til automatisk at annotere datasæt og reklassificere YOLO-datasæt – helt uden cloud. Open source …
Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er
En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …
Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090
En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …
Apple Silicon-inference: "Softwarestakken er et rod"
… prefix-caching, spekulativ afkodning og paged KV-cache på Apple Silicon. vLLM-metal er tættest, mens mlx-lm dropper MTP-heads ved konvertering af …
Ling 3.0 Flash overgår Qwen-122b på Strix Halo i vLLM
På AMD Strix Halo med vLLM ROCm/HiP og 4-bit komprimering slår Ling 3.0 Flash Qwen-122b i hastighed. Tool calling virker …
Opfølgning: MiniMax H3 leverer 2K-video med stereo lyd på open weights
Efter fem dages test viser MiniMax H3 imponerende kvalitet med 2K ved 24fps og lydstyret video. Men lokal kørsel på forbruger-GPU er langsom …
PCI-E P2P på forbrugergrafikkort giver markant ydelsesløft i VLLM
At slå P2P til mellem to forbrugergrafikkort (4x5060 Ti) gav op til 2x højere tokens per sekund i VLLM – en overset optimering.
Opfølgning: DeepSeek V4 Flash kører på 2x DGX Spark – RAM-hovedpine
En bruger serverer 304B DeepSeek V4 Flash på tværs af to DGX Spark med 128 GB unified memory hver, men kæmper med OS-hukommelse …
Opfølgning: DeepSeek V4 Flash kører med 1M kontekst på en enkelt RTX 5090 + DDR5
… med 256 GB DDR5 ved hjælp af CPU/RAM-offloading og vLLM. Opnår ~800 t/s prefill og 15+ t/s decode. [Se tidligere …
Opfølgning: DeepSeek V4 Flash når 105 t/s på to 4090D – Blackwell-kerner genimplementeret i Triton
En udvikler har skrevet alle Blackwell-eksklusive kernels om i Triton, så DeepSeek V4 Flash kører på Ada GPU'er. Resultatet er 2-3x …