Søgning
2 research-rapport(er) for »multi-gpu«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Gemma 4-modellerne fra Google DeepMind, udgivet april 2026, præsenteres i [3] og [4] som multimodal med tekst-, billede- og lydstøtte (på de mindre …
Qwen 3.8 27b
… Qwen3.6-27B er en multimodal model, der accepterer tekst, billeder og video [2], og den er udgivet under Apache 2.0-licensen [2 …
4 briefing-resultat(er) for »multi-gpu«
Gammel GPU kan speede mmproj op til 10x med llama.cpp
Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.
PCI-E P2P på forbrugergrafikkort giver markant ydelsesløft i VLLM
At slå P2P til mellem to forbrugergrafikkort (4x5060 Ti) gav op til 2x højere tokens per sekund i VLLM – en overset optimering.
Billig multi-node GPU: 30 tok/s på Laguna med to 4060'ere og USB-ethernet
… Trafikken ligger på 30-70 MB/s – langt under hvad mange tror er nødvendigt for multi-node-inference.
6x3090 vs 8x3090: Er opgraderingen værd?
En bruger overvejer at gå fra seks til otte RTX 3090'ere via en PCIe-splitter for at køre DeepSeek Flash V4 i Q8 …