News-Tracker

Søgning

AI & LLM · daglig briefing


2 research-rapport(er) for »multi-gpu«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Gemma 4-modellerne fra Google DeepMind, udgivet april 2026, præsenteres i [3] og [4] som multimodal med tekst-, billede- og lydstøtte (på de mindre …

fredag 7. august 2026 · research

Qwen 3.8 27b

… Qwen3.6-27B er en multimodal model, der accepterer tekst, billeder og video [2], og den er udgivet under Apache 2.0-licensen [2 …

mandag 3. august 2026 · research

4 briefing-resultat(er) for »multi-gpu«

Gammel GPU kan speede mmproj op til 10x med llama.cpp

Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.

lørdag 12. september 2026 · Værktøjer & produkter llama.cppmmprojgpu-offloadinglocal-llm

PCI-E P2P på forbrugergrafikkort giver markant ydelsesløft i VLLM

At slå P2P til mellem to forbrugergrafikkort (4x5060 Ti) gav op til 2x højere tokens per sekund i VLLM – en overset optimering.

søndag 9. august 2026 · Værktøjer & produkter pci-ep2pvllmmulti-gpu

Billig multi-node GPU: 30 tok/s på Laguna med to 4060'ere og USB-ethernet

… Trafikken ligger på 30-70 MB/s – langt under hvad mange tror er nødvendigt for multi-node-inference.

torsdag 23. juli 2026 · Værktøjer & produkter llama.cppmulti-nodelocal-inferencelaguna

6x3090 vs 8x3090: Er opgraderingen værd?

En bruger overvejer at gå fra seks til otte RTX 3090'ere via en PCIe-splitter for at køre DeepSeek Flash V4 i Q8 …

fredag 17. juli 2026 · Værktøjer & produkter 3090multi-gpulocal-llmpcie