Søgning
1 research-rapport(er) for »rtx-3090«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Her anbefales Qwen3.6-27B dense til "real coding agent work" på en enkelt 24GB GPU (RTX 3090Ti). Kilden angiver, at Qwen3.6-27B …
16 briefing-resultat(er) for »rtx-3090«
llamAmpere: 90+ TPS på en RTX 3090 med specialiseret llama.cpp-fork
En custom fork af llama.cpp optimeret til Ampere-arkitekturen leverer API-hastigheder lokalt på en 3090 med op til 240K kontekst. Et kvantespring …
Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090
… Projektet bliver open source og viser, hvad lokale modeller kan præstere på en enkelt RTX 3090. Se [briefingen 31. august](/archive/2026-08-31).
Hvorfor ser vi ikke flere INT8 W8A8-modeller til RTX 3090?
RTX 3090 har native INT8-tensorcores, men de fleste vælger FP8 eller mindre kvanter – debatten om hvorfor fortsætter.
Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM
… i 4-bit+ med acceptable tokens/s på en opsætning med 2x RTX 3090 og DDR5 RAM. Se [tidligere dækning](/archive/2026-08-09).
Qwen3.8-27B Q6 kører 20 timers agentisk kode uden stop
På en RTX 3090 + RTX 3060 holdt modellen 60–63 tokens/s gennem et helt døgns målrettet arbejde. [Se tidligere dækning](/archive/2026-08 …
Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er
En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …
Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer
Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).
Qwen3.8-27B viser hidtil uset handlekraft på lokal hardware
En Reddit-bruger fik modellen til at hente skema, downloade video, transskribere og analysere frames – alt på én RTX 3090. Offentligheden aner ikke, hvor …
Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2
En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …
Opfølgning: Reddit benchmarker quants – "vi benchmarker modeller ingen kører"
… Kl-divergens er en dårlig proxy for egentlig opgaveperformance. [Forrige briefing dækkede 82 tps på RTX 3090](/archive/2026-08-17).
Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090
En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …
Opfølgning: LFM 2.6B imponerer med 260 tok/s på RTX 3090
Brugere rapporterer lynhurtig inferens på lokalt hardware. Modellen er designet til mobil og klarer simple opgaver som resumé og søgning. Se [briefingen 5. august …
Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090
En bruger har fået DeepSeek V4 Flash (284B MoE) til at køre på en gammel quad-Xeon DDR4-server med to RTX 3090'ere …
Opfølgning: DeepSeek V4 Flash kører på RTX 3090 med 12,5 tok/s via CPU-spild
En bruger fik DeepSeek-V4-Flash-0731 til at køre på et enkelt 24 GB-kort ved at lægge MoE-eksperter i system-RAM …
Bruger spørger: Bedste setup til lokal LLM på RTX 3090 og 48 GB RAM
Reddit-bruger søger stabilt OS og framework til coding og web-søgning på 24 GB VRAM. Ollama kørte langsomt, Unsloth var hurtigt men ustabilt.
6x3090 vs 8x3090: Er opgraderingen værd?
En bruger overvejer at gå fra seks til otte RTX 3090'ere via en PCIe-splitter for at køre DeepSeek Flash V4 i Q8 …