News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »3090«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Her anbefales Qwen3.6-27B dense til "real coding agent work" på en enkelt 24GB GPU (RTX 3090Ti). Kilden angiver, at Qwen3.6-27B …

torsdag 30. juli 2026 · research

21 briefing-resultat(er) for »3090«

llamAmpere: 90+ TPS på en RTX 3090 med specialiseret llama.cpp-fork

En custom fork af llama.cpp optimeret til Ampere-arkitekturen leverer API-hastigheder lokalt på en 3090 med op til 240K kontekst. Et kvantespring …

tirsdag 15. september 2026 · Værktøjer & produkter llama.cpp3090ampereoptimization

Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090

… Projektet bliver open source og viser, hvad lokale modeller kan præstere på en enkelt RTX 3090. Se [briefingen 31. august](/archive/2026-08-31).

mandag 14. september 2026 · Nye modeller qwen327blocal-llmgame-dev

Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?

Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …

søndag 6. september 2026 · Værktøjer & produkter llama.cpptensor-parallelismgpu

Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4

llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …

fredag 4. september 2026 · Værktøjer & produkter llama.cppqwen3expert-cachemoe

Hvorfor ser vi ikke flere INT8 W8A8-modeller til RTX 3090?

RTX 3090 har native INT8-tensorcores, men de fleste vælger FP8 eller mindre kvanter – debatten om hvorfor fortsætter.

onsdag 2. september 2026 · Forskning & arkitektur rtx-3090int8w8a8quantization

Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged

GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …

fredag 28. august 2026 · Værktøjer & produkter llama.cppqwen3.8-flash-nextgguf

Qwen3.8-27B Q4 mestrer ThreeJS – genererer kode på 3090

Bruger viser, at den kvantiserede 27B-model producerer korrekt ThreeJS-kode med "thinking high" aktiveret.

onsdag 26. august 2026 · Nye modeller qwen3.8-27bquantizedthreejscoding

Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM

… i 4-bit+ med acceptable tokens/s på en opsætning med 2x RTX 3090 og DDR5 RAM. Se [tidligere dækning](/archive/2026-08-09).

søndag 23. august 2026 · Værktøjer & produkter deepseek-v4-flashquantlocal-llmllama.cpp

Qwen3.8-27B Q6 kører 20 timers agentisk kode uden stop

På en RTX 3090 + RTX 3060 holdt modellen 60–63 tokens/s gennem et helt døgns målrettet arbejde. [Se tidligere dækning](/archive/2026-08 …

lørdag 22. august 2026 · Nye modeller qwen3.8-27bagentic-codingrtx-3090rtx-3060

Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er

En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …

lørdag 22. august 2026 · Værktøjer & produkter vllmqwen3.8-27brtx-3090inference-speed

Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer

Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).

fredag 21. august 2026 · Værktøjer & produkter qwen-3.8inference-optimizationrtx-3090tps

Qwen3.8-27B viser hidtil uset handlekraft på lokal hardware

En Reddit-bruger fik modellen til at hente skema, downloade video, transskribere og analysere frames – alt på én RTX 3090. Offentligheden aner ikke, hvor …

torsdag 20. august 2026 · Nye modeller qwen-3.8agentslocal-llmtool-use

Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2

En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …

torsdag 20. august 2026 · Nye modeller qwen-3.8dflash2inferenceoptimizationrtx-3090

Opfølgning: Reddit benchmarker quants – "vi benchmarker modeller ingen kører"

… Kl-divergens er en dårlig proxy for egentlig opgaveperformance. [Forrige briefing dækkede 82 tps på RTX 3090](/archive/2026-08-17).

tirsdag 18. august 2026 · Forskning & arkitektur benchmarkquantizationqwen-3.8local-llm

Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090

En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …

mandag 17. august 2026 · Værktøjer & produkter qwen-3.8rtx-3090vllmoptimization

Opfølgning: LFM 2.6B imponerer med 260 tok/s på RTX 3090

Brugere rapporterer lynhurtig inferens på lokalt hardware. Modellen er designet til mobil og klarer simple opgaver som resumé og søgning. Se [briefingen 5. august …

søndag 9. august 2026 · Nye modeller lfm-2.6bliquid-ailocal-llm

Opfølgning: Dual 3090-opsætning firedobler prompt-hastigheden i llama.cpp

Ved at flytte prompt processing til GPU'erne steg ydeevnen fra 400 til 1600 tokens/s på Qwen 3.6 27B. En konkret gevinst …

fredag 7. august 2026 · Værktøjer & produkter llama.cppdual-3090qwen-3.6prompt-processing

Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090

En bruger har fået DeepSeek V4 Flash (284B MoE) til at køre på en gammel quad-Xeon DDR4-server med to RTX 3090'ere …

tirsdag 4. august 2026 · Nye modeller deepseek-v4-flashinferencertx-3090cpu-gpu

Opfølgning: DeepSeek V4 Flash kører på RTX 3090 med 12,5 tok/s via CPU-spild

En bruger fik DeepSeek-V4-Flash-0731 til at køre på et enkelt 24 GB-kort ved at lægge MoE-eksperter i system-RAM …

søndag 2. august 2026 · Værktøjer & produkter deepseek-v4-flashlocal-llmrtx-3090llama.cpp

Bruger spørger: Bedste setup til lokal LLM på RTX 3090 og 48 GB RAM

Reddit-bruger søger stabilt OS og framework til coding og web-søgning på 24 GB VRAM. Ollama kørte langsomt, Unsloth var hurtigt men ustabilt.

søndag 26. juli 2026 · Værktøjer & produkter local-llmrtx-3090ollamaunsloth

6x3090 vs 8x3090: Er opgraderingen værd?

En bruger overvejer at gå fra seks til otte RTX 3090'ere via en PCIe-splitter for at køre DeepSeek Flash V4 i Q8 …

fredag 17. juli 2026 · Værktøjer & produkter 3090multi-gpulocal-llmpcie