News-Tracker

Søgning

AI & LLM · daglig briefing


5 research-rapport(er) for »qwen3«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Switched from Qwen3.6 35b-a3b to Qwen3.6 27b mid coding and it's noticeably better!](https://www.reddit.com/r/LocalLLaMA/comments …

fredag 7. august 2026 · research

Qwen 3.8 27b

## Kort resumé Qwen3.8-27B er en kommende open-weight model fra Alibaba, der blev annonceret i juli-august 2026, men selve vægtene var …

mandag 3. august 2026 · research

Qwen 3.8 27b

## Hvad der skete Ifølge [1] (Reddit, r/LocalLLaMA) efterlyser en bruger Qwen3.8 i størrelserne 27B, 35B, 122B og 397B. Brugeren skriver, at ”the …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Her anbefales Qwen3.6-27B dense til "real coding agent work" på en enkelt 24GB GPU (RTX 3090Ti). Kilden angiver, at Qwen3.6-27B …

torsdag 30. juli 2026 · research

elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links

… 31b slår Qwen3.6-27b som kodningsagent i praksis](https://www.reddit.com/r/LocalLLaMA/comments/1uz8532/gemma431b_better_than_qwen3627b/) (brief-arkiv) 31 …

lørdag 18. juli 2026 · research

50 briefing-resultat(er) for »qwen3«

K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design

… Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre effektive på begrænset hardware.

tirsdag 15. september 2026 · Nye modeller k2-horizonkv-cachelocal-llmartificial-analysis

Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090

En bruger tester Qwen3.8 27b's maksimale ydeevne ved at lade modellen bygge et helt spil på fem timer. Projektet bliver open source …

mandag 14. september 2026 · Nye modeller qwen327blocal-llmgame-dev

Agnes-3.0-Flash: Benchmark-hit med uklar historie

33B-modellen hævdes at slå Qwen3.8 27B på AA-indekset, men HF-udgaven er "Preview" og ikke samme model som evalueret.

søndag 13. september 2026 · Nye modeller agnes-3.0-flashqwen-3.8benchmarkopen-weights

Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering

En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …

søndag 13. september 2026 · Værktøjer & produkter pi-devcontext-managementqwen-3.8llama.cpp

Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air

Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …

fredag 11. september 2026 · Forskning & arkitektur qwen-3.8apple-siliconinferenceoptimization

Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en

En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmexpert-cacheprefill-optimization

Følelseskontrol til Qwen3-TTS via fine-tuning med emotion-tags

En udvikler har fine-tunet Qwen3-TTS med inline emotion-tags, så modellen kan styre tonefald direkte i transskriptionen. Resultatet er en TTS-model …

torsdag 10. september 2026 · Forskning & arkitektur qwen3-ttsemotion-controlfine-tuningtts

MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden

OpenBMBs MiniCPM5-2B slår Qwen3.5-4B på 34 benchmarks og leveres med datasæt, checkpoints og Apache 2.0-vægte. GGUF fra 1,56 …

tirsdag 8. september 2026 · Nye modeller minicpm5openbmbon-deviceapache-2.0

Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode

Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …

tirsdag 8. september 2026 · Værktøjer & produkter strix-halollama.cppqwen3.8-flash-nextinference

Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next

Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3qwen3.8-flash-nextcpu-offloadinference

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen

En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …

tirsdag 8. september 2026 · Forskning & arkitektur task-aware-quantizationqwen-3.8quantizationreasoning

Udvikler: Modellerne er fine, værktøjerne er problemet

… Han mener, at modeller som Qwen3.8-27B er gode nok, men værktøjerne halter.

tirsdag 8. september 2026 · Værktøjer & produkter coding-agentstoolingdeveloper-experienceqwen-3.8

Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4

En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.8unslothquantizationbenchmark

Opfølgning: DeepSeek V4 Flash vs. Qwen3.8 Flash Next – praktisk sammenligning

Brugerrapport viser, at DeepSeek V4 Flash er 40% langsommere men fuldfører opgaver dobbelt så hurtigt som Qwen3.8 Flash Next. [briefingen 31. august](/archive …

mandag 7. september 2026 · Nye modeller deepseek-v4-flashqwen3.8-flash-nextcomparisonlocal-llm

Opfølgning: Tips til draft acceptance med MTP i llama.cpp

Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).

mandag 7. september 2026 · Værktøjer & produkter llama.cppmtpdraft-modelqwen-3.6

Opfølgning: Qwen3.8 Flash Next-skabeloner testet på SWE-bench

Stock når 99 % på xhigh, Sharp er stabil på 94 % på begge efforts, Fixed følger tæt. Skabelonen ændrer både hastighed og tokenforbrug markant. [Briefingen …

søndag 6. september 2026 · Forskning & arkitektur qwen3.8-flash-nextswe-benchtemplates

Qwen 3.8 27B "afhackede" en brugeres PC

En r/LocalLLaMA-bruger fik en RAT installeret via et ondsindet site og brugte Qwen 3.8 27B til at rense maskinen. Lokale modeller …

søndag 6. september 2026 · Værktøjer & produkter qwen3.8-27bmalware-removallocal-llm

Qwen 3.8 Flash Next Max: stærk til samtale

Brugere oplever, at modellen kender overraskende detaljer om lokale forhold og kaster sig helhjertet over problemer – uden de sædvanlige hallucinationer.

søndag 6. september 2026 · Nye modeller qwen3.8-flash-nextchatopen-weights

Modeltsunami: Ti nye modeller fra Google, OpenAI, Alibaba og Anthropic

… Gemini 3.8 Flash, Qwen3.8-serien, GPT-6 Astra og Claude 5.1. Markedet har fået flere generationsskift på få uger.

lørdag 5. september 2026 · Nye modeller model-roundupgpt-6-astraclaude-5.1qwen-3.8

Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM

Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bggufquantizationbenchmark

Opfølgning: Ollama ROCm matcher næsten llama.cpp Vulkan på RX 7900 XTX

Qwen3.8 27B Q4_K_M gav 34,4 tok/s i Ollama mod 35,8 i llama.cpp; Ollama var bedst til prompt …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bollamarocmvulkan

Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?

Bruger spørger, om konteksten skal ligge på det andet 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent …

lørdag 5. september 2026 · Værktøjer & produkter ggufkv-cachevramqwen3.8-27b

Sjov model med 20 "sanser" – men den virker

En hobbyist har givet Qwen3-8B tyve sensoriske modaliteter i én model kaldet "supermultimodal". Eksperimentet illustrerer, hvor hurtigt open-source-fællesskabet kan lege med …

fredag 4. september 2026 · Forskning & arkitektur multimodalqwen3senseshugging-face

Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4

llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …

fredag 4. september 2026 · Værktøjer & produkter llama.cppqwen3expert-cachemoe

Qwen3.8 Flash Next ser "korruption" overalt

Brugere rapporterer at modellen fejlagtigt ser ødelagt tekst i konteksten og scanner git.

torsdag 3. september 2026 · Forskning & arkitektur qwen-3.8hallucinationcorruption

Opfølgning: AP-kvanter til Qwen3.8 Flash slår konkurrenter

Opfølgning på [briefingen 2. september](/archive/2026-09-02). Nyt KLD-datasæt forbedrer kvantisering. AgentionAI frigiver AP-GGUF på HuggingFace.

torsdag 3. september 2026 · Forskning & arkitektur qwen-3.8ap-quantskaitchup

Opfølgning: Kør 104GB Qwen3.8-model på 48GB Mac med ~12 tok/s

Slotstream muliggør kørsel af den 125B store Qwen3.8-Flash-Next på Mac med SSD-streaming af eksperter og MLX-native Swift-kode. [Se …

onsdag 2. september 2026 · Værktøjer & produkter qwen3.8-flash-nextslotstreammlxexpert-offloading

Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache

Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).

onsdag 2. september 2026 · Forskning & arkitektur qwen-3.8r9700mxfp4inference-speed

Opfølgning: Kaitchup benchmarker Qwen3.8 27B-kvanter fra Q4 til Q1

Resultater viser, at UD Q3_K_XL med 12,8GB giver 100% nøjagtighed og er ideel til 16GB-kort. [Se tidligere briefingen](/archive/2026 …

onsdag 2. september 2026 · Forskning & arkitektur qwen3.8-27bkaitchupquantizationbenchmark

Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s

En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …

tirsdag 1. september 2026 · Nye modeller qwen-3.8performancellama.cppvram

Opfølgning: Flash Next vs. 27B – hurtigere, men med ny fejltype

Flash Next er hurtigere og fejlfri på JSON og injection, men 27B vinder på symbolsk ræsonnement. Flash Next har en ny fejl: den lover …

mandag 31. august 2026 · Nye modeller qwen3.8-flash-nextmxfp4local-llmbenchmark

Opfølgning: Dual-GPU tuner til llama.cpp optimerer tensor-split

… Testet med Qwen3.8-27B på ROCm og Vulkan. [briefingen 17. august](/archive/2026-08-17)

mandag 31. august 2026 · Værktøjer & produkter llama.cppdual-gputensor-splitqwen-3.8

Opfølgning: Qwen 3.8 27B overgår GPT-5.6 på tysk oversættelse

Brugere rapporterer at Qwen 3.8 27B leverer idiomatisk, nuanceret tysk langt bedre end frontier-modeller. Særligt tegnsætning og ordvalg roses. [briefingen 20. august …

mandag 31. august 2026 · Nye modeller qwen3.8-27bgemmatranslationmultilingual

Qwen3.8-27B-UD-IQ3XXS: End-to-end pipeline fra prompt til video

En bruger demonstrerer en fuld workflow: byg app, prompt flow, test til billede, billede til video og sammensyning – alt styret af Qwen 3.8.

mandag 31. august 2026 · Værktøjer & produkter qwen3.8-27biq3xxsimage-to-videopipeline

Opfølgning: Qwen 3.8 Flash Next kører på mobil – 3,5 tok/s

En 80B-model kører på en Android-telefon til 400-500 dollars. Kraftig kvantisering på den tætte del gør det muligt på 12 GB …

mandag 31. august 2026 · Værktøjer & produkter qwen3.8-flash-nextmobileandroidlocal-llm

To kinesiske AI-labs lander uafhængigt på samme arkitektur

Z.ai (GLM-5.3-Flash) og Qwen (Qwen3.8-Flash-Next) har begge sendt næsten identiske modeller: 3:1 lineære hybrider, komprimerede indexere …

søndag 30. august 2026 · Forskning & arkitektur glm-5.3qwen-3.8architecturemoe

Tenstorrent QuietBox 2 benchmarket med Qwen 3.7 27B

En medarbejder har benchmarked Qwen 3.7 27B på Tenstorrents QuietBox 2 med to p300c-kort. Tallene er endnu ikke offentlige i detaljer, men …

søndag 30. august 2026 · Værktøjer & produkter tenstorrentqwen3.7benchmarkhardware

Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork

En bruger forked NInfer og tilføjede tensor-parallel og YaRN ×4 rope scaling, så Qwen3.8-27B NVFP4 kører 1.048.576 tokens kontekst …

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8tinker1m-contextrtx-5090

Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4

En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …

søndag 30. august 2026 · Nye modeller qwen-3.8ggufquantizationlocal-llm

50% hastighedsboost ved at offloade "hot" experts til VRAM

… Giver 20→30 t/s på Qwen3.8 Flash Next, når modellen ikke passer i VRAM. Endnu kun testet på kodning.

lørdag 29. august 2026 · Forskning & arkitektur moevram-offloadinghot-expertsllama.cpp

N-gram-tabel på SSD streamet i SGLang – uden performance-tab?

En bruger spørger, om nogen har testet at offloade Qwen 3.8 Flash Nexts n-gram-opslagstabel til SSD og streame den i SGLang …

lørdag 29. august 2026 · Forskning & arkitektur qwen3.8-flash-nextn-gramssd-offloadingsolana

AtomicChats GGUF-kvant af Qwen3.8 Flash Next imponerer

En bruger på M4 Max 128GB rapporterer, at AtomicChats kvant af Flash Next bruger pageable PLE-tabel via mmap, hvilket reducerer RAM-forbrug fra …

lørdag 29. august 2026 · Værktøjer & produkter ggufqwen3.8-flash-nextatomicchatquant

Opfølgning: Er Qwen3.8 Flash Next værd at køre på 4x3090?

Bruger frustreret over 27B-modellens ubeslutsomhed overvejer Flash Next på 4x3090 med n-gram på SSD. Spørger om arkitekturen er klar nok til local …

lørdag 29. august 2026 · Værktøjer & produkter qwen3.8-flash-next4x3090deploymentadvice

Opfølgning: 181 tok/s på Qwen3.8 Flash Next på 2× DGX Spark

En bruger opnår 181 tokens/s aggregeret på tværs af 9 samtidige agentsessioner på to forbundne DGX Spark. Hemmeligheden: PLE-tabel mmap’et fra …

lørdag 29. august 2026 · Værktøjer & produkter dgx-sparkqwen3.8-flash-nextmulti-nodethroughput

Opfølgning: State-of-the-art GGUFs til Qwen3.8-27B – 2,5-3,0 bpw

Nye GSQ-RCO-kvanter slår alle eksisterende kvanters nøjagtighed ved samme filstørrelse. 2,75 bpw (9,3 GB) matcher endda BF16 i gennemsnit på …

lørdag 29. august 2026 · Værktøjer & produkter ggufqwen3.8-27bgsq-rcoquantization

Ensemble af Qwen3.8-27B-modeller matcher Fable-5 på kodning

Et nyt papir viser, at flere Qwen3.8-27B-modeller sammen kan matche Fable-5 på LiveCodeBench Hard – til en femtedel af prisen. Metoden …

fredag 28. august 2026 · Forskning & arkitektur qwen-3.8ensemblefable-5livecodebench

Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged

GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …

fredag 28. august 2026 · Værktøjer & produkter llama.cppqwen3.8-flash-nextgguf

Opfølgning: Alibaba udgiver Qwen3.8-Flash-Next som forhåndsvisning af Qwen4-arkitekturen

… Modellen bygger videre på Qwen3.8-familien, som blev dækket i [briefingen 14. august](/archive/2026-08-14).

torsdag 27. august 2026 · Nye modeller qwen3.8-flash-nextqwen4moeopen-weights

Opfølgning: Bruger flytter kodningsarbejde fra Claude til lokal Qwen via MCP

En bruger deler et MCP-setup, der lader Claude Code sende specificerede opgaver til en lokal Qwen3.8-27B-model for at spare tokens …

torsdag 27. august 2026 · Værktøjer & produkter claude-codelocal-llmmcpqwen