News-Tracker

Søgning

AI & LLM · daglig briefing


6 research-rapport(er) for »qwen«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

# Qwen 3.6 27B sammenlignet med Gemma 4 og Laguna 2.1 til lokal kørsel ## Hvad kilderne siger Qwen 3.6 27B fremhæves bredt …

fredag 7. august 2026 · research

Qwen 3.8 27b

## Kort resumé Qwen3.8-27B er en kommende open-weight model fra Alibaba, der blev annonceret i juli-august 2026, men selve vægtene var …

mandag 3. august 2026 · research

Qwen 3.8 27b

## Hvad der skete Ifølge [1] (Reddit, r/LocalLLaMA) efterlyser en bruger Qwen3.8 i størrelserne 27B, 35B, 122B og 397B. Brugeren skriver, at ”the …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Her anbefales Qwen3.6-27B dense til "real coding agent work" på en enkelt 24GB GPU (RTX 3090Ti). Kilden angiver, at Qwen3.6-27B …

torsdag 30. juli 2026 · research

hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting

## Hvad der skete Flere kilder rapporterer om Alibabas lancering og opdatering af deres open‑source sprogmodel‑familie Qwen (通义千问). Den 9. maj 2024 udgav …

onsdag 29. juli 2026 · research

elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links

… 31b slår Qwen3.6-27b som kodningsagent i praksis](https://www.reddit.com/r/LocalLLaMA/comments/1uz8532/gemma431b_better_than_qwen3627b/) (brief-arkiv) 31 …

lørdag 18. juli 2026 · research

50 briefing-resultat(er) for »qwen«

K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design

… Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre effektive på begrænset hardware.

tirsdag 15. september 2026 · Nye modeller k2-horizonkv-cachelocal-llmartificial-analysis

Muse Glimmer: Overset samtale-model der føles naturlig

Brugere på r/LocalLLaMA roser Muse Glimmer for at føre dybe, menneskelige samtaler uden AI-klichéer. Modellen skiller sig ud som en af de …

tirsdag 15. september 2026 · Nye modeller muse-glimmerchatqwen

Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090

En bruger tester Qwen3.8 27b's maksimale ydeevne ved at lade modellen bygge et helt spil på fem timer. Projektet bliver open source …

mandag 14. september 2026 · Nye modeller qwen327blocal-llmgame-dev

Lorivo: Serverless LoRA-hosting på delte GPU'er

Platformen lader mange LoRA-adaptere dele én GPU-server per basismodel og giver OpenAI-kompatible endpoints. Qwen 3.5 4B er gratis.

søndag 13. september 2026 · Værktøjer & produkter loravllmserverlessfine-tuning

Agnes-3.0-Flash: Benchmark-hit med uklar historie

33B-modellen hævdes at slå Qwen3.8 27B på AA-indekset, men HF-udgaven er "Preview" og ikke samme model som evalueret.

søndag 13. september 2026 · Nye modeller agnes-3.0-flashqwen-3.8benchmarkopen-weights

Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering

En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …

søndag 13. september 2026 · Værktøjer & produkter pi-devcontext-managementqwen-3.8llama.cpp

2B LLM finjusteret på WhatsApp-chat – 80% menneskelig winrate

En udvikler trænede Qwen 2B på en seks-personers gruppechat. Modellen lærte slang og reaktioner, men mangler dyb forståelse. Cookbook med reproducerbar pipeline på …

lørdag 12. september 2026 · Værktøjer & produkter fine-tuning2b-modelwhatsapplocal-llm

Kan ngram-embeddings bruges til dynamisk, kontinuerlig læring under inferens?

Reddit-bruger foreslår en "live" ngram-tabel oven på Qwen 3.8 Flash' frosne embeddings – nye "hukommelser" dannes, gamle henfalder. Spekulativ, men fascinerende idé.

lørdag 12. september 2026 · Forskning & arkitektur ngram-embeddingsrsilive-trainingqwen-3.8

Opfølgning: Er Qwen-Next ringere end 3.8 27B til kodning?

Bruger på M5 Max finder, at Qwen 3.8 27B q8 klarer svære kodetasks bedre end Qwen-Next. Flere oplever samme tendens. [briefingen 29 …

lørdag 12. september 2026 · Værktøjer & produkter qwen-nextqwen-3.8codinglocal-llm

Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air

Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …

fredag 11. september 2026 · Forskning & arkitektur qwen-3.8apple-siliconinferenceoptimization

Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en

En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmexpert-cacheprefill-optimization

Qwen 3.8 vinder jobsamtale: Slår GLM Flash i kodetest

En bruger fortæller, at Qwen 3.8 kørte lokalt og klarede en kodningssamtale bedre end GLM Flash via OpenRouter. Modellen skrev tests og løste …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmcodinginterview

Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund

En bruger får Qwen 3.8 27B til at køre på en enkelt RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmrtx-3060quantization

Følelseskontrol til Qwen3-TTS via fine-tuning med emotion-tags

En udvikler har fine-tunet Qwen3-TTS med inline emotion-tags, så modellen kan styre tonefald direkte i transskriptionen. Resultatet er en TTS-model …

torsdag 10. september 2026 · Forskning & arkitektur qwen3-ttsemotion-controlfine-tuningtts

Er 5 t/s brugbart til en lokal model? Ja, siger bruger

En bruger kører Qwen 3.8 27B på en iGPU og DDR5 med 5 t/s og finder det mere brugbart end 20 t …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmperformanceliability

MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden

OpenBMBs MiniCPM5-2B slår Qwen3.5-4B på 34 benchmarks og leveres med datasæt, checkpoints og Apache 2.0-vægte. GGUF fra 1,56 …

tirsdag 8. september 2026 · Nye modeller minicpm5openbmbon-deviceapache-2.0

Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode

Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …

tirsdag 8. september 2026 · Værktøjer & produkter strix-halollama.cppqwen3.8-flash-nextinference

Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next

Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3qwen3.8-flash-nextcpu-offloadinference

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen

En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …

tirsdag 8. september 2026 · Forskning & arkitektur task-aware-quantizationqwen-3.8quantizationreasoning

ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp

Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3llama.cppqwen-3.8inference

Udvikler: Modellerne er fine, værktøjerne er problemet

… Han mener, at modeller som Qwen3.8-27B er gode nok, men værktøjerne halter.

tirsdag 8. september 2026 · Værktøjer & produkter coding-agentstoolingdeveloper-experienceqwen-3.8

Sådan får du lokal Qwen til at teste Windows-apps

En ikke-programmør spørger, hvordan man lader en lokal Qwen bygge og teste Windows-apps. Foreslåede veje inkluderer Windows-VM med opencode eller WSL.

tirsdag 8. september 2026 · Værktøjer & produkter opencodeqwen-3.8windowslocal-llm

Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4

En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.8unslothquantizationbenchmark

Opfølgning: DeepSeek V4 Flash vs. Qwen3.8 Flash Next – praktisk sammenligning

Brugerrapport viser, at DeepSeek V4 Flash er 40% langsommere men fuldfører opgaver dobbelt så hurtigt som Qwen3.8 Flash Next. [briefingen 31. august](/archive …

mandag 7. september 2026 · Nye modeller deepseek-v4-flashqwen3.8-flash-nextcomparisonlocal-llm

Opfølgning: Tips til draft acceptance med MTP i llama.cpp

Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).

mandag 7. september 2026 · Værktøjer & produkter llama.cppmtpdraft-modelqwen-3.6

Benchmarks fra 4x Radeon AI Pro R9700-builds efterspurgt

En bruger overvejer en 4x R9700-server til DeepSeek V4 Flash og Qwen 3.8 Flash og spørger om erfaringer.

mandag 7. september 2026 · Værktøjer & produkter radeon-ai-pro-r9700amdbenchmarkdeepseek-v4

Opfølgning: vllm med P2P-driver vs. llama.cpp til Qwen 3.8 27B

Bruger med fire RTX 4090'er overvejer om P2P-patch gør vllm bedre end llama.cpp til MoE-modeller. [briefingen 30. august](/archive/2026 …

mandag 7. september 2026 · Værktøjer & produkter vllmllama.cppp2pqwen-3.8

2x R9700 og 64 GB DDR5 – en "beast" til lokal inferens

Bruger rapporterer gode resultater med Qwen 3.8 27B og Flash Next på et ASUS ProArt-kort med to Radeon AI Pro R9700.

mandag 7. september 2026 · Værktøjer & produkter r9700qwen-3.8vllmradiance

Råd til billig GPU til lokal LLM – 2080 Ti 22 GB eller MI50 32 GB?

Bruger med 700 USD budget overvejer modificerede GPU'er fra Kina til at køre Qwen 3.8 27B Q4_K_M.

mandag 7. september 2026 · Værktøjer & produkter budget-gpu2080-timi50local-llm

Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090

Ny fork leverer 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab …

søndag 6. september 2026 · Forskning & arkitektur tinkerkv-cacheyarnqwen-3.8

Opfølgning: Qwen3.8 Flash Next-skabeloner testet på SWE-bench

Stock når 99 % på xhigh, Sharp er stabil på 94 % på begge efforts, Fixed følger tæt. Skabelonen ændrer både hastighed og tokenforbrug markant. [Briefingen …

søndag 6. september 2026 · Forskning & arkitektur qwen3.8-flash-nextswe-benchtemplates

Qwen 3.8 27B "afhackede" en brugeres PC

En r/LocalLLaMA-bruger fik en RAT installeret via et ondsindet site og brugte Qwen 3.8 27B til at rense maskinen. Lokale modeller …

søndag 6. september 2026 · Værktøjer & produkter qwen3.8-27bmalware-removallocal-llm

Lokal demoscene-generator ser sit eget output

auto_demo_scener lader nu Qwen se videooptagelser af sine Three.js-effekter via NInfer og omskrive fejlbehæftede demoer automatisk. Også brugbar som modelbenchmark.

søndag 6. september 2026 · Værktøjer & produkter demoscenetinkerthreejs

Qwen 3.8 Flash Next Max: stærk til samtale

Brugere oplever, at modellen kender overraskende detaljer om lokale forhold og kaster sig helhjertet over problemer – uden de sædvanlige hallucinationer.

søndag 6. september 2026 · Nye modeller qwen3.8-flash-nextchatopen-weights

Modeltsunami: Ti nye modeller fra Google, OpenAI, Alibaba og Anthropic

… Gemini 3.8 Flash, Qwen3.8-serien, GPT-6 Astra og Claude 5.1. Markedet har fået flere generationsskift på få uger.

lørdag 5. september 2026 · Nye modeller model-roundupgpt-6-astraclaude-5.1qwen-3.8

Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM

Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bggufquantizationbenchmark

Opfølgning: Ollama ROCm matcher næsten llama.cpp Vulkan på RX 7900 XTX

Qwen3.8 27B Q4_K_M gav 34,4 tok/s i Ollama mod 35,8 i llama.cpp; Ollama var bedst til prompt …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bollamarocmvulkan

Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?

Bruger spørger, om konteksten skal ligge på det andet 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent …

lørdag 5. september 2026 · Værktøjer & produkter ggufkv-cachevramqwen3.8-27b

Sjov model med 20 "sanser" – men den virker

En hobbyist har givet Qwen3-8B tyve sensoriske modaliteter i én model kaldet "supermultimodal". Eksperimentet illustrerer, hvor hurtigt open-source-fællesskabet kan lege med …

fredag 4. september 2026 · Forskning & arkitektur multimodalqwen3senseshugging-face

Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4

llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …

fredag 4. september 2026 · Værktøjer & produkter llama.cppqwen3expert-cachemoe

MLX på Mac M5: Er det overflødigt?

Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.

torsdag 3. september 2026 · Værktøjer & produkter mlxllama.cppapple-siliconqwen-3.8

Perplexity open-sourcer Mac-inferens til Qwen 3.6

Perplexity udgiver "lily" – en inferensserver optimeret til Apple Silicon.

torsdag 3. september 2026 · Værktøjer & produkter perplexityinference-servermacqwen-3.6

Qwen3.8 Flash Next ser "korruption" overalt

Brugere rapporterer at modellen fejlagtigt ser ødelagt tekst i konteksten og scanner git.

torsdag 3. september 2026 · Forskning & arkitektur qwen-3.8hallucinationcorruption

Opfølgning: AP-kvanter til Qwen3.8 Flash slår konkurrenter

Opfølgning på [briefingen 2. september](/archive/2026-09-02). Nyt KLD-datasæt forbedrer kvantisering. AgentionAI frigiver AP-GGUF på HuggingFace.

torsdag 3. september 2026 · Forskning & arkitektur qwen-3.8ap-quantskaitchup

Opfølgning: Kør 104GB Qwen3.8-model på 48GB Mac med ~12 tok/s

Slotstream muliggør kørsel af den 125B store Qwen3.8-Flash-Next på Mac med SSD-streaming af eksperter og MLX-native Swift-kode. [Se …

onsdag 2. september 2026 · Værktøjer & produkter qwen3.8-flash-nextslotstreammlxexpert-offloading

Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache

Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).

onsdag 2. september 2026 · Forskning & arkitektur qwen-3.8r9700mxfp4inference-speed

Opfølgning: Kaitchup benchmarker Qwen3.8 27B-kvanter fra Q4 til Q1

Resultater viser, at UD Q3_K_XL med 12,8GB giver 100% nøjagtighed og er ideel til 16GB-kort. [Se tidligere briefingen](/archive/2026 …

onsdag 2. september 2026 · Forskning & arkitektur qwen3.8-27bkaitchupquantizationbenchmark

Opfølgning: Qwen 3.8 er en god koder, men en dårlig samarbejdspartner

Brugere oplever, at 3.8 overkomplicerer ændringer og ignorerer eksisterende kodestil, hvor 3.6 var mere præcis til små rettelser. [Se tidligere briefingen](/archive …

onsdag 2. september 2026 · Værktøjer & produkter qwen-3.8qwen-3.6code-generationcollaboration

Vision-støtte gør Qwen 3.8 27B til en bedre kodeassistent

Brugere på LocalLLaMA rapporterer, at vision-versionen af Qwen 3.8 27B automatisk tager screenshots for at verificere kode, hvilket reducerer stille fejl. Kører …

tirsdag 1. september 2026 · Værktøjer & produkter qwen-3.8visioncodingvlm