Søgning
6 research-rapport(er) for »qwen«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
# Qwen 3.6 27B sammenlignet med Gemma 4 og Laguna 2.1 til lokal kørsel ## Hvad kilderne siger Qwen 3.6 27B fremhæves bredt …
Qwen 3.8 27b
## Kort resumé Qwen3.8-27B er en kommende open-weight model fra Alibaba, der blev annonceret i juli-august 2026, men selve vægtene var …
Qwen 3.8 27b
## Hvad der skete Ifølge [1] (Reddit, r/LocalLLaMA) efterlyser en bruger Qwen3.8 i størrelserne 27B, 35B, 122B og 397B. Brugeren skriver, at ”the …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Her anbefales Qwen3.6-27B dense til "real coding agent work" på en enkelt 24GB GPU (RTX 3090Ti). Kilden angiver, at Qwen3.6-27B …
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
## Hvad der skete Flere kilder rapporterer om Alibabas lancering og opdatering af deres open‑source sprogmodel‑familie Qwen (通义千问). Den 9. maj 2024 udgav …
elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links
… 31b slår Qwen3.6-27b som kodningsagent i praksis](https://www.reddit.com/r/LocalLLaMA/comments/1uz8532/gemma431b_better_than_qwen3627b/) (brief-arkiv) 31 …
50 briefing-resultat(er) for »qwen«
K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design
… Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre effektive på begrænset hardware.
Muse Glimmer: Overset samtale-model der føles naturlig
Brugere på r/LocalLLaMA roser Muse Glimmer for at føre dybe, menneskelige samtaler uden AI-klichéer. Modellen skiller sig ud som en af de …
Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090
En bruger tester Qwen3.8 27b's maksimale ydeevne ved at lade modellen bygge et helt spil på fem timer. Projektet bliver open source …
Lorivo: Serverless LoRA-hosting på delte GPU'er
Platformen lader mange LoRA-adaptere dele én GPU-server per basismodel og giver OpenAI-kompatible endpoints. Qwen 3.5 4B er gratis.
Agnes-3.0-Flash: Benchmark-hit med uklar historie
33B-modellen hævdes at slå Qwen3.8 27B på AA-indekset, men HF-udgaven er "Preview" og ikke samme model som evalueret.
Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering
En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …
2B LLM finjusteret på WhatsApp-chat – 80% menneskelig winrate
En udvikler trænede Qwen 2B på en seks-personers gruppechat. Modellen lærte slang og reaktioner, men mangler dyb forståelse. Cookbook med reproducerbar pipeline på …
Kan ngram-embeddings bruges til dynamisk, kontinuerlig læring under inferens?
Reddit-bruger foreslår en "live" ngram-tabel oven på Qwen 3.8 Flash' frosne embeddings – nye "hukommelser" dannes, gamle henfalder. Spekulativ, men fascinerende idé.
Opfølgning: Er Qwen-Next ringere end 3.8 27B til kodning?
Bruger på M5 Max finder, at Qwen 3.8 27B q8 klarer svære kodetasks bedre end Qwen-Next. Flere oplever samme tendens. [briefingen 29 …
Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air
Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Qwen 3.8 vinder jobsamtale: Slår GLM Flash i kodetest
En bruger fortæller, at Qwen 3.8 kørte lokalt og klarede en kodningssamtale bedre end GLM Flash via OpenRouter. Modellen skrev tests og løste …
Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund
En bruger får Qwen 3.8 27B til at køre på en enkelt RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s …
Følelseskontrol til Qwen3-TTS via fine-tuning med emotion-tags
En udvikler har fine-tunet Qwen3-TTS med inline emotion-tags, så modellen kan styre tonefald direkte i transskriptionen. Resultatet er en TTS-model …
Er 5 t/s brugbart til en lokal model? Ja, siger bruger
En bruger kører Qwen 3.8 27B på en iGPU og DDR5 med 5 t/s og finder det mere brugbart end 20 t …
MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden
OpenBMBs MiniCPM5-2B slår Qwen3.5-4B på 34 benchmarks og leveres med datasæt, checkpoints og Apache 2.0-vægte. GGUF fra 1,56 …
Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode
Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …
Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next
Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen
En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …
ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp
Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.
Udvikler: Modellerne er fine, værktøjerne er problemet
… Han mener, at modeller som Qwen3.8-27B er gode nok, men værktøjerne halter.
Sådan får du lokal Qwen til at teste Windows-apps
En ikke-programmør spørger, hvordan man lader en lokal Qwen bygge og teste Windows-apps. Foreslåede veje inkluderer Windows-VM med opencode eller WSL.
Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4
En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.
Opfølgning: DeepSeek V4 Flash vs. Qwen3.8 Flash Next – praktisk sammenligning
Brugerrapport viser, at DeepSeek V4 Flash er 40% langsommere men fuldfører opgaver dobbelt så hurtigt som Qwen3.8 Flash Next. [briefingen 31. august](/archive …
Opfølgning: Tips til draft acceptance med MTP i llama.cpp
Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).
Benchmarks fra 4x Radeon AI Pro R9700-builds efterspurgt
En bruger overvejer en 4x R9700-server til DeepSeek V4 Flash og Qwen 3.8 Flash og spørger om erfaringer.
Opfølgning: vllm med P2P-driver vs. llama.cpp til Qwen 3.8 27B
Bruger med fire RTX 4090'er overvejer om P2P-patch gør vllm bedre end llama.cpp til MoE-modeller. [briefingen 30. august](/archive/2026 …
2x R9700 og 64 GB DDR5 – en "beast" til lokal inferens
Bruger rapporterer gode resultater med Qwen 3.8 27B og Flash Next på et ASUS ProArt-kort med to Radeon AI Pro R9700.
Råd til billig GPU til lokal LLM – 2080 Ti 22 GB eller MI50 32 GB?
Bruger med 700 USD budget overvejer modificerede GPU'er fra Kina til at køre Qwen 3.8 27B Q4_K_M.
Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090
Ny fork leverer 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab …
Opfølgning: Qwen3.8 Flash Next-skabeloner testet på SWE-bench
Stock når 99 % på xhigh, Sharp er stabil på 94 % på begge efforts, Fixed følger tæt. Skabelonen ændrer både hastighed og tokenforbrug markant. [Briefingen …
Qwen 3.8 27B "afhackede" en brugeres PC
En r/LocalLLaMA-bruger fik en RAT installeret via et ondsindet site og brugte Qwen 3.8 27B til at rense maskinen. Lokale modeller …
Lokal demoscene-generator ser sit eget output
auto_demo_scener lader nu Qwen se videooptagelser af sine Three.js-effekter via NInfer og omskrive fejlbehæftede demoer automatisk. Også brugbar som modelbenchmark.
Qwen 3.8 Flash Next Max: stærk til samtale
Brugere oplever, at modellen kender overraskende detaljer om lokale forhold og kaster sig helhjertet over problemer – uden de sædvanlige hallucinationer.
Modeltsunami: Ti nye modeller fra Google, OpenAI, Alibaba og Anthropic
… Gemini 3.8 Flash, Qwen3.8-serien, GPT-6 Astra og Claude 5.1. Markedet har fået flere generationsskift på få uger.
Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM
Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …
Opfølgning: Ollama ROCm matcher næsten llama.cpp Vulkan på RX 7900 XTX
Qwen3.8 27B Q4_K_M gav 34,4 tok/s i Ollama mod 35,8 i llama.cpp; Ollama var bedst til prompt …
Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?
Bruger spørger, om konteksten skal ligge på det andet 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent …
Sjov model med 20 "sanser" – men den virker
En hobbyist har givet Qwen3-8B tyve sensoriske modaliteter i én model kaldet "supermultimodal". Eksperimentet illustrerer, hvor hurtigt open-source-fællesskabet kan lege med …
Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4
llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …
MLX på Mac M5: Er det overflødigt?
Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.
Perplexity open-sourcer Mac-inferens til Qwen 3.6
Perplexity udgiver "lily" – en inferensserver optimeret til Apple Silicon.
Qwen3.8 Flash Next ser "korruption" overalt
Brugere rapporterer at modellen fejlagtigt ser ødelagt tekst i konteksten og scanner git.
Opfølgning: AP-kvanter til Qwen3.8 Flash slår konkurrenter
Opfølgning på [briefingen 2. september](/archive/2026-09-02). Nyt KLD-datasæt forbedrer kvantisering. AgentionAI frigiver AP-GGUF på HuggingFace.
Opfølgning: Kør 104GB Qwen3.8-model på 48GB Mac med ~12 tok/s
Slotstream muliggør kørsel af den 125B store Qwen3.8-Flash-Next på Mac med SSD-streaming af eksperter og MLX-native Swift-kode. [Se …
Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache
Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).
Opfølgning: Kaitchup benchmarker Qwen3.8 27B-kvanter fra Q4 til Q1
Resultater viser, at UD Q3_K_XL med 12,8GB giver 100% nøjagtighed og er ideel til 16GB-kort. [Se tidligere briefingen](/archive/2026 …
Opfølgning: Qwen 3.8 er en god koder, men en dårlig samarbejdspartner
Brugere oplever, at 3.8 overkomplicerer ændringer og ignorerer eksisterende kodestil, hvor 3.6 var mere præcis til små rettelser. [Se tidligere briefingen](/archive …
Vision-støtte gør Qwen 3.8 27B til en bedre kodeassistent
Brugere på LocalLLaMA rapporterer, at vision-versionen af Qwen 3.8 27B automatisk tager screenshots for at verificere kode, hvilket reducerer stille fejl. Kører …