Søgning
6 research-rapport(er) for »qwen-3.8«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… The Measured Numbers](https://kie.ai/blog/qwen-3-6-27b-deep-dive-benchmarks-quantization) 8. [Qwen3.6-27B: 27B Model Beats 397B on …
Qwen 3.8 27b
… Modellen er en del af Qwen3.8-familien, som også inkluderer den massive Qwen3.8-Max på 2,4 billioner parametre [3]. Qwen3.8 …
Qwen 3.8 27b
## Hvad der skete Ifølge [1] (Reddit, r/LocalLLaMA) efterlyser en bruger Qwen3.8 i størrelserne 27B, 35B, 122B og 397B. Brugeren skriver, at ”the …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… 2025/04/28/alibaba-unveils-qwen-3-a-family-of-hybrid-ai-reasoning-models/) 8. [Alibaba's Qwen team releases AI models that can …
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… 1350) 8. [机锋网移动版 GFan Mobile软件下载_手机阅读类_手机软件_新浪网](https://data.tech.sina.com.cn/3gsoft/download.php?id=3332) 9. [Alibaba upgrades Qwen app …
elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links
… Ford Mustang Mach-E [3], Kia EV6 GT [8]) er kampagnebaserede. De kan være tidsbegrænsede og ikke nødvendigvis gældende ved almindeligt køb. - **Manglende HK …
50 briefing-resultat(er) for »qwen-3.8«
Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090
En bruger tester Qwen3.8 27b's maksimale ydeevne ved at lade modellen bygge et helt spil på fem timer. Projektet bliver open source …
Agnes-3.0-Flash: Benchmark-hit med uklar historie
33B-modellen hævdes at slå Qwen3.8 27B på AA-indekset, men HF-udgaven er "Preview" og ikke samme model som evalueret.
Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering
En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …
Kan ngram-embeddings bruges til dynamisk, kontinuerlig læring under inferens?
Reddit-bruger foreslår en "live" ngram-tabel oven på Qwen 3.8 Flash' frosne embeddings – nye "hukommelser" dannes, gamle henfalder. Spekulativ, men fascinerende idé.
Opfølgning: Er Qwen-Next ringere end 3.8 27B til kodning?
Bruger på M5 Max finder, at Qwen 3.8 27B q8 klarer svære kodetasks bedre end Qwen-Next. Flere oplever samme tendens. [briefingen 29 …
Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air
Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Qwen 3.8 vinder jobsamtale: Slår GLM Flash i kodetest
En bruger fortæller, at Qwen 3.8 kørte lokalt og klarede en kodningssamtale bedre end GLM Flash via OpenRouter. Modellen skrev tests og løste …
Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund
En bruger får Qwen 3.8 27B til at køre på en enkelt RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s …
Er 5 t/s brugbart til en lokal model? Ja, siger bruger
En bruger kører Qwen 3.8 27B på en iGPU og DDR5 med 5 t/s og finder det mere brugbart end 20 t …
Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next
Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen
En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …
ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp
Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.
Udvikler: Modellerne er fine, værktøjerne er problemet
… Han mener, at modeller som Qwen3.8-27B er gode nok, men værktøjerne halter.
Sådan får du lokal Qwen til at teste Windows-apps
En ikke-programmør spørger, hvordan man lader en lokal Qwen bygge og teste Windows-apps. Foreslåede veje inkluderer Windows-VM med opencode eller WSL.
Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4
En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.
Opfølgning: DeepSeek V4 Flash vs. Qwen3.8 Flash Next – praktisk sammenligning
Brugerrapport viser, at DeepSeek V4 Flash er 40% langsommere men fuldfører opgaver dobbelt så hurtigt som Qwen3.8 Flash Next. [briefingen 31. august](/archive …
Benchmarks fra 4x Radeon AI Pro R9700-builds efterspurgt
En bruger overvejer en 4x R9700-server til DeepSeek V4 Flash og Qwen 3.8 Flash og spørger om erfaringer.
Opfølgning: vllm med P2P-driver vs. llama.cpp til Qwen 3.8 27B
Bruger med fire RTX 4090'er overvejer om P2P-patch gør vllm bedre end llama.cpp til MoE-modeller. [briefingen 30. august](/archive/2026 …
2x R9700 og 64 GB DDR5 – en "beast" til lokal inferens
Bruger rapporterer gode resultater med Qwen 3.8 27B og Flash Next på et ASUS ProArt-kort med to Radeon AI Pro R9700.
Råd til billig GPU til lokal LLM – 2080 Ti 22 GB eller MI50 32 GB?
Bruger med 700 USD budget overvejer modificerede GPU'er fra Kina til at køre Qwen 3.8 27B Q4_K_M.
Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090
… august](/archive/2026-08-30)
Qwen 3.8 27B "afhackede" en brugeres PC
En r/LocalLLaMA-bruger fik en RAT installeret via et ondsindet site og brugte Qwen 3.8 27B til at rense maskinen. Lokale modeller …
Qwen 3.8 Flash Next Max: stærk til samtale
Brugere oplever, at modellen kender overraskende detaljer om lokale forhold og kaster sig helhjertet over problemer – uden de sædvanlige hallucinationer.
Modeltsunami: Ti nye modeller fra Google, OpenAI, Alibaba og Anthropic
… Gemini 3.8 Flash, Qwen3.8-serien, GPT-6 Astra og Claude 5.1. Markedet har fået flere generationsskift på få uger.
Opfølgning: Ollama ROCm matcher næsten llama.cpp Vulkan på RX 7900 XTX
Qwen3.8 27B Q4_K_M gav 34,4 tok/s i Ollama mod 35,8 i llama.cpp; Ollama var bedst til prompt …
Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4
llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …
MLX på Mac M5: Er det overflødigt?
Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.
Qwen3.8 Flash Next ser "korruption" overalt
Brugere rapporterer at modellen fejlagtigt ser ødelagt tekst i konteksten og scanner git.
Opfølgning: AP-kvanter til Qwen3.8 Flash slår konkurrenter
Opfølgning på [briefingen 2. september](/archive/2026-09-02). Nyt KLD-datasæt forbedrer kvantisering. AgentionAI frigiver AP-GGUF på HuggingFace.
Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache
Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).
Opfølgning: Qwen 3.8 er en god koder, men en dårlig samarbejdspartner
Brugere oplever, at 3.8 overkomplicerer ændringer og ignorerer eksisterende kodestil, hvor 3.6 var mere præcis til små rettelser. [Se tidligere briefingen](/archive …
Vision-støtte gør Qwen 3.8 27B til en bedre kodeassistent
Brugere på LocalLLaMA rapporterer, at vision-versionen af Qwen 3.8 27B automatisk tager screenshots for at verificere kode, hvilket reducerer stille fejl. Kører …
Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf
Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …
Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s
En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …
Opfølgning: Flash Next vs. 27B – hurtigere, men med ny fejltype
Flash Next er hurtigere og fejlfri på JSON og injection, men 27B vinder på symbolsk ræsonnement. Flash Next har en ny fejl: den lover …
Opfølgning: Dual-GPU tuner til llama.cpp optimerer tensor-split
… Testet med Qwen3.8-27B på ROCm og Vulkan. [briefingen 17. august](/archive/2026-08-17)
Opfølgning: Qwen 3.8 27B overgår GPT-5.6 på tysk oversættelse
Brugere rapporterer at Qwen 3.8 27B leverer idiomatisk, nuanceret tysk langt bedre end frontier-modeller. Særligt tegnsætning og ordvalg roses. [briefingen 20. august …
Open-weight VLM'er matcher Gemini på egocentrisk data – 19x billigere
Gemma 4 26B og Qwen 3.8 27B scorer tæt på Gemini 2.5 Flash i hånd-synlighedsanalyse. Forskellen er pris og muligheden for …
Qwen3.8-27B-UD-IQ3XXS: End-to-end pipeline fra prompt til video
En bruger demonstrerer en fuld workflow: byg app, prompt flow, test til billede, billede til video og sammensyning – alt styret af Qwen 3.8.
Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring
… Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive/2026-08-30)
Opfølgning: Qwen 3.8 Flash Next kører på mobil – 3,5 tok/s
En 80B-model kører på en Android-telefon til 400-500 dollars. Kraftig kvantisering på den tætte del gør det muligt på 12 GB …
Qwen 3.8 er svær at læse – ofrer forståelighed for tæthed
Brugere kritiserer Qwen 3.8 for at bruge mængdelære-symboler og kryptiske formuleringer. "Consent is negotiable; enforcement is gravity" – hvad betyder det?
Opfølgning: Qwen 3.8 Next UD IQ1_S – seks gange langsommere end Q4
En bruger spørger, om Qwen 3.8 Next UD IQ1_S overhovedet giver mening frem for Qwen 3.8 27B UD Q4: IQ1_S …
To kinesiske AI-labs lander uafhængigt på samme arkitektur
Z.ai (GLM-5.3-Flash) og Qwen (Qwen3.8-Flash-Next) har begge sendt næsten identiske modeller: 3:1 lineære hybrider, komprimerede indexere …
Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork
En bruger forked NInfer og tilføjede tensor-parallel og YaRN ×4 rope scaling, så Qwen3.8-27B NVFP4 kører 1.048.576 tokens kontekst …
Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4
En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …
Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU
En bruger fik Qwen 3.8 27B til at køre på et RTX 4070 Ti SUPER med 100K kontekst ved 50 tok/s via …
50% hastighedsboost ved at offloade "hot" experts til VRAM
… Giver 20→30 t/s på Qwen3.8 Flash Next, når modellen ikke passer i VRAM. Endnu kun testet på kodning.