Søgning
6 research-rapport(er) for »qwen-3.5«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… 27B Model Beats 397B on Coding (2026)](https://www.buildfastwithai.com/blogs/qwen3-6-27b-review-2026) 9. [Gemma 4 vs Qwen 3.5 …
Qwen 3.8 27b
… På benchmarks opnår Qwen3.6-27B 77,2% på SWE-bench Verified, hvilket slår den tidligere flagskibsmodel Qwen3.5-397B-A17B MoE's 76 …
Qwen 3.8 27b
… At brugeren ønsker Qwen3.8 i 27B, 35B, 122B og 397B. At progressionen hidtil var Qwen3.5 i 0.8B, 2B, 4B, 9B. - **Kun …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Gemma 4 var også hurtigere med 56,3 tokens/sekund mod Qwen3.6's 30,1 tokens/sekund. ⚠ [3] og [4] er begge GitHub …
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… mellemstørrelsen 32B sigter mod balance mellem ydelse og hukommelse, og de store (72B, 110B) er til virksomheds‑ og forskningsbrug [6]. Qwen 2.5 forbedrede …
elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links
… under loftet på 550.000 kr. – prisen er officiel, men tæt på grænsen. - **Volkswagen ID.7 GTX Max** (340 hk, 559.995 kr.) [12 …
47 briefing-resultat(er) for »qwen-3.5«
Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090
En bruger tester Qwen3.8 27b's maksimale ydeevne ved at lade modellen bygge et helt spil på fem timer. Projektet bliver open source …
Lorivo: Serverless LoRA-hosting på delte GPU'er
Platformen lader mange LoRA-adaptere dele én GPU-server per basismodel og giver OpenAI-kompatible endpoints. Qwen 3.5 4B er gratis.
Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering
En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Er 5 t/s brugbart til en lokal model? Ja, siger bruger
En bruger kører Qwen 3.8 27B på en iGPU og DDR5 med 5 t/s og finder det mere brugbart end 20 t …
MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden
OpenBMBs MiniCPM5-2B slår Qwen3.5-4B på 34 benchmarks og leveres med datasæt, checkpoints og Apache 2.0-vægte. GGUF fra 1,56 …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen
En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …
Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090
… 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab. [Briefingen 30. august …
Modeltsunami: Ti nye modeller fra Google, OpenAI, Alibaba og Anthropic
… Gemini 3.8 Flash, Qwen3.8-serien, GPT-6 Astra og Claude 5.1. Markedet har fået flere generationsskift på få uger.
Vision-støtte gør Qwen 3.8 27B til en bedre kodeassistent
… vision-versionen af Qwen 3.8 27B automatisk tager screenshots for at verificere kode, hvilket reducerer stille fejl. Kører lokalt på en RTX 5090.
Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf
Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …
Opfølgning: Qwen 3.8 27B overgår GPT-5.6 på tysk oversættelse
Brugere rapporterer at Qwen 3.8 27B leverer idiomatisk, nuanceret tysk langt bedre end frontier-modeller. Særligt tegnsætning og ordvalg roses. [briefingen 20. august …
Open-weight VLM'er matcher Gemini på egocentrisk data – 19x billigere
Gemma 4 26B og Qwen 3.8 27B scorer tæt på Gemini 2.5 Flash i hånd-synlighedsanalyse. Forskellen er pris og muligheden for …
Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring
… Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive/2026-08-30)
Opfølgning: Qwen 3.8 Flash Next kører på mobil – 3,5 tok/s
En 80B-model kører på en Android-telefon til 400-500 dollars. Kraftig kvantisering på den tætte del gør det muligt på 12 GB …
To kinesiske AI-labs lander uafhængigt på samme arkitektur
Z.ai (GLM-5.3-Flash) og Qwen (Qwen3.8-Flash-Next) har begge sendt næsten identiske modeller: 3:1 lineære hybrider, komprimerede indexere …
Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork
En bruger forked NInfer og tilføjede tensor-parallel og YaRN ×4 rope scaling, så Qwen3.8-27B NVFP4 kører 1.048.576 tokens kontekst …
Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU
En bruger fik Qwen 3.8 27B til at køre på et RTX 4070 Ti SUPER med 100K kontekst ved 50 tok/s via …
50% hastighedsboost ved at offloade "hot" experts til VRAM
… Giver 20→30 t/s på Qwen3.8 Flash Next, når modellen ikke passer i VRAM. Endnu kun testet på kodning.
Opfølgning: State-of-the-art GGUFs til Qwen3.8-27B – 2,5-3,0 bpw
… 2,75 bpw (9,3 GB) matcher endda BF16 i gennemsnit på flere benchmarks [se briefingen 20. august](/archive/2026-08-20).
Ensemble af Qwen3.8-27B-modeller matcher Fable-5 på kodning
Et nyt papir viser, at flere Qwen3.8-27B-modeller sammen kan matche Fable-5 på LiveCodeBench Hard – til en femtedel af prisen. Metoden …
Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged
GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …
Opfølgning: Ornith 1.5 og Tiel-Coder vinder tool-calling benchmark blandt 35B-A3B-varianter
Fine-tunes af Qwen3.6-35B-A3B slår den originale model og nærmer sig Qwen3.8-27B i tool-eval-bench. [briefingen 25. august …
FreeToken: Kør frontlinje-MoE på din gaming-PC
… s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B på en RTX 5090.
Opfølgning: Ornith 1.5 slår Qwen 3.8 og Muse Glimmer i benchmark
En community-sammenligning viser, at Ornith-1.5-35B-A3B klarer sig bedst blandt flere MoE-modeller – TielCoder kan være endnu stærkere på kodning.
Rens dine støvbunnyer – Qwen 3.5 Opus kræver vedligeholdelse
En bruger på r/LocalLLaMA deler et humoristisk indlæg om, at Qwen 3.5 Opus 4.6 distilled bad om "maintenance" – med billede af …
Qwen 3.8 27B vs. Opus 5: 39.000 linjer C til HTML-port
En udvikler testede Qwen 3.8 27B mod Opus 5 på at porte et 39.000-linjers C-spil til single-file HTML/three …
Opfølgning: Qwen 3.8 27B er "en game changer" – overgår Gemini 3.5 Flash Lite til OCR
Udviklere rapporterer, at Qwen 3.8 27B kørende lokalt leverer OCR-kvalitet bedre end Gemini 3.5 Flash Lite. Modellen matcher frontier-modeller fra …
Hvilken lille model til sessionskompression?
En bruger søger en bittesmå model (fx Qwen 3.5 0.8B) til at komprimere lang kontekst genereret af Qwen 3.8 27B i …
Llama.cpp får DSpark PC Tree – op til 29,5 % hurtigere inferens
En implementering af Parent-Conditioned Drafting Tree giver op til 72 % acceptrate på Qwen 3.0, med størst gevinst ved summarisering. Første udkast, men …
Bruger skifter fra Claude til lokal Qwen3.8 – 'jeg er fri'
En Reddit-bruger rapporterer at have erstattet Claude Pro med en lokal Qwen3.8-27B på en RTX 5090M, og oplever kun få kompromiser.
Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090
Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)
Qwen 3.8 27B matcher GPT-5.6 Luna – på en brøkdel af parametrene
Qwen 3.8 27B scorer 52 på Artificial Analysis Intelligence Index, samme score som GPT-5.6 Luna (max) og kun ét point efter …
Qwen 3.8 27B Q2 vs Q3 vs MoE på 12 GB VRAM – MoE vinder på fart
Test på en RTX 5070 Ti laptop viser, at Qwen 3.6 35B-A3B MoE (Q4) giver 59 t/s og 6/6 korrekte …
RTX 5060 Ti-repo opbygget omkring afprøvede presets
… Syv presets til 1× og 2× RTX 5060 Ti dækker Qwen3.8 27B, Nail 35B-A3B og flere.
Qwen 3.8-27B genererer kompleks akvarie-simulation via Copilot
En bruger bad modellen om at skabe en fysisk simulation af et sprængt akvarium. Copilot itererede 54 gange og producerede et fuldt funktionelt resultat.
1-bit Qwen 3.8 2.4T kører på Mac Ultra – 508 GB RAM i brug
En bruger tester Unsloths 1-bit kvantisering af Qwen 3.8 2.4T på en Mac Ultra 512 GB. Modellen bruger 508 GB RAM …
35B BigBang-v1 påstår at matche modeller op til 1,6T parametre
En ny finetune baseret på Qwen 3.5 hævder aggregatperformance mellem DeepSeek Flash og Pro, men per-benchmark-scorerne er ujævne. Benchmark-kontamination er …
Opfølgning: Qwen 3.8 Max topper agentic benchmark
Alibaba-modellen er nu nummer ét på Artificial Analysis' agentic index foran Opus 5 – et tegn på, at agentiske evner ikke længere er forbeholdt …
Opfølgning: Dual 3090-opsætning firedobler prompt-hastigheden i llama.cpp
… til 1600 tokens/s på Qwen 3.6 27B. En konkret gevinst fra den nye GPU-sampling. [Briefingen 5. august](/archive/2026-08-05).
Opfølgning: Brugere anklager Artificial Analysis for at rykke Qwen ned
Efter Qwen 3.8 Max toppede agentic-indekset, ændrede AA vægtningen i v4.1.1, så Anthropic igen fører. [Se briefingen 5. august](/archive …
Opfølgning: Er ældre modeller som GLM 5.2 og Kimi 2.7 stadig relevante?
Med ankomsten af Kimi K3, Qwen 3.8 Max og DeepSeek V4 Pro spørger community, om tidligere topmodeller stadig duer til langvarig kodning. [briefingen …
Qwen 3.8-Max lanceret – Alibaba sætter ny standard med 2,4 billioner parametre
Alibaba har udgivet Qwen 3.8-Max, en open-weight MoE-model med 2,4 billioner parametre, der matcher Kimi K3 og DeepSeek V4 …
Brugerne håber på en mindre variant af Qwen 3.8
… En Reddit-bruger ønsker sig en sub-0,5B-model som alternativ, og peger på Minimax M3 som eksempel.
Opfølgning: 192 GB RAM – hvad kører fællesskabet på store modeller?
Brugeren fortæller om erfaringer med Qwen3.5-397B på M2 Ultra og arbejdet med at fikse KV-cache i llama.cpp. Se [briefingen 17 …
Bonsai 27B kører lokalt på iPhone i kun 3,9GB
PrismML har bygget Bonsai ved at kvantisere Qwen3.6-27B ned til 1-bit, hvilket reducerer størrelsen fra ~54GB til 3,9GB. Modellen bevarer …