News-Tracker

Digg

AI & LLM · daglig briefing


hent mp3

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

fredag 7. august 2026 · 20 søgninger · 20 sidehentninger · 3 LLM-kald · 0 refleksionsrunde(r) · 1 omplanlægning(er) · 15445 tokens · $0.0085 · 101s

Qwen 3.6 27B sammenlignet med Gemma 4 og Laguna 2.1 til lokal kørsel

Hvad kilderne siger

Qwen 3.6 27B fremhæves bredt som en stærk kandidat til lokal kørsel på grund af sin tætte (dense) arkitektur og favorable størrelse-til-ydeevne-forhold. Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan køre på et enkelt 16-24GB GPU. Den tætte arkitektur betyder, at alle 27 milliarder parametre er aktive per token, i modsætning til MoE-modeller der kun aktiverer en delmængde — dette giver ifølge [8] forudsigelig latens og ingen expert-routing overhead, hvilket spiller godt med spekulativ dekodning.

Kilderne peger på flere tekniske faktorer, der gør Qwen 3.6 27B velegnet til lokale miljøer. [7] rapporterer, at NVFP4-kvantisering leverer cirka 2,6–2,86× dekodningshastighedsforbedring over BF16, med en MMLU-score på 0,8446. På DGX Spark måler fællesskabet 28–33 tokens per sekund med NVFP4 via vLLM 0.24.0, mens Apple Silicon med MTPLX v2 når 82,8 t/s på M3 Ultra. [8] fremhæver desuden den 262.144-token kontekstudvidelse, der kan udvides til omkring en million tokens via YaRN, samt den nye "Thinking Preservation"-mekanisme.

Sammenlignet med konkurrenterne har Qwen 3.6 27B en fordel i VRAM-behov. [12] angiver, at Q4_K_M-kvantisering lander på cirka 16,8 GB — nok til et RTX 4080 16GB. [10] bekræfter dette ved at måle, at Qwen 3.6 27B kræver "only slightly less memory" end Gemma 4 12B trods den store parameterforskel, med begge modeller testet på en NVIDIA H100 med 80GB VRAM. [11] præciserer, at FP8-kørsel kræver omkring 36-40 GB VRAM.

Gemma 4-modellerne fra Google DeepMind, udgivet april 2026, præsenteres i [3] og [4] som multimodal med tekst-, billede- og lydstøtte (på de mindre varianter), med en kontekstudvidelse på op til 256K tokens og support til over 140 sprog. [14] beskriver Gemma 4-familien som fokuseret på "intelligence per parameter," hvor 26B MoE-varianten aktiverer kun omkring 3,8 milliarder parametre under inferens. [1] viser dog, at Gemma 4 12B QAT Q4_0 scorede 86,7% på LiveCodeBench mod Qwen3.6-27B-MTP Q4_K_M's 53,3% — en markant forskel på 25 ud af 75 opgaver — dog med forbehold for at dette kun dækker én specifik konfiguration.

Laguna 2.1 præsenteres i [5] og [6] som en 118B total parametre Mixture-of-Experts model med 8B aktiverede parametre per token, designet til agentic coding og langvarige opgaver. Modellen har en 1.048.576-token kontekstudvidelse (1 million), blanding af sliding window og global attention (48 lag i 1:3 forhold), og native reasoning-support med interleaved thinking. [6] angiver, at NVFP4-vægtene fylder cirka 71 GB, hvilket gør den langt mere krævende end Qwen 3.6 27B til lokale opsætninger.

Hvor kilderne skiller sig

Der er markante forskelle i, hvordan kilderne vurderer Qwen 3.6 27B's kodningspræstationer. [1] viser en klar fordel til Gemma 4 12B med 86,7% mod 53,3% på LiveCodeBench, mens [8] hævder at "27B outperformed a 397B model on agentic coding benchmarks." Disse to resultater er umiddelbart modstridende, men [1] påpeger selv, at der er tale om forskellige benchmarks og konfigurationer — LiveCodeBench måler pass@1 på 75 problemer med 4.096 token cap, mens SWE-bench Verified tester mere komplekse software engineering-opgaver. [2] nævner at Qwen3.6-27B-FP8 når 90,0% på SWE-bench Verified med en engineered agent stack, hvilket understøtter at modellen excellerer på visse kodningsopgaver selvom den scorer lavere på andre benchmarks.

Kilderne er uenige om, hvorvidt Qwen 3.6 27B er bedre end større modeller i samme familie. [15] viser en praktikerberetning: "Switched from Qwen3.6 35b-a3b to Qwen3.6 27b mid coding and it's noticeably better!" Dog rapporterer [7], at 35B-A3B-søskendevarianten faktisk vinder uafhængige agentic tool-eval-bench sammenligninger med en 91,0 ± 1,5 mean score på tværs af 84 scenarier og 8 forsøg. [18] nuancerer dette yderligere: "while it's true that qwen3.6 is good for agentic coding, it's not very good for exploring the codebase and coming up with plans" — en indvending der ikke findes i de mere positive kilder.

På multimodalitet er kilderne enige om, at Gemma 4 har en fordel med lydstøtte, som Qwen 3.6 27B mangler. [4] beskriver Gemma 4 12B som "encoder-free" med native audio og vision understanding, mens [8] kun nævner "native multimodal support" for Qwen uden at specificere audio. [10] bekræfter: "Although it lacks audio support, it offers powerful text and vision capabilities."

Tidsmæssigt udkom Qwen 3.6 27B den 22. april 2026 [8], Gemma 4 den 2. april 2026 [3], og Laguna 2.1 i august 2026 [5][6]. Forskellene i publiceringstidspunkt kan forklare nogle variationer i rapporterede benchmarks, da modelversioner kan have fået opdateringer.

Kun bragt af enkelte medier

Flere unikke detaljer optræder kun i enkelte kilder. [7] indeholder specifikke throughput-målinger på Apple Silicon: MTPLX v2 når 82,8 t/s på M3 Ultra med Optimized Speed build — et resultat der ikke findes i andre kilder. Samme kilde nævner også, at NVFP4-kvantiseringen af 35B-modellen "appear to be broken in agentic workflows," en teknisk indsigelse der ikke adresseres andetsteds.

[1] leverer den eneste direkte head-to-head LiveCodeBench-sammenligning mellem Gemma 4 12B og Qwen 3.6 27B med verificerbare tal: 86,7% vs 53,3% på henholdsvis 75 opgaver. [2] er den eneste kilde der nævner 90,0% på SWE-bench Verified med FP8-kvantisering og en engineered agent stack.

[18] fra Hacker News indeholder en praktikerspecifik indvending, der ikke findes i de mere tekniske kilder: at Qwen 3.6 27B "is not very good for exploring the codebase and coming up with plans" og kræver parring med en model der kan indtage hele konteksten. [17] rapporterer en anden praktikeroplevelse efter flere ugers brug som en "downgrade" sammenlignet med en anden (uspecificeret) model, med "so many strongly-held opinions I did not ever ask it for."

[19] giver en konkret vLLM-opsætningsguide med specifikke kvalitets-/præstations-ofre for at få modellen til at passe på 24 GB VRAM.

Ubekræftet

Ingen af kilderne leverer uafhængige benchmarks for Laguna 2.1 sammenlignet med Qwen 3.6 27B. Kilderne [5] og [6] beskriver Laguna 2.1's specifikationer og tilgængelighed, men der er ingen målinger af faktisk ydeevne i kodnings- eller agentic-opgaver, der kan sammenlignes direkte med Qwen 3.6 27B's dokumenterede 77,2% på SWE-bench Verified eller 53,3% på LiveCodeBench.

Der er heller ingen uafhængige målinger, der bekræfter [8]'s påstand om, at Qwen 3.6 27B "outperformed a 397B model on coding benchmarks" — dette er en påstand uden specifikke benchmark-referencer i artiklen. [2] nævner 90% på SWE-bench Verified, men kun med en "engineered agent stack," hvilket gør det uklart hvor meget af scoren der skyldes modellen versus stacken.

Ingen praktikerkilder (tier 4) rapporterer erfaringer med at køre Laguna 2.1 lokalt — alle [5] og [6] er produktkort uden community-feedback. Der er ingen målinger af Qwen 3.6 27B's ydeevne på nyere hardware som Blackwell-arkitekturen (kun [7] nævner "Blackwell-class hardware" uden specifikke tal).

Kilder

  1. Evidence-backed assessment: Gemma 4 12B versus Qwen 3.6 coding claim · GitHub
  2. Qwen3.6-27B-FP8 reaches 90.0% on SWE-bench Verified with an engineered agent stack · QwenLM/Qwen3 · Discussion #1846
  3. Welcome Gemma 4: Frontier multimodal intelligence on device
  4. google/gemma-4-12B-it · Hugging Face
  5. unsloth/Laguna-S-2.1-GGUF · Hugging Face
  6. poolside/Laguna-S-2.1-NVFP4 · Hugging Face
  7. Qwen 3.6 27B Benchmark Deep Dive: The Measured Numbers
  8. Qwen3.6-27B: 27B Model Beats 397B on Coding (2026)
  9. Gemma 4 vs Qwen 3.5: Every Size Compared (2026)
  10. Gemma 4 12B vs Qwen 3.6 27B: Which Open Model Wins in Coding, Translation, and Vision? | by Mehul Gupta | Data Science in Your Pocket | Medium
  11. r/LocalLLaMA on Reddit: Actual comparison between locally ran Qwen-3.6-27B and proprietary models
  12. Qwen 3.6 27B: The Sweet Spot for Local Dev (Guide) | QWE AI Academy
  13. Gemma 4 vs Qwen 3.5: Which Open-Weight Model Should You Use for Local AI Workflows? | MindStudio
  14. Gemma4
  15. r/LocalLLaMA on Reddit: Switched from Qwen3.6 35b-a3b to Qwen3.6 27b mid coding and it's noticeably better!
  16. r/LocalLLM on Reddit: Qwen3.6:27b is the first local model that actually holds up against Claude Code for me
  17. After having been a happy user of Qwen3.6-27B for a few weeks, due to being away... | Hacker News
  18. It's pretty close already. Check qwen3.6 27b if you haven't already. People are ... | Hacker News
  19. Local-Server/qwen3.6-27b-vllm-setup.md at main · Ezhik-NY/Local-Server
  20. pentagi/examples/guides/vllm-qwen35-27b-fp8.md at main · vxcontrol/pentagi

Opfølgende spørgsmål

Endnu ingen opfølgende spørgsmål. Stil et nedenfor — svaret henter friske tal fra web og vurderer det mod rapportens kriterier.

Forslag — grav videre i hullerne