Søgning
3 research-rapport(er) for »swe-bench«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan …
Qwen 3.8 27b
… På benchmarks opnår Qwen3.6-27B 77,2% på SWE-bench Verified, hvilket slår den tidligere flagskibsmodel Qwen3.5-397B-A17B MoE's 76 …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Den scorer 77,2% på SWE-bench Verified (april 2026), matcher Claude 4.5 Opus på Terminal-Bench, og kører på en enkelt 16 …
7 briefing-resultat(er) for »swe-bench«
Real-SWE: Nyt benchmark tester AI på private virksomhedskodebaser
Benchmarket evaluerer modeller på rigtige, private enterprise-kodebaser frem for syntetiske opgaver. Diskuteres på Hacker News og r/LocalLLaMA.
Opfølgning: Qwen3.8 Flash Next-skabeloner testet på SWE-bench
Stock når 99 % på xhigh, Sharp er stabil på 94 % på begge efforts, Fixed følger tæt. Skabelonen ændrer både hastighed og tokenforbrug markant. [Briefingen …
"Intelligence Density" – nyt mål for kodning pr. parameter
En aggregator på tværs af SWE-bench, DeepSWE, Terminal-Bench og Code Arena beregner hvor meget kodningsintelligens hver parameter leverer. Små modeller straffes for …
IBM udgiver Granite 4.2 med indbygget ræsonnement og agentisk RL
… 8B og 30B er trænet med agentisk RL i sandkassemiljøer, og 30B opnår 57% på SWE-Bench.
Lokal agentic coding benchmark: Qwen 3.8 27B medium reasoning er sweet spot
En omfattende benchmark viser at medium reasoning mode i Qwen 3.8 27B giver højest score med markant færre tokens end xhigh mode. Kører …
Muse Glimmer: Metas 30B open-weight agent-model kører på én GPU
… Modellen klarer sig stærkt på agent-benchmarks som SWE-Bench og DeepSearch QA, og Mark Zuckerberg fulgte op med et manifest, der argumenterer for …
Poolside udgiver Laguna S 2.1 – en open-weight kodningsmodel med imponerende ydeevne
… Den matcher langt større modeller på SWE-Bench og kører på en enkelt DGX Spark.