News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »swe-bench«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan …

fredag 7. august 2026 · research

Qwen 3.8 27b

… På benchmarks opnår Qwen3.6-27B 77,2% på SWE-bench Verified, hvilket slår den tidligere flagskibsmodel Qwen3.5-397B-A17B MoE's 76 …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Den scorer 77,2% på SWE-bench Verified (april 2026), matcher Claude 4.5 Opus på Terminal-Bench, og kører på en enkelt 16 …

torsdag 30. juli 2026 · research

7 briefing-resultat(er) for »swe-bench«

Real-SWE: Nyt benchmark tester AI på private virksomhedskodebaser

Benchmarket evaluerer modeller på rigtige, private enterprise-kodebaser frem for syntetiske opgaver. Diskuteres på Hacker News og r/LocalLLaMA.

søndag 13. september 2026 · Forskning & arkitektur real-swebenchmarkenterprise-codecoding-agents

Opfølgning: Qwen3.8 Flash Next-skabeloner testet på SWE-bench

Stock når 99 % på xhigh, Sharp er stabil på 94 % på begge efforts, Fixed følger tæt. Skabelonen ændrer både hastighed og tokenforbrug markant. [Briefingen …

søndag 6. september 2026 · Forskning & arkitektur qwen3.8-flash-nextswe-benchtemplates

"Intelligence Density" – nyt mål for kodning pr. parameter

En aggregator på tværs af SWE-bench, DeepSWE, Terminal-Bench og Code Arena beregner hvor meget kodningsintelligens hver parameter leverer. Små modeller straffes for …

mandag 31. august 2026 · Forskning & arkitektur coding-benchmarksintelligence-densityswe-benchagentic-coding

IBM udgiver Granite 4.2 med indbygget ræsonnement og agentisk RL

… 8B og 30B er trænet med agentisk RL i sandkassemiljøer, og 30B opnår 57% på SWE-Bench.

torsdag 27. august 2026 · Nye modeller ibmgranite-4.2open-weightsagentic-rl

Lokal agentic coding benchmark: Qwen 3.8 27B medium reasoning er sweet spot

En omfattende benchmark viser at medium reasoning mode i Qwen 3.8 27B giver højest score med markant færre tokens end xhigh mode. Kører …

tirsdag 18. august 2026 · Forskning & arkitektur qwen-3.8agentic-codingbenchmarkreasoning-effort

Muse Glimmer: Metas 30B open-weight agent-model kører på én GPU

… Modellen klarer sig stærkt på agent-benchmarks som SWE-Bench og DeepSearch QA, og Mark Zuckerberg fulgte op med et manifest, der argumenterer for …

tirsdag 11. august 2026 · Nye modeller muse-glimmermetaopen-weightslocal-ai

Poolside udgiver Laguna S 2.1 – en open-weight kodningsmodel med imponerende ydeevne

… Den matcher langt større modeller på SWE-Bench og kører på en enkelt DGX Spark.

onsdag 22. juli 2026 · Nye modeller poolsidelaguna-s-2.1open-weightscoding-model