Søgning
2 research-rapport(er) for »terminal-bench«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Den scorer 77,2% på SWE-bench Verified (april 2026), matcher Claude 4.5 Opus på Terminal-Bench, og kører på en enkelt 16 …
4 briefing-resultat(er) for »terminal-bench«
Opfølgning: Anthropic lancerer Claude Fable 5.1 og Mythos 5.1
Fable 5.1 opnår 52,6% på Terminal-Bench-Science, får 1M kontekstvindue og 75% billigere cache-læsninger, mens Mythos 5.1 forbliver begrænset …
"Intelligence Density" – nyt mål for kodning pr. parameter
En aggregator på tværs af SWE-bench, DeepSWE, Terminal-Bench og Code Arena beregner hvor meget kodningsintelligens hver parameter leverer. Små modeller straffes for …
Terminal-Bench-Science evaluerer AI-agenter på videnskabelige workflows
En ny benchmark tester AI-agenters evne til at udføre reelle forskningsopgaver i terminalen. Målet er at kvantificere, hvor godt AI kan assistere i …
Opfølgning: MacBook vs. 2× DGX Spark – DeepSeek V4 Flash i kvantiseringskamp
… Mac'en vandt 54% mod 52% på Terminal-Bench 2.1 – overraskende tæt. Se [briefingen 17. juli](/archive/2026-07-17).