News-Tracker

Søgning

AI & LLM · daglig briefing


2 research-rapport(er) for »terminal-bench«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan …

fredag 7. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Den scorer 77,2% på SWE-bench Verified (april 2026), matcher Claude 4.5 Opus på Terminal-Bench, og kører på en enkelt 16 …

torsdag 30. juli 2026 · research

4 briefing-resultat(er) for »terminal-bench«

Opfølgning: Anthropic lancerer Claude Fable 5.1 og Mythos 5.1

Fable 5.1 opnår 52,6% på Terminal-Bench-Science, får 1M kontekstvindue og 75% billigere cache-læsninger, mens Mythos 5.1 forbliver begrænset …

onsdag 2. september 2026 · Nye modeller claude-fable-5.1claude-mythos-5.1terminal-benchcache-reads

"Intelligence Density" – nyt mål for kodning pr. parameter

En aggregator på tværs af SWE-bench, DeepSWE, Terminal-Bench og Code Arena beregner hvor meget kodningsintelligens hver parameter leverer. Små modeller straffes for …

mandag 31. august 2026 · Forskning & arkitektur coding-benchmarksintelligence-densityswe-benchagentic-coding

Terminal-Bench-Science evaluerer AI-agenter på videnskabelige workflows

En ny benchmark tester AI-agenters evne til at udføre reelle forskningsopgaver i terminalen. Målet er at kvantificere, hvor godt AI kan assistere i …

fredag 28. august 2026 · Forskning & arkitektur benchmarkai-agentsscientific-research

Opfølgning: MacBook vs. 2× DGX Spark – DeepSeek V4 Flash i kvantiseringskamp

… Mac'en vandt 54% mod 52% på Terminal-Bench 2.1 – overraskende tæt. Se [briefingen 17. juli](/archive/2026-07-17).

lørdag 18. juli 2026 · Forskning & arkitektur deepseek-v4-flashquantizationlocal-inferencebenchmark