News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »coding-benchmarks«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Der er heller ingen uafhængige målinger, der bekræfter [8]'s påstand om, at Qwen 3.6 27B "outperformed a 397B model on coding benchmarks

fredag 7. august 2026 · research

Qwen 3.8 27b

… Kilderne giver ingen konkrete specifikationer, benchmarks eller priser for denne model. Det er derfor vigtigt at skelne mellem den eksisterende Qwen3.6-27B og …

mandag 3. august 2026 · research

Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?

… Der er ingen uafhængige benchmarks eller testresultater i de leverede kilder. **Tomt kildelag:** Lag 2 (lokalpresse) gav ingen brugbare kilder. Det betyder ikke, at …

torsdag 30. juli 2026 · research

6 briefing-resultat(er) for »coding-benchmarks«

Meta lover Muse Spark 1.3 som svar på OpenAI og Anthropic

… september](/archive/2026-09-03) dækkede løftet om open-weights; nu følger detaljer og benchmarks.

fredag 4. september 2026 · Nye modeller muse-spark-1.3metaopen-weightscoding

"Intelligence Density" – nyt mål for kodning pr. parameter

En aggregator på tværs af SWE-bench, DeepSWE, Terminal-Bench og Code Arena beregner hvor meget kodningsintelligens hver parameter leverer. Små modeller straffes for …

mandag 31. august 2026 · Forskning & arkitektur coding-benchmarksintelligence-densityswe-benchagentic-coding

Opfølgning: Ox Alpha – mysteriet fortsætter, spekulationer om kinesisk oprindelse

Ox Alpha er fortsat gratis og slår Claude Fable på kodning, men identiteten forbliver ukendt – Xiaomi og DeepSeek er blevet afskrevet som kilder. [briefingen …

tirsdag 25. august 2026 · Nye modeller ox-alphaopenroutermystery-modelcoding-benchmarks

Opfølgning: Kimi K3 topper kodningsbenchmark som første kinesiske model

Moonshot AIs 2,8 billioner parameters model er open-weight og sætter nye standarder. Det lægger pres på prissætningen hos amerikanske frontløbere. Se [briefingen …

søndag 9. august 2026 · Nye modeller kimi-k3moonshot-aicoding-benchmarksopen-weights

Opfølgning: Karpathys Ringenes Herre-test viser, hvordan AI-benchmarks har ændret sig

Andrej Karpathy fik Claude Opus 5 til at bygge en 3D-verden af Ringenes Herre på to timer for 10 dollars – 5.500 linjer …

tirsdag 4. august 2026 · 🗣️ Stemmer karpathyclaude-opus-5coding-benchmarkslord-of-the-rings

Hvorfor er næsten alle nye benchmarks kodningsfokuserede?

En debat på r/LocalLLaMA efterlyser flere benchmarks til sprogindlæring, kreativ skrivning og STEM-ræsonnement. Kodningsfokus risikerer at overse vigtige anvendelsesområder.

søndag 2. august 2026 · Forskning & arkitektur benchmarkcoding-biasmmlu-proevaluation