Søgning
3 research-rapport(er) for »coding-benchmarks«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Der er heller ingen uafhængige målinger, der bekræfter [8]'s påstand om, at Qwen 3.6 27B "outperformed a 397B model on coding benchmarks …
Qwen 3.8 27b
… Kilderne giver ingen konkrete specifikationer, benchmarks eller priser for denne model. Det er derfor vigtigt at skelne mellem den eksisterende Qwen3.6-27B og …
Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?
… Der er ingen uafhængige benchmarks eller testresultater i de leverede kilder. **Tomt kildelag:** Lag 2 (lokalpresse) gav ingen brugbare kilder. Det betyder ikke, at …
6 briefing-resultat(er) for »coding-benchmarks«
Meta lover Muse Spark 1.3 som svar på OpenAI og Anthropic
… september](/archive/2026-09-03) dækkede løftet om open-weights; nu følger detaljer og benchmarks.
"Intelligence Density" – nyt mål for kodning pr. parameter
En aggregator på tværs af SWE-bench, DeepSWE, Terminal-Bench og Code Arena beregner hvor meget kodningsintelligens hver parameter leverer. Små modeller straffes for …
Opfølgning: Ox Alpha – mysteriet fortsætter, spekulationer om kinesisk oprindelse
Ox Alpha er fortsat gratis og slår Claude Fable på kodning, men identiteten forbliver ukendt – Xiaomi og DeepSeek er blevet afskrevet som kilder. [briefingen …
Opfølgning: Kimi K3 topper kodningsbenchmark som første kinesiske model
Moonshot AIs 2,8 billioner parameters model er open-weight og sætter nye standarder. Det lægger pres på prissætningen hos amerikanske frontløbere. Se [briefingen …
Opfølgning: Karpathys Ringenes Herre-test viser, hvordan AI-benchmarks har ændret sig
Andrej Karpathy fik Claude Opus 5 til at bygge en 3D-verden af Ringenes Herre på to timer for 10 dollars – 5.500 linjer …
Hvorfor er næsten alle nye benchmarks kodningsfokuserede?
En debat på r/LocalLLaMA efterlyser flere benchmarks til sprogindlæring, kreativ skrivning og STEM-ræsonnement. Kodningsfokus risikerer at overse vigtige anvendelsesområder.