News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »artificial-analysis«

Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?

… create sophisticated agents and streamline enterprise workflows through spreadsheet and financial analysis." Artiklen nævner specifikt, at Opus 4.5's "agents autonomously refine their …

torsdag 30. juli 2026 · research

9 briefing-resultat(er) for »artificial-analysis«

K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design

K2 Horizon-modellerne scorer højt på Artificial Analysis, men kræver uforholdsmæssigt meget RAM til kontekst. Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre …

tirsdag 15. september 2026 · Nye modeller k2-horizonkv-cachelocal-llmartificial-analysis

DeepSeek V4.1 Flash slår Astra på ny benchmark – overraskende sejr

DeepSeeks V4.1 Flash-model har indtaget førstepladsen på Artificial Analysis' nye Intelligence Index v4.3-benchmark og slår dermed både Astra og Fable …

mandag 14. september 2026 · Nye modeller deepseek-v4.1artificial-analysisbenchmarkastra

Artificial Analysis forsvarer sig: "Vi er ikke købt"

Benchmark-portalen dokumenterer, at de har brugt 13.129 USD alene på at teste Fable 5.1, og afviser kritikken af deres metode som …

fredag 11. september 2026 · Forskning & arkitektur artificial-analysisbenchmarktransparencyevaluation

Qwen 3.8 Low og Medium knuser benchmarks – over-tænkning var ikke nødvendig

Artificial Analysis viser, at de lavere reasoning-presets leverer konkurrencedygtige scores, hvilket bekræfter, at modellens styrke ikke kun skyldes over-tænkning. [Se tidligere dækning …

lørdag 22. august 2026 · Nye modeller qwen3.8-27bartificial-analysisbenchmarklow-medium

Opfølgning: GLM-5.3 benchmarkresultater offentliggjort – konkurrencedygtig med topmodeller

Artificial Analysis viser, at GLM-5.3 præsterer stærkt på tværs af standardtest. [briefingen 18. august](/archive/2026-08-18)

onsdag 19. august 2026 · Nye modeller glm-5.3benchmarkartificial-analysis

Qwen 3.8 27B matcher GPT-5.6 Luna – på en brøkdel af parametrene

Qwen 3.8 27B scorer 52 på Artificial Analysis Intelligence Index, samme score som GPT-5.6 Luna (max) og kun ét point efter …

tirsdag 18. august 2026 · Nye modeller qwen-3.8open-weightsbenchmarkchinese-ai

Ling 3.0 Flash: Den hidtil bedste åbne model i sin størrelse

Ling 3.0 Flash er nu tilgængelig som open-weight på Hugging Face og slår alle konkurrenter i sin klasse. Det styrker argumentet for …

fredag 14. august 2026 · Nye modeller ling-3.0-flashopen-weightshugging-faceartificial-analysis

Opfølgning: Qwen 3.8 Max topper agentic benchmark

Alibaba-modellen er nu nummer ét på Artificial Analysis' agentic index foran Opus 5 – et tegn på, at agentiske evner ikke længere er forbeholdt …

fredag 7. august 2026 · Nye modeller qwen3-8-maxagentic-indexartificial-analysisopus-5

Opfølgning: Brugere anklager Artificial Analysis for at rykke Qwen ned

Efter Qwen 3.8 Max toppede agentic-indekset, ændrede AA vægtningen i v4.1.1, så Anthropic igen fører. [Se briefingen 5. august](/archive …

fredag 7. august 2026 · Branche & politik artificial-analysisqwen3-8-maxbenchmark