News-Tracker

Søgning

AI & LLM · daglig briefing


7 research-rapport(er) for »benchmark«

hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting

… Open Source OpenAI? 2026 Benchmark - TokenMix Blog](https://tokenmix.ai/blog/gpt-oss-120b-review-benchmark-2026) 7. [How to Run a 120B LLM …

fredag 7. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Forskellene i publiceringstidspunkt kan forklare nogle variationer i rapporterede benchmarks, da modelversioner kan have fået opdateringer. ## Kun bragt af enkelte medier Flere unikke detaljer …

fredag 7. august 2026 · research

Qwen 3.8 27b

… The Measured Numbers](https://kie.ai/blog/qwen-3-6-27b-deep-dive-benchmarks-quantization) 10. [Evaluating Qwen 3.6 27B: A Complete Benchmarking

mandag 3. august 2026 · research

Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?

… Der er ingen uafhængige benchmarks eller testresultater i de leverede kilder. **Tomt kildelag:** Lag 2 (lokalpresse) gav ingen brugbare kilder. Det betyder ikke, at …

torsdag 30. juli 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… juli 2026) viser en specifik benchmark, at **Gemma 4 12B QAT Q4_0** opnår 86,7% (65/75) på LiveCodeBench på en Tesla V100 …

torsdag 30. juli 2026 · research

Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?

… Apple Silicon Benchmark Comparison](https://www.promptquorum.com/local-llms/apple-silicon-m5-local-llm) 21. [How M5 Ultra and M7 Ultra could fix …

onsdag 22. juli 2026 · research

Hvad er status på EU's AI Act-håndhævelse i 2026?

… Hvad pelican benchmark afslører om Kimi K3](https://simonwillison.net/2026/Jul/16/kimi-k3/) (brief-arkiv) 18. [EU AI Act Deadlines 2026-2027 …

fredag 17. juli 2026 · research

50 briefing-resultat(er) for »benchmark«

K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design

K2 Horizon-modellerne scorer højt på Artificial Analysis, men kræver uforholdsmæssigt meget RAM til kontekst. Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre …

tirsdag 15. september 2026 · Nye modeller k2-horizonkv-cachelocal-llmartificial-analysis

DeepSeek V4.1 Flash slår Astra på ny benchmark – overraskende sejr

DeepSeeks V4.1 Flash-model har indtaget førstepladsen på Artificial Analysis' nye Intelligence Index v4.3-benchmark og slår dermed både Astra og Fable …

mandag 14. september 2026 · Nye modeller deepseek-v4.1artificial-analysisbenchmarkastra

Real-SWE: Nyt benchmark tester AI på private virksomhedskodebaser

Benchmarket evaluerer modeller på rigtige, private enterprise-kodebaser frem for syntetiske opgaver. Diskuteres på Hacker News og r/LocalLLaMA.

søndag 13. september 2026 · Forskning & arkitektur real-swebenchmarkenterprise-codecoding-agents

RoastMyHarness benchmarker dine brugerdefinerede Pi-værktøjer

Værktøjet kører DeepSWE-opgaver mod både bar Pi og din modificerede harness for at vise, hvad der blev bedre, og hvad der gik i …

søndag 13. september 2026 · Værktøjer & produkter pibenchmarkdeepseekharness

Agnes-3.0-Flash: Benchmark-hit med uklar historie

33B-modellen hævdes at slå Qwen3.8 27B på AA-indekset, men HF-udgaven er "Preview" og ikke samme model som evalueret.

søndag 13. september 2026 · Nye modeller agnes-3.0-flashqwen-3.8benchmarkopen-weights

Artificial Analysis forsvarer sig: "Vi er ikke købt"

Benchmark-portalen dokumenterer, at de har brugt 13.129 USD alene på at teste Fable 5.1, og afviser kritikken af deres metode som …

fredag 11. september 2026 · Forskning & arkitektur artificial-analysisbenchmarktransparencyevaluation

Muse-Glimmer-30B overrasker med kreativ skrivekunst

Den lille 30B-model slår langt større frontier-modeller i EQ-Bench Creative Writing og leverer ægte morsom David Sedaris-parodi.

fredag 11. september 2026 · Nye modeller muse-glimmer-30bcreative-writingbenchmarkopen-weights

MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden

OpenBMBs MiniCPM5-2B slår Qwen3.5-4B på 34 benchmarks og leveres med datasæt, checkpoints og Apache 2.0-vægte. GGUF fra 1,56 …

tirsdag 8. september 2026 · Nye modeller minicpm5openbmbon-deviceapache-2.0

Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4

En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.8unslothquantizationbenchmark

Nyt benchmark: The Struggle Bench – kan AI'en overleve i en lejlighed?

Modellen får en server, en lejlighed og en bankkonto. Den skal betale husleje uden at begå cyberkriminalitet. Score: antal måneder den overlever.

mandag 7. september 2026 · Forskning & arkitektur benchmarkstruggle-benchagisurvival

Benchmarks fra 4x Radeon AI Pro R9700-builds efterspurgt

En bruger overvejer en 4x R9700-server til DeepSeek V4 Flash og Qwen 3.8 Flash og spørger om erfaringer.

mandag 7. september 2026 · Værktøjer & produkter radeon-ai-pro-r9700amdbenchmarkdeepseek-v4

lm-eval-ledger: Nyt open source benchmark-harness med svarinspektion

Værktøjet kører benchmarks, gemmer alle svar i SQLite og tilbyder en web-app til at sammenligne modelsvar spørgsmål for spørgsmål.

mandag 7. september 2026 · Værktøjer & produkter benchmark-harnesslm-eval-ledgeropen-sourcemodel-comparison

Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM

Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bggufquantizationbenchmark

Opfølgning: GPT-6 Astra får 62,7 % på ARC-AGI-3 med standard harness

… september](/archive/2026-09-02) dækkede udrulningen; nu udfordres benchmark-tolkningen.

fredag 4. september 2026 · Forskning & arkitektur arc-agi-3gpt-6-astrareasoningbenchmark

Meta lover Muse Spark 1.3 som svar på OpenAI og Anthropic

… september](/archive/2026-09-03) dækkede løftet om open-weights; nu følger detaljer og benchmarks.

fredag 4. september 2026 · Nye modeller muse-spark-1.3metaopen-weightscoding

Opfølgning: GLM 5.3 Flash over DSV4 Flash?

Opfølgning på [briefingen 30. august](/archive/2026-08-30). Reddit-bruger på M3 Ultra 256GB overvejer skifte. GLM nævnes som benchmark-bedre.

torsdag 3. september 2026 · Forskning & arkitektur glm-5.3deepseek-v4comparisonopfølgning

Opfølgning: Kaitchup benchmarker Qwen3.8 27B-kvanter fra Q4 til Q1

Resultater viser, at UD Q3_K_XL med 12,8GB giver 100% nøjagtighed og er ideel til 16GB-kort. [Se tidligere briefingen](/archive/2026 …

onsdag 2. september 2026 · Forskning & arkitektur qwen3.8-27bkaitchupquantizationbenchmark

Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s

En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …

tirsdag 1. september 2026 · Nye modeller qwen-3.8performancellama.cppvram

Opfølgning: Flash Next vs. 27B – hurtigere, men med ny fejltype

Flash Next er hurtigere og fejlfri på JSON og injection, men 27B vinder på symbolsk ræsonnement. Flash Next har en ny fejl: den lover …

mandag 31. august 2026 · Nye modeller qwen3.8-flash-nextmxfp4local-llmbenchmark

Ny benchmark tester LLM'ers evne til at angribe live infrastruktur

… kendte sårbarheder får modellerne en live server de selv skal hacke. Benchmarken er bygget til at finde den bedste model til reel penetration testing.

mandag 31. august 2026 · Værktøjer & produkter pentestingbenchmarkllm-securityagents

Benchmark måler time-to-first-token på tværs af hele voice-stakken

Undersøgelsen dækker LLM, speech-to-text, text-to-speech og speech-to-speech. Voice-agents fejler på latency længe før de fejler på intelligens.

mandag 31. august 2026 · Værktøjer & produkter latencyttssttvoice-agentsbenchmark

"Intelligence Density" – nyt mål for kodning pr. parameter

En aggregator på tværs af SWE-bench, DeepSWE, Terminal-Bench og Code Arena beregner hvor meget kodningsintelligens hver parameter leverer. Små modeller straffes for …

mandag 31. august 2026 · Forskning & arkitektur coding-benchmarksintelligence-densityswe-benchagentic-coding

GLM 5.3 Flash slår DeepSeek V4 Flash på HumanEval på 2x DGX Spark

En bruger benchmarkede GLM 5.3 Flash (NVFP4) mod DeepSeek V4 Flash 0731 på to DGX Spark: GLM vandt med 97,0% mod 94 …

søndag 30. august 2026 · Nye modeller glm-5.3deepseek-v4humanevalmxfp4

Tenstorrent QuietBox 2 benchmarket med Qwen 3.7 27B

En medarbejder har benchmarked Qwen 3.7 27B på Tenstorrents QuietBox 2 med to p300c-kort. Tallene er endnu ikke offentlige i detaljer, men …

søndag 30. august 2026 · Værktøjer & produkter tenstorrentqwen3.7benchmarkhardware

Finansmodel-benchmark afslører mere om testmetode end om modellen

Ling-3.0-flash-Fin's benchmark-kort viser, at resultaterne afhænger af specifikke agent-systemer, temperaturer og værktøjer – ikke bare modelvægtene. Vægtene er …

søndag 30. august 2026 · Branche & politik ling-3.0financebenchmarktransparency

Opfølgning: State-of-the-art GGUFs til Qwen3.8-27B – 2,5-3,0 bpw

… 2,75 bpw (9,3 GB) matcher endda BF16 i gennemsnit på flere benchmarks [se briefingen 20. august](/archive/2026-08-20).

lørdag 29. august 2026 · Værktøjer & produkter ggufqwen3.8-27bgsq-rcoquantization

Google DeepMind piloterer verdens første dobbeltblindede AI-evalueringer

DeepMind afprøver dobbeltblindede tests for at reducere bias i AI-benchmarking. Metoden kan blive ny standard for objektiv modelvurdering.

fredag 28. august 2026 · Forskning & arkitektur double-blindevaluationdeepmind

Terminal-Bench-Science evaluerer AI-agenter på videnskabelige workflows

En ny benchmark tester AI-agenters evne til at udføre reelle forskningsopgaver i terminalen. Målet er at kvantificere, hvor godt AI kan assistere i …

fredag 28. august 2026 · Forskning & arkitektur benchmarkai-agentsscientific-research

Opfølgning: Ornith 1.5 og Tiel-Coder vinder tool-calling benchmark blandt 35B-A3B-varianter

Fine-tunes af Qwen3.6-35B-A3B slår den originale model og nærmer sig Qwen3.8-27B i tool-eval-bench. [briefingen 25. august …

onsdag 26. august 2026 · Nye modeller qwen3.6-35b-a3btool-callingbenchmarkornith

Opfølgning: Ox Alpha – mysteriet fortsætter, spekulationer om kinesisk oprindelse

Ox Alpha er fortsat gratis og slår Claude Fable på kodning, men identiteten forbliver ukendt – Xiaomi og DeepSeek er blevet afskrevet som kilder. [briefingen …

tirsdag 25. august 2026 · Nye modeller ox-alphaopenroutermystery-modelcoding-benchmarks

Opfølgning: Ornith 1.5 slår Qwen 3.8 og Muse Glimmer i benchmark

En community-sammenligning viser, at Ornith-1.5-35B-A3B klarer sig bedst blandt flere MoE-modeller – TielCoder kan være endnu stærkere på kodning.

tirsdag 25. august 2026 · Nye modeller qwennemotronornithmuse-glimmerbenchmark

Opfølgning: $100 benchmark af Qwen3.8-27B quants

En bruger planlægger at bruge $100 på cloud-GPU'er for at teste kvantiseringsniveauer, KV-cache-præcision og kontekst-afvejninger på Qwen3.8-27B.

tirsdag 25. august 2026 · Forskning & arkitektur qwenquantizationbenchmarkkv-cache

Opfølgning: PowerColor R9700 til Qwen 3.8 27B – reelle tok/s efterlyses

… Q4_K_XL og spørger efter reelle tok/s ved 64K+ kontekst, ikke kun kolde benchmarks. Se [briefingen 15. august](/archive/2026-08-15).

mandag 24. august 2026 · Værktøjer & produkter r9700qwen3.8-27bbenchmarkvram

Opfølgning: Atomic Dynamic-quants af Qwen 3.8 27B testet på RTX 6000

Et team har lavet og benchmarked Atomic Dynamic GGUF-quants af Qwen 3.8 27B – Q4, Q5, Q6 og Q8 – på en RTX 6000 …

mandag 24. august 2026 · Forskning & arkitektur qwen3.8-27bquantizationatomic-dynamicbenchmark

Qwen 3.8 27B vs. Opus 5: 39.000 linjer C til HTML-port

En udvikler testede Qwen 3.8 27B mod Opus 5 på at porte et 39.000-linjers C-spil til single-file HTML/three …

mandag 24. august 2026 · Forskning & arkitektur qwen3.8-27bcodingc-to-htmlbenchmark

Opfølgning: Q8-kvant Qwen 3.8 27B slår BF16 Qwen 3.6 i kodning

Grundig benchmark viser, at Q8 Qwen 3.8 27B overgår BF16 Qwen 3.6 på instruktionsfølgning og 280k kontekst – men har initiale udfordringer med …

søndag 23. august 2026 · Værktøjer & produkter qwen3.8-27bcodingquantcontextqwen3.6-27b

Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test

Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på …

søndag 23. august 2026 · Værktøjer & produkter dflash2speculative-decodingqwen3.8-27bllama.cpplivecodebench

Qwen 3.8 Low og Medium knuser benchmarks – over-tænkning var ikke nødvendig

Artificial Analysis viser, at de lavere reasoning-presets leverer konkurrencedygtige scores, hvilket bekræfter, at modellens styrke ikke kun skyldes over-tænkning. [Se tidligere dækning …

lørdag 22. august 2026 · Nye modeller qwen3.8-27bartificial-analysisbenchmarklow-medium

Opfølgning: Benchmark-kaos – GLM-5.3 resultater diskuteres

Reddit-bruger påpeger, at benchmark-scoren for GLM-5.3 er ude af proportioner. [briefingen 19. august](/archive/2026-08-19).

fredag 21. august 2026 · Forskning & arkitektur benchmarkglm-5.3follow-up

Fine-tuning af Cactus Needle 2 matcher DeepSeek v4 på specifikke opgaver

Henry fra Cactus viser, at Needle 2 efter finjustering overgår DeepSeek v4 Flash på afgrænsede opgaver – men advarer mod overfitting.

fredag 21. august 2026 · Værktøjer & produkter cactus-needle-2fine-tuningdeepseek-v4benchmark

Opfølgning: Ornith-1.5-familien slår Claude Opus 4.8 på flere benchmarks

Ornith-1.5 fås i 9B, 35B MoE og 397B MoE og opnår state-of-the-art blandt open-source modeller. Modellerne er selvforbedrende …

torsdag 20. august 2026 · Nye modeller ornith-1.5open-weightsmoedeepseek

Qwen3.8-27B klarer sig dårligt på SlopCodeBench – god som copilot, ikke alene

Modellen scorer kun 17,6 % på strenge checkpoints og 13,3 % på sværere delmængder. Den kan løse problemer med klar retning, men ikke styre …

torsdag 20. august 2026 · Nye modeller qwen-3.8slopcodebenchcodingbenchmark

Opfølgning: Z.AI's GLM-5.3 overgår amerikanske modeller i cybersikkerhed – udgivelse forsinket

Det kinesiske open-weight-model GLM-5.3 slår benchmarks, men udgivelsen er udskudt efter uventede hacking-evner. [briefingen 11. august](/archive/2026-08 …

onsdag 19. august 2026 · Nye modeller glm-5.3open-weightscybersecurityz-ai

Opfølgning: GLM-5.3 benchmarkresultater offentliggjort – konkurrencedygtig med topmodeller

Artificial Analysis viser, at GLM-5.3 præsterer stærkt på tværs af standardtest. [briefingen 18. august](/archive/2026-08-18)

onsdag 19. august 2026 · Nye modeller glm-5.3benchmarkartificial-analysis

Opfølgning: Ling-3.0 (BailingMoE3) understøttes nu officielt i llama.cpp

PR #26608 er merged, og GGUF-kvantiseringer er tilgængelige – benchmarks på Intel Arc B580 viser 114 tk/s. [briefingen 17. august](/archive/2026-08 …

onsdag 19. august 2026 · Værktøjer & produkter ling-3.0bailingmoe3llama.cppintel-arc

Qwen 3.8 27B matcher GPT-5.6 Luna – på en brøkdel af parametrene

Qwen 3.8 27B scorer 52 på Artificial Analysis Intelligence Index, samme score som GPT-5.6 Luna (max) og kun ét point efter …

tirsdag 18. august 2026 · Nye modeller qwen-3.8open-weightsbenchmarkchinese-ai

Opfølgning: Reddit benchmarker quants – "vi benchmarker modeller ingen kører"

En tråd påpeger at Qwen 3.8s imponerende benchmarks gælder uquantiserede modeller, mens næsten alle kører en eller anden quant. Kl-divergens er en …

tirsdag 18. august 2026 · Forskning & arkitektur benchmarkquantizationqwen-3.8local-llm

Lokal agentic coding benchmark: Qwen 3.8 27B medium reasoning er sweet spot

En omfattende benchmark viser at medium reasoning mode i Qwen 3.8 27B giver højest score med markant færre tokens end xhigh mode. Kører …

tirsdag 18. august 2026 · Forskning & arkitektur qwen-3.8agentic-codingbenchmarkreasoning-effort

ROCm 7.14 i llama.cpp giver 50% hurtigere prompt-processing på Radeon 780M

… til ROCm 7.14 tilføjer officiel understøttelse af Radeon 780M iGPU. Benchmarks viser markant forbedring for tætte modeller sammenlignet med Vulkan, men MoE-modeller …

mandag 17. august 2026 · Værktøjer & produkter llama.cpprocmradeon-780mvulkan

Opfølgning: Qwen3.8-27B matcher Claude 4.6 fra for seks måneder siden

Qwen3.8-27B præsterer på niveau med Claude 4.6 fra februar, men halter bag Opus 4.7/4.8 og Mythos. En 27B …

søndag 16. august 2026 · Nye modeller qwen3.8-27bopen-weightsclaude-opusbenchmark