Søgning
7 research-rapport(er) for »benchmark«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Open Source OpenAI? 2026 Benchmark - TokenMix Blog](https://tokenmix.ai/blog/gpt-oss-120b-review-benchmark-2026) 7. [How to Run a 120B LLM …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Forskellene i publiceringstidspunkt kan forklare nogle variationer i rapporterede benchmarks, da modelversioner kan have fået opdateringer. ## Kun bragt af enkelte medier Flere unikke detaljer …
Qwen 3.8 27b
… The Measured Numbers](https://kie.ai/blog/qwen-3-6-27b-deep-dive-benchmarks-quantization) 10. [Evaluating Qwen 3.6 27B: A Complete Benchmarking …
Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?
… Der er ingen uafhængige benchmarks eller testresultater i de leverede kilder. **Tomt kildelag:** Lag 2 (lokalpresse) gav ingen brugbare kilder. Det betyder ikke, at …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… juli 2026) viser en specifik benchmark, at **Gemma 4 12B QAT Q4_0** opnår 86,7% (65/75) på LiveCodeBench på en Tesla V100 …
Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?
… Apple Silicon Benchmark Comparison](https://www.promptquorum.com/local-llms/apple-silicon-m5-local-llm) 21. [How M5 Ultra and M7 Ultra could fix …
Hvad er status på EU's AI Act-håndhævelse i 2026?
… Hvad pelican benchmark afslører om Kimi K3](https://simonwillison.net/2026/Jul/16/kimi-k3/) (brief-arkiv) 18. [EU AI Act Deadlines 2026-2027 …
50 briefing-resultat(er) for »benchmark«
K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design
K2 Horizon-modellerne scorer højt på Artificial Analysis, men kræver uforholdsmæssigt meget RAM til kontekst. Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre …
DeepSeek V4.1 Flash slår Astra på ny benchmark – overraskende sejr
DeepSeeks V4.1 Flash-model har indtaget førstepladsen på Artificial Analysis' nye Intelligence Index v4.3-benchmark og slår dermed både Astra og Fable …
Real-SWE: Nyt benchmark tester AI på private virksomhedskodebaser
Benchmarket evaluerer modeller på rigtige, private enterprise-kodebaser frem for syntetiske opgaver. Diskuteres på Hacker News og r/LocalLLaMA.
RoastMyHarness benchmarker dine brugerdefinerede Pi-værktøjer
Værktøjet kører DeepSWE-opgaver mod både bar Pi og din modificerede harness for at vise, hvad der blev bedre, og hvad der gik i …
Agnes-3.0-Flash: Benchmark-hit med uklar historie
33B-modellen hævdes at slå Qwen3.8 27B på AA-indekset, men HF-udgaven er "Preview" og ikke samme model som evalueret.
Artificial Analysis forsvarer sig: "Vi er ikke købt"
Benchmark-portalen dokumenterer, at de har brugt 13.129 USD alene på at teste Fable 5.1, og afviser kritikken af deres metode som …
Muse-Glimmer-30B overrasker med kreativ skrivekunst
Den lille 30B-model slår langt større frontier-modeller i EQ-Bench Creative Writing og leverer ægte morsom David Sedaris-parodi.
MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden
OpenBMBs MiniCPM5-2B slår Qwen3.5-4B på 34 benchmarks og leveres med datasæt, checkpoints og Apache 2.0-vægte. GGUF fra 1,56 …
Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4
En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.
Nyt benchmark: The Struggle Bench – kan AI'en overleve i en lejlighed?
Modellen får en server, en lejlighed og en bankkonto. Den skal betale husleje uden at begå cyberkriminalitet. Score: antal måneder den overlever.
Benchmarks fra 4x Radeon AI Pro R9700-builds efterspurgt
En bruger overvejer en 4x R9700-server til DeepSeek V4 Flash og Qwen 3.8 Flash og spørger om erfaringer.
lm-eval-ledger: Nyt open source benchmark-harness med svarinspektion
Værktøjet kører benchmarks, gemmer alle svar i SQLite og tilbyder en web-app til at sammenligne modelsvar spørgsmål for spørgsmål.
Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM
Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …
Opfølgning: GPT-6 Astra får 62,7 % på ARC-AGI-3 med standard harness
… september](/archive/2026-09-02) dækkede udrulningen; nu udfordres benchmark-tolkningen.
Meta lover Muse Spark 1.3 som svar på OpenAI og Anthropic
… september](/archive/2026-09-03) dækkede løftet om open-weights; nu følger detaljer og benchmarks.
Opfølgning: GLM 5.3 Flash over DSV4 Flash?
Opfølgning på [briefingen 30. august](/archive/2026-08-30). Reddit-bruger på M3 Ultra 256GB overvejer skifte. GLM nævnes som benchmark-bedre.
Opfølgning: Kaitchup benchmarker Qwen3.8 27B-kvanter fra Q4 til Q1
Resultater viser, at UD Q3_K_XL med 12,8GB giver 100% nøjagtighed og er ideel til 16GB-kort. [Se tidligere briefingen](/archive/2026 …
Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s
En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …
Opfølgning: Flash Next vs. 27B – hurtigere, men med ny fejltype
Flash Next er hurtigere og fejlfri på JSON og injection, men 27B vinder på symbolsk ræsonnement. Flash Next har en ny fejl: den lover …
Ny benchmark tester LLM'ers evne til at angribe live infrastruktur
… kendte sårbarheder får modellerne en live server de selv skal hacke. Benchmarken er bygget til at finde den bedste model til reel penetration testing.
Benchmark måler time-to-first-token på tværs af hele voice-stakken
Undersøgelsen dækker LLM, speech-to-text, text-to-speech og speech-to-speech. Voice-agents fejler på latency længe før de fejler på intelligens.
"Intelligence Density" – nyt mål for kodning pr. parameter
En aggregator på tværs af SWE-bench, DeepSWE, Terminal-Bench og Code Arena beregner hvor meget kodningsintelligens hver parameter leverer. Små modeller straffes for …
GLM 5.3 Flash slår DeepSeek V4 Flash på HumanEval på 2x DGX Spark
En bruger benchmarkede GLM 5.3 Flash (NVFP4) mod DeepSeek V4 Flash 0731 på to DGX Spark: GLM vandt med 97,0% mod 94 …
Tenstorrent QuietBox 2 benchmarket med Qwen 3.7 27B
En medarbejder har benchmarked Qwen 3.7 27B på Tenstorrents QuietBox 2 med to p300c-kort. Tallene er endnu ikke offentlige i detaljer, men …
Finansmodel-benchmark afslører mere om testmetode end om modellen
Ling-3.0-flash-Fin's benchmark-kort viser, at resultaterne afhænger af specifikke agent-systemer, temperaturer og værktøjer – ikke bare modelvægtene. Vægtene er …
Opfølgning: State-of-the-art GGUFs til Qwen3.8-27B – 2,5-3,0 bpw
… 2,75 bpw (9,3 GB) matcher endda BF16 i gennemsnit på flere benchmarks [se briefingen 20. august](/archive/2026-08-20).
Google DeepMind piloterer verdens første dobbeltblindede AI-evalueringer
DeepMind afprøver dobbeltblindede tests for at reducere bias i AI-benchmarking. Metoden kan blive ny standard for objektiv modelvurdering.
Terminal-Bench-Science evaluerer AI-agenter på videnskabelige workflows
En ny benchmark tester AI-agenters evne til at udføre reelle forskningsopgaver i terminalen. Målet er at kvantificere, hvor godt AI kan assistere i …
Opfølgning: Ornith 1.5 og Tiel-Coder vinder tool-calling benchmark blandt 35B-A3B-varianter
Fine-tunes af Qwen3.6-35B-A3B slår den originale model og nærmer sig Qwen3.8-27B i tool-eval-bench. [briefingen 25. august …
Opfølgning: Ox Alpha – mysteriet fortsætter, spekulationer om kinesisk oprindelse
Ox Alpha er fortsat gratis og slår Claude Fable på kodning, men identiteten forbliver ukendt – Xiaomi og DeepSeek er blevet afskrevet som kilder. [briefingen …
Opfølgning: Ornith 1.5 slår Qwen 3.8 og Muse Glimmer i benchmark
En community-sammenligning viser, at Ornith-1.5-35B-A3B klarer sig bedst blandt flere MoE-modeller – TielCoder kan være endnu stærkere på kodning.
Opfølgning: $100 benchmark af Qwen3.8-27B quants
En bruger planlægger at bruge $100 på cloud-GPU'er for at teste kvantiseringsniveauer, KV-cache-præcision og kontekst-afvejninger på Qwen3.8-27B.
Opfølgning: PowerColor R9700 til Qwen 3.8 27B – reelle tok/s efterlyses
… Q4_K_XL og spørger efter reelle tok/s ved 64K+ kontekst, ikke kun kolde benchmarks. Se [briefingen 15. august](/archive/2026-08-15).
Opfølgning: Atomic Dynamic-quants af Qwen 3.8 27B testet på RTX 6000
Et team har lavet og benchmarked Atomic Dynamic GGUF-quants af Qwen 3.8 27B – Q4, Q5, Q6 og Q8 – på en RTX 6000 …
Qwen 3.8 27B vs. Opus 5: 39.000 linjer C til HTML-port
En udvikler testede Qwen 3.8 27B mod Opus 5 på at porte et 39.000-linjers C-spil til single-file HTML/three …
Opfølgning: Q8-kvant Qwen 3.8 27B slår BF16 Qwen 3.6 i kodning
Grundig benchmark viser, at Q8 Qwen 3.8 27B overgår BF16 Qwen 3.6 på instruktionsfølgning og 280k kontekst – men har initiale udfordringer med …
Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test
Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på …
Qwen 3.8 Low og Medium knuser benchmarks – over-tænkning var ikke nødvendig
Artificial Analysis viser, at de lavere reasoning-presets leverer konkurrencedygtige scores, hvilket bekræfter, at modellens styrke ikke kun skyldes over-tænkning. [Se tidligere dækning …
Opfølgning: Benchmark-kaos – GLM-5.3 resultater diskuteres
Reddit-bruger påpeger, at benchmark-scoren for GLM-5.3 er ude af proportioner. [briefingen 19. august](/archive/2026-08-19).
Fine-tuning af Cactus Needle 2 matcher DeepSeek v4 på specifikke opgaver
Henry fra Cactus viser, at Needle 2 efter finjustering overgår DeepSeek v4 Flash på afgrænsede opgaver – men advarer mod overfitting.
Opfølgning: Ornith-1.5-familien slår Claude Opus 4.8 på flere benchmarks
Ornith-1.5 fås i 9B, 35B MoE og 397B MoE og opnår state-of-the-art blandt open-source modeller. Modellerne er selvforbedrende …
Qwen3.8-27B klarer sig dårligt på SlopCodeBench – god som copilot, ikke alene
Modellen scorer kun 17,6 % på strenge checkpoints og 13,3 % på sværere delmængder. Den kan løse problemer med klar retning, men ikke styre …
Opfølgning: Z.AI's GLM-5.3 overgår amerikanske modeller i cybersikkerhed – udgivelse forsinket
Det kinesiske open-weight-model GLM-5.3 slår benchmarks, men udgivelsen er udskudt efter uventede hacking-evner. [briefingen 11. august](/archive/2026-08 …
Opfølgning: GLM-5.3 benchmarkresultater offentliggjort – konkurrencedygtig med topmodeller
Artificial Analysis viser, at GLM-5.3 præsterer stærkt på tværs af standardtest. [briefingen 18. august](/archive/2026-08-18)
Opfølgning: Ling-3.0 (BailingMoE3) understøttes nu officielt i llama.cpp
PR #26608 er merged, og GGUF-kvantiseringer er tilgængelige – benchmarks på Intel Arc B580 viser 114 tk/s. [briefingen 17. august](/archive/2026-08 …
Qwen 3.8 27B matcher GPT-5.6 Luna – på en brøkdel af parametrene
Qwen 3.8 27B scorer 52 på Artificial Analysis Intelligence Index, samme score som GPT-5.6 Luna (max) og kun ét point efter …
Opfølgning: Reddit benchmarker quants – "vi benchmarker modeller ingen kører"
En tråd påpeger at Qwen 3.8s imponerende benchmarks gælder uquantiserede modeller, mens næsten alle kører en eller anden quant. Kl-divergens er en …
Lokal agentic coding benchmark: Qwen 3.8 27B medium reasoning er sweet spot
En omfattende benchmark viser at medium reasoning mode i Qwen 3.8 27B giver højest score med markant færre tokens end xhigh mode. Kører …
ROCm 7.14 i llama.cpp giver 50% hurtigere prompt-processing på Radeon 780M
… til ROCm 7.14 tilføjer officiel understøttelse af Radeon 780M iGPU. Benchmarks viser markant forbedring for tætte modeller sammenlignet med Vulkan, men MoE-modeller …
Opfølgning: Qwen3.8-27B matcher Claude 4.6 fra for seks måneder siden
Qwen3.8-27B præsterer på niveau med Claude 4.6 fra februar, men halter bag Opus 4.7/4.8 og Mythos. En 27B …