News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »opus-5«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan …

fredag 7. august 2026 · research

Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?

… 2026-07-24) bringer en neutral til positiv tone, der gengiver Anthropics egen framelding: "The company is framing Opus 5 as the go-to …

torsdag 30. juli 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Den scorer 77,2% på SWE-bench Verified (april 2026), matcher Claude 4.5 Opus på Terminal-Bench, og kører på en enkelt 16 …

torsdag 30. juli 2026 · research

14 briefing-resultat(er) for »opus-5«

Lokale open source-modeller finder 10 ud af 12 sikkerhedshuller

… open source-modeller som DeepSeek-V4 og GLM-5.1 fandt næsten alle fejl, hvorimod Claude Opus 5 fandt 0 ud af 8.

tirsdag 8. september 2026 · Sikkerhed & jailbreaks cybersecurityopen-source-modelsdeepseek-v4glm-5.1

Claude Code Auto Mode kan brydes – sikkerhedsmekanismen blokerede selv rensningen

Johann Rehberger viser et angreb mod Claude Codes auto mode, der virker i 80% af tilfældene. Værre: auto mode forhindrede Claude i at stoppe …

lørdag 29. august 2026 · 🗣️ Stemmer claude-codeopus-5prompt-injectionsandbox

Rens dine støvbunnyer – Qwen 3.5 Opus kræver vedligeholdelse

En bruger på r/LocalLLaMA deler et humoristisk indlæg om, at Qwen 3.5 Opus 4.6 distilled bad om "maintenance" – med billede af …

mandag 24. august 2026 · Værktøjer & produkter hardwaredustmaintenanceqwen

Qwen 3.8 27B vs. Opus 5: 39.000 linjer C til HTML-port

En udvikler testede Qwen 3.8 27B mod Opus 5 på at porte et 39.000-linjers C-spil til single-file HTML/three …

mandag 24. august 2026 · Forskning & arkitektur qwen3.8-27bcodingc-to-htmlbenchmark

Opfølgning: Ornith-1.5-familien slår Claude Opus 4.8 på flere benchmarks

Ornith-1.5 fås i 9B, 35B MoE og 397B MoE og opnår state-of-the-art blandt open-source modeller. Modellerne er selvforbedrende …

torsdag 20. august 2026 · Nye modeller ornith-1.5open-weightsmoedeepseek

Opfølgning: Qwen3.8-27B matcher Claude 4.6 fra for seks måneder siden

Qwen3.8-27B præsterer på niveau med Claude 4.6 fra februar, men halter bag Opus 4.7/4.8 og Mythos. En 27B …

søndag 16. august 2026 · Nye modeller qwen3.8-27bopen-weightsclaude-opusbenchmark

Opfølgning: Qwen 3.8 Max topper agentic benchmark

Alibaba-modellen er nu nummer ét på Artificial Analysis' agentic index foran Opus 5 – et tegn på, at agentiske evner ikke længere er forbeholdt …

fredag 7. august 2026 · Nye modeller qwen3-8-maxagentic-indexartificial-analysisopus-5

Opfølgning: DeepSeek V4 Flash 2-bit kvant opnår 100% i SQL-benchmark

… Kun Opus 4.7 og GPT-5.5 har tidligere klaret det. [Se tidligere briefingen](/archive/2026-08-01)

onsdag 5. august 2026 · Forskning & arkitektur deepseek-v4-flash2-bit-quantsql-benchmarklocal-llm

Opfølgning: Karpathys Ringenes Herre-test viser, hvordan AI-benchmarks har ændret sig

Andrej Karpathy fik Claude Opus 5 til at bygge en 3D-verden af Ringenes Herre på to timer for 10 dollars – 5.500 linjer …

tirsdag 4. august 2026 · 🗣️ Stemmer karpathyclaude-opus-5coding-benchmarkslord-of-the-rings

Andrej Karpathy: Claude Opus 5 bygger 3D-verden af Ringenes Herre for 10 dollars

Karpathy gav modellen første afsnit af LOTR og et 1M token-budget. Resultatet kalder han "mind-boggling" – AI er forbi simple prompts.

mandag 3. august 2026 · 🗣️ Stemmer karpathyclaude-opus-5lord-of-the-rings

Opfølgning: Brugere på r/LocalLLaMA så tvivl om benchmarks – Gemma 4 imponerer i praksis

Flere brugere rapporterer, at Gemma 4 26B klarer sig bedre end Gemini 3.5 Flash og Claude Opus 5 i virkelige opgaver som e …

fredag 31. juli 2026 · 🗣️ Stemmer gemma-4benchmarkliabilitylocal-llm

Opfølgning: OpenAI's sandbox-flugt og open-weight-kampen fortsætter

… Claude Opus 5 præger samtidig ugens modelkapløb. [briefingen 25. juli](/archive/2026-07-25)

mandag 27. juli 2026 · Sikkerhed & jailbreaks openaisandbox-escapehugging-facesecurity-test

Kimi K3 finder sikkerhedsbugs som GPT-5.6 og Claude Opus 4.8 overså

En udvikler lod Kimi K3 reviewe sit post-kvante-kryptografi-projekt – modellen fandt fem reelle fejl, som andre frontier-modeller havde misset. Eksemplet understreger …

tirsdag 21. juli 2026 · Forskning & arkitektur kimi-k3cryptographyauditingreddit