News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »claude-opus«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan …

fredag 7. august 2026 · research

Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?

… 2025-11-24) har kodning som hovedtema: "Anthropic unveiled an upgraded Opus model on Monday, boosting Claude's ability to write detailed code, create …

torsdag 30. juli 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Den scorer 77,2% på SWE-bench Verified (april 2026), matcher Claude 4.5 Opus på Terminal-Bench, og kører på en enkelt 16 …

torsdag 30. juli 2026 · research

10 briefing-resultat(er) for »claude-opus«

Lokale open source-modeller finder 10 ud af 12 sikkerhedshuller

… open source-modeller som DeepSeek-V4 og GLM-5.1 fandt næsten alle fejl, hvorimod Claude Opus 5 fandt 0 ud af 8.

tirsdag 8. september 2026 · Sikkerhed & jailbreaks cybersecurityopen-source-modelsdeepseek-v4glm-5.1

Claude Code Auto Mode kan brydes – sikkerhedsmekanismen blokerede selv rensningen

Johann Rehberger viser et angreb mod Claude Codes auto mode, der virker i 80% af tilfældene. Værre: auto mode forhindrede Claude i at stoppe …

lørdag 29. august 2026 · 🗣️ Stemmer claude-codeopus-5prompt-injectionsandbox

Opfølgning: Ornith-1.5-familien slår Claude Opus 4.8 på flere benchmarks

Ornith-1.5 fås i 9B, 35B MoE og 397B MoE og opnår state-of-the-art blandt open-source modeller. Modellerne er selvforbedrende …

torsdag 20. august 2026 · Nye modeller ornith-1.5open-weightsmoedeepseek

Opfølgning: Qwen3.8-27B matcher Claude 4.6 fra for seks måneder siden

Qwen3.8-27B præsterer på niveau med Claude 4.6 fra februar, men halter bag Opus 4.7/4.8 og Mythos. En 27B …

søndag 16. august 2026 · Nye modeller qwen3.8-27bopen-weightsclaude-opusbenchmark

Opfølgning: Karpathys Ringenes Herre-test viser, hvordan AI-benchmarks har ændret sig

Andrej Karpathy fik Claude Opus 5 til at bygge en 3D-verden af Ringenes Herre på to timer for 10 dollars – 5.500 linjer …

tirsdag 4. august 2026 · 🗣️ Stemmer karpathyclaude-opus-5coding-benchmarkslord-of-the-rings

Andrej Karpathy: Claude Opus 5 bygger 3D-verden af Ringenes Herre for 10 dollars

Karpathy gav modellen første afsnit af LOTR og et 1M token-budget. Resultatet kalder han "mind-boggling" – AI er forbi simple prompts.

mandag 3. august 2026 · 🗣️ Stemmer karpathyclaude-opus-5lord-of-the-rings

Opfølgning: Brugere på r/LocalLLaMA så tvivl om benchmarks – Gemma 4 imponerer i praksis

Flere brugere rapporterer, at Gemma 4 26B klarer sig bedre end Gemini 3.5 Flash og Claude Opus 5 i virkelige opgaver som e …

fredag 31. juli 2026 · 🗣️ Stemmer gemma-4benchmarkliabilitylocal-llm

Opfølgning: OpenAI's sandbox-flugt og open-weight-kampen fortsætter

Claude Opus 5 præger samtidig ugens modelkapløb. [briefingen 25. juli](/archive/2026-07-25)

mandag 27. juli 2026 · Sikkerhed & jailbreaks openaisandbox-escapehugging-facesecurity-test

Kimi K3 finder sikkerhedsbugs som GPT-5.6 og Claude Opus 4.8 overså

En udvikler lod Kimi K3 reviewe sit post-kvante-kryptografi-projekt – modellen fandt fem reelle fejl, som andre frontier-modeller havde misset. Eksemplet understreger …

tirsdag 21. juli 2026 · Forskning & arkitektur kimi-k3cryptographyauditingreddit