News-Tracker

Søgning

AI & LLM · daglig briefing


4 research-rapport(er) for »claude-5.1«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan …

fredag 7. august 2026 · research

Qwen 3.8 27b

… against Claude Code for me](https://www.reddit.com/r/LocalLLM/comments/1t3pjkn/qwen3627b_is_the_first_local_model_that_actually/) 13. [5 Bedste …

mandag 3. august 2026 · research

Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?

… model Claude's coding, agentic abilities with Opus 4.5](https://finance.yahoo.com/news/anthropic-bolsters-ai-model-claudes-190359419.html) 5. [OpenAI …

torsdag 30. juli 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Den scorer 77,2% på SWE-bench Verified (april 2026), matcher Claude 4.5 Opus på Terminal-Bench, og kører på en enkelt 16

torsdag 30. juli 2026 · research

12 briefing-resultat(er) for »claude-5.1«

Opfølgning: GPT-6, Fable 5.1 og flere rogue agent-angreb

… GPT-6 Astra, Claude Fable 5.1 og nye tilfælde af rogue agenter. Han viser, hvordan prompt-ændringer kan sammenlignes via GitHub-diffs. [Se …

tirsdag 8. september 2026 · 🗣️ Stemmer gpt-6claude-fable-5.1rogue-agentprompt-diffs

Lokale open source-modeller finder 10 ud af 12 sikkerhedshuller

… open source-modeller som DeepSeek-V4 og GLM-5.1 fandt næsten alle fejl, hvorimod Claude Opus 5 fandt 0 ud af 8.

tirsdag 8. september 2026 · Sikkerhed & jailbreaks cybersecurityopen-source-modelsdeepseek-v4glm-5.1

Opfølgning: Zvi graver i Claude Fable 5.1's system card

Zvi Mowshowitz gennemgår system card for Fable 5.1 og Mythos 5.1 og kalder Fable 5.1 den mest kapable offentligt tilgængelige model …

søndag 6. september 2026 · 🗣️ Stemmer claude-fable-5.1claude-mythos-5.1anthropic

Modeltsunami: Ti nye modeller fra Google, OpenAI, Alibaba og Anthropic

… Gemini 3.8 Flash, Qwen3.8-serien, GPT-6 Astra og Claude 5.1. Markedet har fået flere generationsskift på få uger.

lørdag 5. september 2026 · Nye modeller model-roundupgpt-6-astraclaude-5.1qwen-3.8

Opfølgning: Anthropic lancerer Claude Fable 5.1 og Mythos 5.1

Fable 5.1 opnår 52,6% på Terminal-Bench-Science, får 1M kontekstvindue og 75% billigere cache-læsninger, mens Mythos 5.1 forbliver begrænset …

onsdag 2. september 2026 · Nye modeller claude-fable-5.1claude-mythos-5.1terminal-benchcache-reads

Opfølgning: Ornith-1.5-familien slår Claude Opus 4.8 på flere benchmarks

Ornith-1.5 fås i 9B, 35B MoE og 397B MoE og opnår state-of-the-art blandt open-source modeller. Modellerne er selvforbedrende …

torsdag 20. august 2026 · Nye modeller ornith-1.5open-weightsmoedeepseek

Opfølgning: Qwen3.8-27B matcher Claude 4.6 fra for seks måneder siden

Qwen3.8-27B præsterer på niveau med Claude 4.6 fra februar, men halter bag Opus 4.7/4.8 og Mythos. En 27B …

søndag 16. august 2026 · Nye modeller qwen3.8-27bopen-weightsclaude-opusbenchmark

Nyt papir: Krypterede reasoning-traces fra GPT-5.6 og Claude kan stjæles – og dekrypteres via svagere modeller

Forskere har vist, at de krypterede "chain-of-thought"-blokke fra OpenAI, Anthropic og Google kan genses i svagere modeller fra samme familie og …

onsdag 12. august 2026 · Sikkerhed & jailbreaks reasoning-tracesjailbreakchain-of-thoughtencryption

Opfølgning: Karpathys Ringenes Herre-test viser, hvordan AI-benchmarks har ændret sig

Andrej Karpathy fik Claude Opus 5 til at bygge en 3D-verden af Ringenes Herre på to timer for 10 dollars – 5.500 linjer …

tirsdag 4. august 2026 · 🗣️ Stemmer karpathyclaude-opus-5coding-benchmarkslord-of-the-rings

Andrej Karpathy: Claude Opus 5 bygger 3D-verden af Ringenes Herre for 10 dollars

Karpathy gav modellen første afsnit af LOTR og et 1M token-budget. Resultatet kalder han "mind-boggling" – AI er forbi simple prompts.

mandag 3. august 2026 · 🗣️ Stemmer karpathyclaude-opus-5lord-of-the-rings

Kimi K3: Verdens største open-weight model er her

Moonshot AI har lanceret Kimi K3 med 2,8 billioner parametre, som slår Claude Fable og GPT-5.6 Sol på flere benchmarks. Modellen …

lørdag 18. juli 2026 · Nye modeller kimi-k3moonshotopen-weightschina

Kimi K3 slår Claude Sonnet 5 på Simple Bench

Kimi K3 (max) har demonstreret overlegen performance ved at slå Claude Sonnet 5 på Simple Bench. Resultatet understøtter Moonshot AI's påstande om, at …

fredag 17. juli 2026 · Nye modeller kimi-k3benchmarkmoonshot-ai