Søgning
4 research-rapport(er) for »claude-5.1«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Ifølge [12] scorer modellen 77,2% på SWE-bench Verified og matcher Claude 4.5 Opus på Terminal-Bench, samtidig med at den kan …
Qwen 3.8 27b
… against Claude Code for me](https://www.reddit.com/r/LocalLLM/comments/1t3pjkn/qwen3627b_is_the_first_local_model_that_actually/) 13. [5 Bedste …
Jeg har brugt Claude Opus længe. Kan du ikke undersøge om det stadig er det som anbefales til programmering eller om det for tiden er Feks openai med 5.6 Sol?
… model Claude's coding, agentic abilities with Opus 4.5](https://finance.yahoo.com/news/anthropic-bolsters-ai-model-claudes-190359419.html) 5. [OpenAI …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Den scorer 77,2% på SWE-bench Verified (april 2026), matcher Claude 4.5 Opus på Terminal-Bench, og kører på en enkelt 16 …
12 briefing-resultat(er) for »claude-5.1«
Opfølgning: GPT-6, Fable 5.1 og flere rogue agent-angreb
… GPT-6 Astra, Claude Fable 5.1 og nye tilfælde af rogue agenter. Han viser, hvordan prompt-ændringer kan sammenlignes via GitHub-diffs. [Se …
Lokale open source-modeller finder 10 ud af 12 sikkerhedshuller
… open source-modeller som DeepSeek-V4 og GLM-5.1 fandt næsten alle fejl, hvorimod Claude Opus 5 fandt 0 ud af 8.
Opfølgning: Zvi graver i Claude Fable 5.1's system card
Zvi Mowshowitz gennemgår system card for Fable 5.1 og Mythos 5.1 og kalder Fable 5.1 den mest kapable offentligt tilgængelige model …
Modeltsunami: Ti nye modeller fra Google, OpenAI, Alibaba og Anthropic
… Gemini 3.8 Flash, Qwen3.8-serien, GPT-6 Astra og Claude 5.1. Markedet har fået flere generationsskift på få uger.
Opfølgning: Anthropic lancerer Claude Fable 5.1 og Mythos 5.1
Fable 5.1 opnår 52,6% på Terminal-Bench-Science, får 1M kontekstvindue og 75% billigere cache-læsninger, mens Mythos 5.1 forbliver begrænset …
Opfølgning: Ornith-1.5-familien slår Claude Opus 4.8 på flere benchmarks
Ornith-1.5 fås i 9B, 35B MoE og 397B MoE og opnår state-of-the-art blandt open-source modeller. Modellerne er selvforbedrende …
Opfølgning: Qwen3.8-27B matcher Claude 4.6 fra for seks måneder siden
Qwen3.8-27B præsterer på niveau med Claude 4.6 fra februar, men halter bag Opus 4.7/4.8 og Mythos. En 27B …
Nyt papir: Krypterede reasoning-traces fra GPT-5.6 og Claude kan stjæles – og dekrypteres via svagere modeller
Forskere har vist, at de krypterede "chain-of-thought"-blokke fra OpenAI, Anthropic og Google kan genses i svagere modeller fra samme familie og …
Opfølgning: Karpathys Ringenes Herre-test viser, hvordan AI-benchmarks har ændret sig
Andrej Karpathy fik Claude Opus 5 til at bygge en 3D-verden af Ringenes Herre på to timer for 10 dollars – 5.500 linjer …
Andrej Karpathy: Claude Opus 5 bygger 3D-verden af Ringenes Herre for 10 dollars
Karpathy gav modellen første afsnit af LOTR og et 1M token-budget. Resultatet kalder han "mind-boggling" – AI er forbi simple prompts.
Kimi K3: Verdens største open-weight model er her
Moonshot AI har lanceret Kimi K3 med 2,8 billioner parametre, som slår Claude Fable og GPT-5.6 Sol på flere benchmarks. Modellen …
Kimi K3 slår Claude Sonnet 5 på Simple Bench
Kimi K3 (max) har demonstreret overlegen performance ved at slå Claude Sonnet 5 på Simple Bench. Resultatet understøtter Moonshot AI's påstande om, at …