News-Tracker

søndag 23. august 2026

AI & LLM · daglig briefing


hent mp3
Manuskript
Godmorgen, her er dagens AI-overblik for mandag 25. august 2026.

Vi starter med nye modeller. En mystisk model ved navn Ox Alpha er dukket op på OpenRouter og overgår angiveligt topmodeller som GPT-5.6 Sol og Claude Fable 5 i kodning. Skaberen er ukendt, og modellen er i stealth-preview, ifølge Business Insider.

Og så til en opfølgning: Qwen 3.8 27B bliver kaldt en game changer. Udviklere rapporterer, at den kørende lokalt leverer OCR-kvalitet bedre end Gemini 3.5 Flash Lite. Modellen matcher frontier-modeller fra for et år siden og får teams til at overveje egen hardware, da investeringen kan tjene sig hjem på to måneder.

Liquid AI forbereder en 100 milliarder parameters model. De er kendt for de hurtigste LLM-arkitekturer og varsler via en afstemning på X en kommende 100 milliarders LFM-model. Community venter spændt på en potentiel topmodel.

Videre til forskning og arkitektur. En bruger spørger, om man kan destillere DeepSeek V4 Flash på en klynge med to Asus GX10 for at forbedre Nemotron 3.5 Lightning. Spørgsmålet åbner debat om praktisk anvendelighed af destillering på consumer-hardware.

En anden bruger spørger, om man med Qwen 3.8 27B på én GPU kan få en 64k-agent til at håndtere 300k-opgaver via rekursiv splitning af børneagenter. Prime Agent, RLM og Hermes-delegering nævnes som relevante rammeværktøjer.

En ny idé undersøger bløde reversible transformationer i reasoning. Cyklisk konsistens giver fejldetektion uden ekstra model, og billig backtracking bliver mulig.

Kort nyt: En ny rapport viser, at cyberkriminelle operacionaliserer indirekte prompt injection i praktiske angreb. Sikkerhedsråd fra NCSC lægger vægt på test af beredskabsplaner og brug af attacksimulering.

Så til værktøjerne. En bruger udvider sin 16x DGX Spark-klynge til 36 enheder med 4,6 terabyte unified memory og splitter den i dedikerede inferensmoduler. Seksten noder kører Kimi K3, resten varetager rerank, video- og billedgenerering samtidigt.

En anden bruger fintuner Gemma 4 12B på en enkelt 16 gigabyte GPU og opnår 2,7 gange forbedring på tool calling samt 15,7 procent flere værktøjsopkald. Vægtene er tilgængelige til llama.cpp og Ollama.

En grundig benchmark viser, at Q8 Qwen 3.8 27B overgår BF16 Qwen 3.6 på instruktionsfølgning og 280k kontekst. Muse Glimmer erklæres forældet som kodemodel.

En bruger efterspørger den bedste harness til lange autonome opgaver med auto-kompaktion og hukommelsessystem.

Trods forventning om kun q2-kvanter lykkes det en bruger at køre DeepSeek V4 Flash i 4-bit med acceptable tokens per sekund på en opsætning med to RTX 3090 og DDR5 RAM.

En bruger søger en bittesmå model til at komprimere lang kontekst genereret af Qwen 3.8 27B i xhigh-thinking mode. Spørgsmålet peger på et voksende behov for dedikerede kompressionsmodeller til lokale agenter.

En bruger forsøger at skabe en TTS-stemme til genererede videoer af egne høns, baseret på deres faktiske stemmemønstre. Eksisterende voice match-apps kræver menneskestemmer, så løsningen er endnu ukendt.

Tre dages benchmarking viser DFlash 2 alene giver 2,26 gange speedup på LiveCodeBench, og op til 4,68 gange med ét n-gram lookup. N-gram hjælper på byggefasen, men skader prosatekst.

En bruger deler en ny fork af llama.cpp optimeret til AMD GFX906 via GCN HIP. Forbedringen gør det muligt at køre lokale LLMer på ellers overset AMD-hardware.

Og så til stemmerne. Sebastian Raschka gennemgår, hvordan Claude vandmærker AI-genereret tekst via token-sampling, detektion og fjernelse. Zvi Mowshowitz argumenterer for, at tekstvandmærkning er en gratis gevinst for AI-sikkerhed.

Endelig til branche og politik. Nvidias kvartalsregnskab ventes i denne uge, og både investorer og AI-skeptikere følger med. Samtidig spår The Motley Fool, at en anden AI-chipaktie kan overgå Nvidia over tre år.

Dagens signal: Community-drevet innovation på lokalt hardware accelererer hurtigere end de fleste forventer med nye modeller, fintuningteknikker og speculative decoding-løsninger der smelter frontier-præstation ned i consumer-klassen.

Det var alt for i dag.

Ingen væsentlige nyheder i de seneste 36 timer. Kilderne er tjekket, men der var intet nyt at rapportere.

Nye modeller

Mysterie-modellen Ox Alpha slår GPT-5.6 Sol og Claude Fable 5 i kodning

En anonym model kaldet Ox Alpha er dukket op på OpenRouter og overgår angiveligt topmodeller som GPT-5.6 Sol og Claude Fable 5. Skaberen er ukendt, og modellen er i stealth-preview.

Kilder: Pluang · Business Insider · Cryptobriefing

ox-alphacodingopenroutergpt-5.6-solclaude-fable-5

Opfølgning: Qwen 3.8 27B er "en game changer" – overgår Gemini 3.5 Flash Lite til OCR

opfølgning på 18. august

Udviklere rapporterer, at Qwen 3.8 27B kørende lokalt leverer OCR-kvalitet bedre end Gemini 3.5 Flash Lite. Modellen matcher frontier-modeller fra for et år siden og får teams til at overveje egen hardware, da investeringen kan tjene sig hjem på to måneder. Se forrige omtale.

Kilder: r/LocalLLaMA

qwen3.8-27bopen-weightslocal-llmocr

Liquid AI forbereder 100B-model – hurtigste arkitektur?

Liquid AI, kendt for de hurtigste LLM-arkitekturer og stærke SLM’er, varsler via en afstemning på X en kommende 100B-parameter LFM-model. Community venter spændt på en potentiel topmodel.

Kilder: r/LocalLLaMA

liquid-ai100blfmlarge-language-model

Forskning & arkitektur

Kan DeepSeek V4 Flash destilleres på Nemotron 3.5 Lightning?

En bruger på r/LocalLLaMA spørger, om man kan destillere DeepSeek V4 Flash 0731 på en 2x Asus GX10-klynge for at forbedre Nemotron 3.5 Lightning. Spørgsmålet åbner debat om praktisk anvendelighed af distilling på consumer-hardware.

Kilder: r/LocalLLaMA

distillationdeepseek-v4-flashnemotron-3.5-lightninglocal-llm

Kan 64k kontekst føles som 300k med rekursive lokale agenter?

En bruger spørger, om man med Qwen 3.8 27B på én GPU kan få en 64k-agent til at håndtere 300k-opgaver via rekursiv splitning af børneagenter. Prime Agent, RLM og Hermes-delegering nævnes som relevante rammeværktøjer.

Kilder: r/LocalLLaMA

context-managementrecursive-agentsqwen3.8-27blocal-llm

Hvad hvis Chain-of-Thought var reversibelt?

En ny idé undersøger bløde reversible transformationer (Toffoli/Fredkin) i reasoning: cyklisk konsistens giver fejldetektion uden ekstra model, Bennett-stil uncomputation kan reducere KV-cache fra O(N) til O(log N), og billig backtracking bliver mulig.

Kilder: r/LocalLLaMA

chain-of-thoughtreversible-logickv-cachelocal-llm

Sikkerhed & jailbreaks

Opfølgning: Kriminelle indfører indirekte prompt injection i angrebskæder

opfølgning på 21. august

Ny rapport viser, at cyberkriminelle operacionaliserer indirekte prompt injection (IDPI) i praktiske angreb. Sikkerhedsråd fra NCSC lægger vægt på test af beredskabsplaner og brug af attacksimulering. Se briefingen i går for baggrund om krypterede prompts.

Kilder: InfoSec Today · ICO Optics · laynemcdonald.com · TechMarketView

indirect-prompt-injectionidpiprompt-injectionncsc

Værktøjer & produkter

The All Spark: Fra 16 til 36 DGX Sparks i ét homelab-rack

En bruger udvider sin 16x DGX Spark-klynge til 36 enheder (4,6 TB unified memory) og splitter den i dedikerede inferensmoduler. 16 noder kører Kimi K3, resten varetager rerank, video- og billedgenerering samtidigt.

Kilder: r/LocalLLaMA

dgx-sparkhomelablocal-llmagent-cluster

Fintunet Gemma 4 12B giver 2,7x forbedring på tool calling

En bruger fintuner Gemma 4 12B på en enkelt 16 GB GPU og opnår 2,7x forbedring på tool calling samt 15,7 % flere værktøjsopkald. Vægtene (fp16 → Q4_K_M) er tilgængelige til llama.cpp og Ollama.

Kilder: r/LocalLLaMA

gemma-4-12bfine-tuningtool-callinglocal-llm

Opfølgning: Q8-kvant Qwen 3.8 27B slår BF16 Qwen 3.6 i kodning

opfølgning på 11. august

Grundig benchmark viser, at Q8 Qwen 3.8 27B overgår BF16 Qwen 3.6 på instruktionsfølgning og 280k kontekst – men har initiale udfordringer med at følge nye forbedringer. Muse Glimmer erklæres forældet som kodemodel. Se tidligere omtale.

Kilder: r/LocalLLaMA

qwen3.8-27bcodingquantcontextqwen3.6-27b

Opfølgning: Hvilken harness til lange autonome opgaver?

opfølgning på 16. august

En bruger efterspørger den bedste harness til lange autonome opgaver med auto-kompaktion og hukommelsessystem – inspireret af posts om Qwen 3.8 27B, der automatisk bygger spil over 24 timer. Se tidligere tråd.

Kilder: r/LocalLLaMA

harnessautonomous-tasksqwen3.8-27bmemory

Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM

opfølgning på 9. august

Trods forventning om kun q2-kvanter lykkes det en bruger at køre DeepSeek V4 Flash i 4-bit+ med acceptable tokens/s på en opsætning med 2x RTX 3090 og DDR5 RAM. Se tidligere dækning.

Kilder: r/LocalLLaMA

deepseek-v4-flashquantlocal-llmllama.cpp

Hvilken lille model til sessionskompression?

En bruger søger en bittesmå model (fx Qwen 3.5 0.8B) til at komprimere lang kontekst genereret af Qwen 3.8 27B i xhigh-thinking mode. Spørgsmålet peger på et voksende behov for dedikerede kompressionsmodeller til lokale agenter.

Kilder: r/LocalLLaMA

session-compressiontiny-modelhermesqwen-3.5-0.8b

Skab TTS-stemme fra rigtige kyllingelyde

En bruger forsøger at skabe en TTS-stemme til genererede videoer af egne høns, baseret på deres faktiske “stemmemønstre”. Eksisterende voice match-apps kræver menneskestemmer, så løsningen er endnu ukendt.

Kilder: r/LocalLLaMA

ttsvoice-cloninganimalsvideo-generation

Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test

opfølgning på 19. august

Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på byggefasen, men skader prosatekst. Se forrige omtale.

Kilder: r/LocalLLaMA

dflash2speculative-decodingqwen3.8-27bllama.cpplivecodebench

AMD GFX906 får optimeret llama.cpp-fork

En bruger deler en ny fork af llama.cpp optimeret til AMD GFX906 (Mi50, Mi60, Radeon VII) via GCN HIP. Forbedringen gør det muligt at køre lokale LLM’er på ellers overset AMD-hardware.

Kilder: r/LocalLLaMA

llama.cppamdgfx906hipfork

🗣️ Stemmer

Sebastian Raschka og Zvi Mowshowitz: AI-vandmærkning af tekst er gratis og godt

Sebastian Raschka gennemgår, hvordan Claude vandmærker AI-genereret tekst via token-sampling, detektion og fjernelse. Zvi Mowshowitz argumenterer for, at tekstvandmærkning er en gratis gevinst for AI-sikkerhed.

Kilder: Ahead of AI · Zvi Mowshowitz

watermarkingclaudeai-textzvi-mowshowitz

Branche & politik

Nvidia indberetter regnskab – markedet holder vejret

Nvidias kvartalsregnskab ventes i denne uge, og både investorer og AI-skeptikere følger med. Samtidig spår The Motley Fool, at en anden AI-chipaktie kan overgå Nvidia over tre år.

Kilder: Finimize · The Motley Fool

nvidiawarningsemiconductorsinvestors

Dagens signal: Community-drevet innovation på lokalt hardware accelererer hurtigere end de fleste forventer – med nye modeller, fintuningteknikker og speculative decoding-løsninger der smelter frontier-præstation ned i consumer-klassen.

Modeller

Ny i HF-trending

Se hele listen