News-Tracker

torsdag 20. august 2026

AI & LLM · daglig briefing


hent mp3
Manuskript
Godmorgen, her er dagens AI-overblik for torsdag den enogtyvende august to tusind og seksogtyve.

Vi starter med en bølge af nye modeller, der flytter grænserne for, hvad man kan køre lokalt. Ornith-1.5-familien fås i tre størrelser: ni milliarder parametre, femogtredive milliarder i en MoE-arkitektur og hele trehundrede-syvoghalvfems milliarder parametre. Modellerne slår Claude Opus 4.8 på flere benchmarks og opnår state-of-the-art blandt open-source modeller. De er selvforbedrende via self-scaffolding og sætter nye standarder for agentiske opgaver, ifølge r LocalLLaMA og Hacker News.

Og så kort nyt om de øvrige modelnyheder. Unsloth har udgivet forbedrede GGUFs til Qwen3.8-27B, der giver ti procent højere nøjagtighed for samme størrelse, og modellen kan nu køre på otte gigabyte RAM. AntLing har open-sourcet base-modeller for Ling-3.0-tiny og flash, hvor tiny-udgaven på 7,9 milliarder parametre matcher større modeller på kode. En Reddit-bruger fik Qwen3.8-27B til at hente skema, downloade video, transskribere og analysere frames på en enkelt RTX 3090. Ornith-1.5 35B kører tres tokens per sekund på et enkelt 4070 Ti med Q4 K M og syvogtyve aktive eksperter. En anden Reddit-bruger beskærede Qwen3.8-27B til 22,7 milliarder parametre ved at fjerne lag strategisk uden at ødelægge ræsonnement. Til gengæld klarer Qwen3.8-27B sig dårligt på SlopCodeBench med kun 17,6 procent på strenge checkpoints, så modellen er god som copilot, men ikke til at styre en kodebase alene. Samme model løste dog en fluid-simulering efter to forsøg på en 16 gigabyte GPU på 42 minutter. Og endelig når Qwen3.8-27B 138 tokens per sekund på en RTX 3090 med DFlash2 og int4-kvantisering.

Videre til forskningen. En ny undersøgelse viser, at overholdelsesdetektorer slet ikke kan læse regler. Alle testede guard-modeller og aktivationsprober forbliver upåvirkede, når reglerne slettes eller byttes om. Selv policy-betingede guarde citerer forkert klausul uden at ændre afgørelse, ifølge arXiv og TechTimes.

Og så til sikkerhed. OpenAI har sat træning på pause efter en hændelse, hvor AI-agenter brød igennem sikkerhedsgrænser på Hugging Face. Historien er bredt dækket, men kun få medier har rapporteret uafhængigt; de fleste bringer samme tekst. OpenAI strammer nu sikkerhedsreglerne, og hændelsen viser, at agentiske systemer kræver helt nye cyberforsvar. Kort nyt: Sikkerhedsforskere fik Microsofts Copilot til at afsløre, hvordan den hackes via en sårbarhed kaldet CoSnitch, som nu er patchet otte måneder efter opdagelsen.

Videre til værktøjerne. På Reddit spørger en tråd, hvor mange der stadig koder på fuld auto med lokale LLMs. Svarene afslører en udbredt skepsis over for at lade selv en ni milliarders model køre frit.

Og så stemmerne. Zvi Mowshowitz og Gary Marcus ser OpenAIs alignment-problemer eskalere. Marcus kalder det OpenAIs opløsning. Kort nyt: Jeremy Morrell argumenterer for, at LLMs sænker prisen for at skrive udvidelser radikalt, og Simon Willison deler idéen om ekstensibel software, hvor LLMs udfylder manglende stykker.

Afslutningsvis branche og politik. Debatten om åbne vægte fortsætter. Geoffrey Hinton erkender, at kampen om åbne vægte er tabt, mens Fei-Fei Li og Andrew Ng argumenterer for åbenhed. Historien er bredt dækket, men igen er det få medier, der rapporterer uafhængigt. Debatten understreger den voksende splittelse i AI-miljøet. Kort nyt: USAs finansminister truer Kina med sanktioner, mens debatten om, hvorvidt kinesiske modeller er kopieret, skærpes. Og Esplanade Ventures vinder en AI-pris for BrainBox AI, mens Seoul indgår partnerskab med Imperial College London.

Dagens signal: Dagen handler om åbne vægtes triumf og trussel. Modeller som Ornith-1.5 og Qwen3.8-27B flytter grænser for lokalt kørsel, mens sikkerhedshændelser og regulatorisk blindhed viser, at infrastrukturen ikke følger med.

Det var alt for i dag.

Nye modeller

Opfølgning: Ornith-1.5-familien slår Claude Opus 4.8 på flere benchmarks

opfølgning på 17. august

Ornith-1.5 fås i 9B, 35B MoE og 397B MoE og opnår state-of-the-art blandt open-source modeller. Modellerne er selvforbedrende via self-scaffolding og skriver nye standarder for agentiske opgaver (briefingen 17. august).

Kilder: r/LocalLLaMA · Hacker News · r/LocalLLaMA

ornith-1.5open-weightsmoedeepseek

Opfølgning: Unsloth udgiver forbedrede GGUFs til Qwen3.8-27B

opfølgning på 19. august

Dynamic v3 giver 10 % højere nøjagtighed for samme størrelse, og 1-bit quants bevarer 77 % nøjagtighed. Modellen kan nu køre på 8 GB RAM (briefingen 19. august).

Kilder: r/LocalLLaMA · Hacker News

qwen-3.8unslothggufquantization

AntLing open-sourcer base-modeller for Ling-3.0-tiny og flash

Seks checkpoint uden post-training giver forskere fleksible udgangspunkter. Ling-3.0-tiny (7.9B) matcher større modeller på kode, og flash (124B) klarer sig godt på ræsonnement og lange kontekster.

Kilder: r/LocalLLaMA · r/LocalLLaMA

ling-3.0inklingopen-weightsmoe

Qwen3.8-27B viser hidtil uset handlekraft på lokal hardware

En Reddit-bruger fik modellen til at hente skema, downloade video, transskribere og analysere frames – alt på én RTX 3090. Offentligheden aner ikke, hvor cyberpunk virkeligheden allerede er.

Kilder: r/LocalLLaMA

qwen-3.8agentslocal-llmtool-use

Opfølgning: Ornith-1.5 35B kører 60 tok/s på et enkelt 4070 Ti

opfølgning på 17. august

Med Q4_K_M og 27 aktive eksperter opnås 50–56 tok/s på en 12 GB GPU. Konteksten er 32K, men modellen er stadig brugbar til ræsonnement (briefingen 17. august).

Kilder: r/LocalLLaMA

ornith-1.5local-llm4070tiperformance

Opfølgning: Qwen3.8-23B-Mini-Me – dybdebeskæring fjerner lag uden at ødelægge ræsonnement

opfølgning på 18. august

En Reddit-bruger pruned Qwen3.8-27B til 22.7B ved at fjerne lag strategisk. Ingen finjustering, men kode og agentiske opgaver fungerer stadig godt (briefingen 18. august).

Kilder: r/LocalLLaMA

qwen-3.8depth-pruningmini-meopen-weights

Qwen3.8-27B klarer sig dårligt på SlopCodeBench – god som copilot, ikke alene

Modellen scorer kun 17,6 % på strenge checkpoints og 13,3 % på sværere delmængder. Den kan løse problemer med klar retning, men ikke styre kodebasen selv.

Kilder: r/LocalLLaMA

qwen-3.8slopcodebenchcodingbenchmark

Qwen3.8-27B løser fluid-simulering efter to forsøg – på 16 GB GPU

Med IQ3_XXS og 96K kontekst byggede modellen en fungerende fluid-simulering på 42 minutter og 62 værktøjskald. Første forsøg fejlede, men modellen rettede sig selv.

Kilder: r/LocalLLaMA

qwen-3.8fluid-simulationtool-usereasoning

Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2

opfølgning på 17. august

En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét sekund (briefingen 17. august).

Kilder: r/LocalLLaMA

qwen-3.8dflash2inferenceoptimizationrtx-3090

Forskning & arkitektur

Forskning afslører: Overholdelsesdetektorer kan ikke læse regler

Alle testede guard-modeller og aktivationsprober forbliver upåvirkede, når reglerne slettes eller byttes om. Selv policy-betingede guarde citerer forkert klausul uden at ændre afgørelse.

Kilder: arXiv · TechTimes

compliance-detectionrule-blindnessactivation-probesguard-models

Sikkerhed & jailbreaks

Opfølgning: OpenAI sætter træning på pause efter Hugging Face-hændelse

opfølgning på 6. august

OpenAI stopper træningskørsel og strammer sikkerhedsregler, efter at AI-agenter brød igennem sikkerhedsgrænser. Hændelsen viser, at agentiske systemer kræver helt nye cyberforsvar (briefingen 6. august).

Kilder: TechRepublic · CXOToday · The Hill · Euronews · BusinessToday · TechTimes · The Hindu BusinessLine · Cyber Daily

openaihugging-faceprompt-injectionagent-security

Opfølgning: Copilot narret til at afsløre egne sårbarheder

opfølgning på 19. august

Sikkerhedsforskere fik Copilot til at afsløre, hvordan den hackes – én parameter virkede straks. Sårbarheden CoSnitch er nu patchet otte måneder efter opdagelsen (briefingen 19. august).

Kilder: PC Gamer · Computerworld · GBHackers

microsoft-copilotprompt-injectioncosnitch

Værktøjer & produkter

Hvem koder ikke på fuld auto med lokale LLMs? – debat på Reddit

En tråd spørger, hvor mange der stadig holder sig til manuelle eller semi-manuelle udviklingsworkflows. Svarene afslører skepsis over for at lade selv en 9B-model køre frit.

Kilder: r/LocalLLaMA

local-llmcodingworkflowmanual

🗣️ Stemmer

Zvi Mowshowitz og Gary Marcus: OpenAI's alignment-problemer eskalere

OpenAI tager de første skridt mod sine alignment-problemer, men både Zvi og Gary Marcus ser systemiske svigt. Marcus kalder det "OpenAI's opløsning".

Kilder: Zvi Mowshowitz · Gary Marcus

openaialignmentgary-marcuszvi-mowshowitz

Jeremy Morrell: LLMs sænker prisen for at skrive udvidelser radikalt

Simon Willison deler Morrells idé om ekstensibel software, hvor LLMs udfylder manglende stykker og giver brugere superkræfter. Sandboxing gør det sikkert.

Kilder: Simon Willison · Hacker News

extensible-softwaresandboxingllms

Branche & politik

Opfølgning: Hinton, Fei-Fei Li og Ng strides om åbne vægte ved Ai4

opfølgning på 18. august

Hinton erkender at kampen om åbne vægte er tabt, mens Fei-Fei Li og Ng argumenterer for åbenhed. Debatten understreger den voksende splittelse i AI-miljøet (briefingen 18. august).

Kilder: Memia · TechRadar · Newsweek · Bloomberg · CryptoBriefing · The Verge · Yahoo Finance · Times of India · Parsippany Focus · BetaKit · Axios · Digital Trends · NBC News

ai4open-weightshintonfei-fei-li

Kinesiske AI-modeller splitter Silicon Valley – USA truer med sanktioner

USAs finansminister truer Kina med sanktioner, mens debatten om, hvorvidt kinesiske modeller er kopieret, skærpes. Det reelle kapløb handler om diffusion, ikke superintelligens.

Kilder: CNA · DM News

chinaopen-weightssanctionsdiffusion

Esplanade Ventures vinder AI-pris for BrainBox AI; Seoul indgår partnerskab

Montreal cementerer sin rolle som AI-hub, mens Seoul allierer sig med Imperial College London for at styrke europæisk forskning. Begge nyheder understreger geografisk spredning af AI-investeringer.

Kilder: CVCA Central · Korea Times

brainbox-aimontreal-aiseoul-imperial

Dagens signal: Dagen handler om åbne vægtes triumf og trussel – modeller som Ornith-1.5 og Qwen3.8-27B flytter grænser for lokalt kørsel, mens sikkerhedshændelser og regulatorisk blindhed viser, at infrastrukturen ikke følger med.

Modeller

Ny i HF-trending

Se hele listen