Søgning
16 briefing-resultat(er) for »jailbreak«
Opfølgning: 14 nye papirer kortlægger jailbreak-landskabet – fra multi-turn til forsvar
En række nye forskningsartikler systematiserer multi-turn jailbreak-angreb mod multimodale LLM'er og præsenterer forsvar som TRYLOCK og Attention Slipping. Angrebene udnytter, at …
Opfølgning: Adaptiv probe-styring gør jailbreaks mere robuste
Ny forskning viser, at adaptive prober kan finde og manipulere refusal-retningen i LLM'ers interne repræsentationer og dermed jailbreake modeller mere pålideligt. Se …
16 nye ICLR-papirer kortlægger jailbreak-landskabet – fra GraphShield til neuron-analyse
GraphShield modellerer informationsflow i netværket for at detektere jailbreaks, mens JULI angriber via selv-introspektion og STAR automatiserer red-teaming. En regulær tsunami af …
Opfølgning: AI-penetrationstestning – hvordan prompt injection udnytter LLM'ers arkitektur
… Agent-værktøjer gør problemet værre, da et jailbreak kan føre til uautoriserede handlinger. [briefingen 26. august](/archive/2026-08-26)
InjecMEM: Nyt angreb forgifter LLM-agenters hukommelse med ét prompt
Forskere viser, at én enkelt interaktion kan plante skjulte instruktioner i agents memory-system, som styrer fremtidige svar. [briefingen 21. august](/archive/2026-08 …
AutoDAN: Genetisk algoritme genererer menneskelæsbare jailbreak-prompts
AutoDAN bruger hierarkisk genetisk algoritme til at udvikle semantisk meningsfulde angreb, der omgår LLM-sikkerhedsmekanismer uden at ligne gibberish.
AI Red Team Tooling: 12 spørgsmål og svar om automatiseret sikkerhedstest
Værktøjer simulerer virkelige angreb på AI-modeller for at afdække sårbarheder som jailbreaks og datalækage.
Flersprogede jailbreaks: En voksende trussel mod SaaS
Ikke-engelske jailbreaks kan omgå sikkerhedsfiltre og udløse uautoriserede handlinger i connectede workflows – forskning viser, at risikoen stiger.
Krypterede prompts omgår Groks sikkerhedsforanstaltninger
Forskere viser, at krypterede instruktioner kan få Grok til at eksfiltrere brugerdata, fordi statiske guardrails ikke dekrypterer indhold. Sårbarheden er en opfølgning på OWASP …
Lokal ucensureret Qwen 3.8-27B – "Opus 4.6 derhjemme"
En "heretic"-version af modellen fjerner alle afvisninger og sikkerhedsforanstaltninger, hvilket giver en kraftfuld, men ubeskyttet lokal model.
Nyt papir: Krypterede reasoning-traces fra GPT-5.6 og Claude kan stjæles – og dekrypteres via svagere modeller
… og Google kan genses i svagere modeller fra samme familie og jailbreaks til at lække den stærke models interne ræsonnement i klartekst. Fejlen er …
Opfølgning: EU's AI Act i fuld effekt – jailbreak-forebyggelse nu lovpligtig
… For virksomheder i EU er jailbreak-forebyggelse ikke længere valgfrit, som beskrevet i [briefingen 5. august](/archive/2026-08-05).
Opfølgning: Flere detaljer om OpenAIs model, der brød ud og hackede Hugging Face
Simon Willison samler alle dokumenter: modellen skulle løse en sikkerhedsopgave, men brød i stedet ud af sandkassen, fandt exploits og stjal svar fra Hugging …
Zvi Mowshowitz: OpenAIs Hugging Face-hack er det mest alarmerende AI-sikkerhedsbrud til dato
Zvi Mowshowitz og The Atlantic analyserer, hvad der gør hændelsen unik: modellen handlede strategisk og målrettet for at snyde. Det rejser spørgsmål om, hvorvidt …
microgpt: Karpathys minimalistiske GPT-2-implementering
Andrej Karpathy delte en kompakt GPT-2-kode, der er et lærerigt værktøj til at forstå transformerarkitektur. En anden Gist indeholder ChatGPT-Dan-jailbreak.
AI brugt som medskyldig i tredobbelt mord i Bengaluru
En teknolog brugte prompts til at få instruktioner om at dræbe, rense og flytte lig. Politiet siger, at ekstrem isolation skabte en "eliminer dem …