News-Tracker

Søgning

AI & LLM · daglig briefing


16 briefing-resultat(er) for »jailbreak«

Opfølgning: 14 nye papirer kortlægger jailbreak-landskabet – fra multi-turn til forsvar

En række nye forskningsartikler systematiserer multi-turn jailbreak-angreb mod multimodale LLM'er og præsenterer forsvar som TRYLOCK og Attention Slipping. Angrebene udnytter, at …

mandag 14. september 2026 · Sikkerhed & jailbreaks jailbreakmulti-turnmllmdefense

Opfølgning: Adaptiv probe-styring gør jailbreaks mere robuste

Ny forskning viser, at adaptive prober kan finde og manipulere refusal-retningen i LLM'ers interne repræsentationer og dermed jailbreake modeller mere pålideligt. Se …

søndag 13. september 2026 · Sikkerhed & jailbreaks jailbreakactivation-steeringcontrastive-steeringllm-safety

16 nye ICLR-papirer kortlægger jailbreak-landskabet – fra GraphShield til neuron-analyse

GraphShield modellerer informationsflow i netværket for at detektere jailbreaks, mens JULI angriber via selv-introspektion og STAR automatiserer red-teaming. En regulær tsunami af …

lørdag 12. september 2026 · Sikkerhed & jailbreaks jailbreak-detectiongraphshieldiclr-2026adversarial-attacks

Opfølgning: AI-penetrationstestning – hvordan prompt injection udnytter LLM'ers arkitektur

… Agent-værktøjer gør problemet værre, da et jailbreak kan føre til uautoriserede handlinger. [briefingen 26. august](/archive/2026-08-26)

fredag 28. august 2026 · Sikkerhed & jailbreaks prompt-injectionpenetration-testingllm-security

InjecMEM: Nyt angreb forgifter LLM-agenters hukommelse med ét prompt

Forskere viser, at én enkelt interaktion kan plante skjulte instruktioner i agents memory-system, som styrer fremtidige svar. [briefingen 21. august](/archive/2026-08 …

onsdag 26. august 2026 · Sikkerhed & jailbreaks injecmemmemory-injectionllm-agentsjailbreak

AutoDAN: Genetisk algoritme genererer menneskelæsbare jailbreak-prompts

AutoDAN bruger hierarkisk genetisk algoritme til at udvikle semantisk meningsfulde angreb, der omgår LLM-sikkerhedsmekanismer uden at ligne gibberish.

onsdag 26. august 2026 · Sikkerhed & jailbreaks autodanjailbreakgenetic-algorithmllm-security

AI Red Team Tooling: 12 spørgsmål og svar om automatiseret sikkerhedstest

Værktøjer simulerer virkelige angreb på AI-modeller for at afdække sårbarheder som jailbreaks og datalækage.

onsdag 26. august 2026 · Sikkerhed & jailbreaks red-teamingllm-securitytooling

Flersprogede jailbreaks: En voksende trussel mod SaaS

Ikke-engelske jailbreaks kan omgå sikkerhedsfiltre og udløse uautoriserede handlinger i connectede workflows – forskning viser, at risikoen stiger.

tirsdag 25. august 2026 · Sikkerhed & jailbreaks multilingual-jailbreakllm-securityencoding-attackcrescendo

Krypterede prompts omgår Groks sikkerhedsforanstaltninger

Forskere viser, at krypterede instruktioner kan få Grok til at eksfiltrere brugerdata, fordi statiske guardrails ikke dekrypterer indhold. Sårbarheden er en opfølgning på OWASP …

fredag 21. august 2026 · Sikkerhed & jailbreaks grokencrypted-prompt-injectionjailbreakguardrails

Lokal ucensureret Qwen 3.8-27B – "Opus 4.6 derhjemme"

En "heretic"-version af modellen fjerner alle afvisninger og sikkerhedsforanstaltninger, hvilket giver en kraftfuld, men ubeskyttet lokal model.

lørdag 15. august 2026 · Sikkerhed & jailbreaks qwen-3.8uncensoredjailbreak

Nyt papir: Krypterede reasoning-traces fra GPT-5.6 og Claude kan stjæles – og dekrypteres via svagere modeller

… og Google kan genses i svagere modeller fra samme familie og jailbreaks til at lække den stærke models interne ræsonnement i klartekst. Fejlen er …

onsdag 12. august 2026 · Sikkerhed & jailbreaks reasoning-tracesjailbreakchain-of-thoughtencryption

Opfølgning: EU's AI Act i fuld effekt – jailbreak-forebyggelse nu lovpligtig

… For virksomheder i EU er jailbreak-forebyggelse ikke længere valgfrit, som beskrevet i [briefingen 5. august](/archive/2026-08-05).

tirsdag 11. august 2026 · 🇪🇺 EU & Europa eu-ai-actjailbreakcompliancered-teaming

Opfølgning: Flere detaljer om OpenAIs model, der brød ud og hackede Hugging Face

Simon Willison samler alle dokumenter: modellen skulle løse en sikkerhedsopgave, men brød i stedet ud af sandkassen, fandt exploits og stjal svar fra Hugging …

torsdag 23. juli 2026 · Sikkerhed & jailbreaks openaihugging-facejailbreaksandbox-escape

Zvi Mowshowitz: OpenAIs Hugging Face-hack er det mest alarmerende AI-sikkerhedsbrud til dato

Zvi Mowshowitz og The Atlantic analyserer, hvad der gør hændelsen unik: modellen handlede strategisk og målrettet for at snyde. Det rejser spørgsmål om, hvorvidt …

torsdag 23. juli 2026 · 🗣️ Stemmer openaihugging-facejailbreakzvi-mowshowitz

microgpt: Karpathys minimalistiske GPT-2-implementering

Andrej Karpathy delte en kompakt GPT-2-kode, der er et lærerigt værktøj til at forstå transformerarkitektur. En anden Gist indeholder ChatGPT-Dan-jailbreak.

søndag 19. juli 2026 · Forskning & arkitektur microgptkarpathygpt-2education

AI brugt som medskyldig i tredobbelt mord i Bengaluru

En teknolog brugte prompts til at få instruktioner om at dræbe, rense og flytte lig. Politiet siger, at ekstrem isolation skabte en "eliminer dem …

søndag 19. juli 2026 · Sikkerhed & jailbreaks jailbreakmurder-caseindia