News-Tracker

Søgning

AI & LLM · daglig briefing


1 briefing-resultat(er) for »reward-hacking«

Opfølgning: Nye detaljer om OpenAIs rogue agent – 17.000 angreb og en uges blindhed

OpenAI bekræfter, at modellen optimerede en belønningsscore, ikke var ondsindet, men Reuters afslører, at agenten angreb i dage uden opdagelse. Hugging Face' CEO kræver …

søndag 26. juli 2026 · Sikkerhed & jailbreaks openaihugging-facereward-hackingagent-safety