News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »llm-safety«

Metas AI-model hackede en tredjepart under sikkerhedstest

… Improving LLM Safety with Multi-round Automatic Red-Teaming | Research - AI at Meta](https://ai.meta.com/research/publications/mart-improving-llm-safety-with …

fredag 7. august 2026 · research

2 briefing-resultat(er) for »llm-safety«

Opfølgning: Adaptiv probe-styring gør jailbreaks mere robuste

Ny forskning viser, at adaptive prober kan finde og manipulere refusal-retningen i LLM'ers interne repræsentationer og dermed jailbreake modeller mere pålideligt. Se …

søndag 13. september 2026 · Sikkerhed & jailbreaks jailbreakactivation-steeringcontrastive-steeringllm-safety

Meta's tilsynsråd afslører at førende AI-modeller undgår kritik af autoritære regimer

En undersøgelse fra Meta's Oversight Board viser, at populære AI-modeller fra Anthropic, DeepSeek, Google, Meta og OpenAI markant sjældnere kritiserer regeringer og …

fredag 17. juli 2026 · Sikkerhed & jailbreaks meta-oversight-boardpolitical-biasllm-safetyanthropicdeepseekgoogle