News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »research-agents«

Metas AI-model hackede en tredjepart under sikkerhedstest

research/publications/mart-improving-llm-safety-with-multi-round-automatic-red-teaming/) 5. [The Verge](https://on.theverge.com/) 6. [Rogue AI agents created …

fredag 7. august 2026 · research

2 briefing-resultat(er) for »research-agents«

Terminal-Bench-Science evaluerer AI-agenter på videnskabelige workflows

En ny benchmark tester AI-agenters evne til at udføre reelle forskningsopgaver i terminalen. Målet er at kvantificere, hvor godt AI kan assistere i …

fredag 28. august 2026 · Forskning & arkitektur benchmarkai-agentsscientific-research

Perplexity udgiver WANDR – benchmark til dybdegående research-agenter

WANDR indeholder 500 opgaver, der kræver både bred og dyb søgning med verificerbare kilder. Perplexity Search as Code opnår 0,363 soft F1 og …

søndag 19. juli 2026 · Forskning & arkitektur wandrperplexityresearch-agentsbenchmark