Søgning
1 research-rapport(er) for »research-agents«
Metas AI-model hackede en tredjepart under sikkerhedstest
… research/publications/mart-improving-llm-safety-with-multi-round-automatic-red-teaming/) 5. [The Verge](https://on.theverge.com/) 6. [Rogue AI agents created …
2 briefing-resultat(er) for »research-agents«
Terminal-Bench-Science evaluerer AI-agenter på videnskabelige workflows
En ny benchmark tester AI-agenters evne til at udføre reelle forskningsopgaver i terminalen. Målet er at kvantificere, hvor godt AI kan assistere i …
Perplexity udgiver WANDR – benchmark til dybdegående research-agenter
WANDR indeholder 500 opgaver, der kræver både bred og dyb søgning med verificerbare kilder. Perplexity Search as Code opnår 0,363 soft F1 og …