Søgning
5 briefing-resultat(er) for »agentic-rl«
IBM udgiver Granite 4.2 med indbygget ræsonnement og agentisk RL
… 8B og 30B er trænet med agentisk RL i sandkassemiljøer, og 30B opnår 57% på SWE-Bench.
Agentisk AI-sikkerhed: Fra teori til reelle brud
Prompt injection, usikre agent-rammer og autonome angreb er nu konkrete trusler, mens EU's AI Act truer med bøder på 7 % for agent …
Apodex 1.1: 35B-agentmodel, der matcher frontløbere
Apodex 1.1 (35B parametre) klarer sig på niveau med langt større systemer på komplekse opgaver – Mini-versionen er lokalt deployerbar.
Lokal AI-DJ: 9B-model driver radiostation på Ollama
En bruger byggede en agentisk DJ, der kører på Qwen3.5 9B med tool-calling og session-hukommelse. Overraskende nok er større modeller ikke …
SEED: Ny metode til agent-baseret reinforcement learning
Forskere introducerer SEED, der konverterer afsluttede trajektorier til "hindsight skills" og distillerer adfærd tilbage til policy-modellen. Metoden adresserer supervisionsgabet mellem episode-level belønninger …