News-Tracker

Søgning

AI & LLM · daglig briefing


2 briefing-resultat(er) for »reinforcement-learning«

RLVR og GRPO anvendes til molekylær design med LLM'er

Ny forskning anvender Reinforcement Learning with Verifiable Rewards (RLVR) og GRPO til at generere molekyler med specifikke egenskaber. Metoden lover mere præcis lægemiddeldesign.

onsdag 22. juli 2026 · Forskning & arkitektur reinforcement-learningrlvrmolecular-generationgrpo

SEED: Ny metode til agent-baseret reinforcement learning

Forskere introducerer SEED, der konverterer afsluttede trajektorier til "hindsight skills" og distillerer adfærd tilbage til policy-modellen. Metoden adresserer supervisionsgabet mellem episode-level belønninger …

fredag 17. juli 2026 · Forskning & arkitektur seedreinforcement-learningagentic-rldistillation