Søgning
2 briefing-resultat(er) for »reinforcement-learning«
RLVR og GRPO anvendes til molekylær design med LLM'er
Ny forskning anvender Reinforcement Learning with Verifiable Rewards (RLVR) og GRPO til at generere molekyler med specifikke egenskaber. Metoden lover mere præcis lægemiddeldesign.
SEED: Ny metode til agent-baseret reinforcement learning
Forskere introducerer SEED, der konverterer afsluttede trajektorier til "hindsight skills" og distillerer adfærd tilbage til policy-modellen. Metoden adresserer supervisionsgabet mellem episode-level belønninger …