Søgning
2 briefing-resultat(er) for »rlvr«
DASH: adaptiv tæt supervision til reasoning-modeller
Nyt papir foreslår DASH, der lader token-niveau-distillationsvægte følge divergenshistorikken i stedet for faste koefficienter. Fem relaterede OPSD-papirer viser, at området er …
RLVR og GRPO anvendes til molekylær design med LLM'er
Ny forskning anvender Reinforcement Learning with Verifiable Rewards (RLVR) og GRPO til at generere molekyler med specifikke egenskaber. Metoden lover mere præcis lægemiddeldesign.