News-Tracker

Søgning

AI & LLM · daglig briefing


2 briefing-resultat(er) for »rlvr«

DASH: adaptiv tæt supervision til reasoning-modeller

Nyt papir foreslår DASH, der lader token-niveau-distillationsvægte følge divergenshistorikken i stedet for faste koefficienter. Fem relaterede OPSD-papirer viser, at området er …

fredag 7. august 2026 · Forskning & arkitektur dashopsdself-distillationrlvr

RLVR og GRPO anvendes til molekylær design med LLM'er

Ny forskning anvender Reinforcement Learning with Verifiable Rewards (RLVR) og GRPO til at generere molekyler med specifikke egenskaber. Metoden lover mere præcis lægemiddeldesign.

onsdag 22. juli 2026 · Forskning & arkitektur reinforcement-learningrlvrmolecular-generationgrpo