Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

By Siye Wu · Paper · cs.CL

Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large language models, but covering multiple capabilities often involves training separate domain experts and subsequently consolidating them. We organize three fusion paradigms by the artefac

Cs.cl

View original

HomeResourceLoading…