Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
By Siye Wu · Paper · cs.CL
Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large language models, but covering multiple capabilities often involves training separate domain experts and subsequently consolidating them. We organize three fusion paradigms by the artefac