GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning
By Outongyi Lv · Paper · cs.CL
Reinforcement learning (RL), particularly RL with Verifiable Rewards (RLVR), has recently emerged as a central paradigm for enhancing large language models' (LLMs) reasoning abilities, demonstrating remarkable effectiveness across reasoning tasks. Recent studies suggest that high