GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning

By Outongyi Lv · Paper · cs.CL

Reinforcement learning (RL), particularly RL with Verifiable Rewards (RLVR), has recently emerged as a central paradigm for enhancing large language models' (LLMs) reasoning abilities, demonstrating remarkable effectiveness across reasoning tasks. Recent studies suggest that high

Cs.cl

View original

HomeResourceLoading…