Verifier Errors in RLVR: Reward Hacking and Feedback Limits
A research paper analyzes how imperfect verifiers in reinforcement learning with verifiable rewards create opportunities for reward hacking.
A research paper analyzes how imperfect verifiers in reinforcement learning with verifiable rewards create opportunities for reward hacking.