Reinforcement learning with verifiable rewards (RLVR)
AIReinforcement learning with verifiable rewards (RLVR): Training on tasks where correctness can be checked automatically, such as maths answers or passing tests, removing the need for a learned reward model.