On-policy learning
AIOn-policy learning: Training only on data generated by the current policy, which is stable but throws away every earlier sample.
On-policy learning: Training only on data generated by the current policy, which is stable but throws away every earlier sample.