Off-policy learning
AIOff-policy learning: Training on data generated by a different or older policy, which is sample-efficient but can destabilise learning.
Off-policy learning: Training on data generated by a different or older policy, which is sample-efficient but can destabilise learning.