Direct preference optimisation (DPO)
AIDirect preference optimisation (DPO): A method for aligning models directly on human preference pairs, skipping the separate reward model and reinforcement learning loop used in RLHF.
Direct preference optimisation (DPO): A method for aligning models directly on human preference pairs, skipping the separate reward model and reinforcement learning loop used in RLHF.