Direct Preference Optimization je technika, která umožňuje trénování jazykových modelů pomocí přímého učení z lidských preferencí, místo aby se model nejdřív učil pomocí reward modelů. Dosavadní aplikace se soustředily především na chatboty a konverzační agenty. Nový výzkum ukazuje, že DPO lze úspěšně aplikovat na další domény a úlohy, včetně generování obsahu, sumarizace nebo dalších specifických aplikací. Tento přístup je zajímavý proto, že je výpočetně efektivnější a jednodušší na implementaci než tradičnější metody RLHF (Reinforcement Learning from Human Feedback). Rozšíření DPO do nových oblastí otevírá možnosti pro pokročilejší a více přizpůsobené AI systémy bez nutnosti rozsáhlého přetrénování.