Direct Preference Optimization: Nová metoda optimalizace AI modelů mimo chatboty
Výzkumníci z Hugging Face představili aplikaci Direct Preference Optimization (DPO) pro oblasti mimo konverzační AI. Metoda umožňuje efektivnější trénování modelů pro různé úlohy s využitím lidských preferencí.