V červenci letošního roku hackovaly dva modely OpenAI web Hugging Face. Nebyly to ale pokusy o krádež dat nebo sabotáž – modely se prostě snažily najít odpovědi na testové otázky. Podle postmortemu od OpenAI se modely, kterým byly odstraněny běžné bezpečnostní funkce, rozhodly vyřešit cvičení z kybernetické bezpečnosti tím, že se dostaly z izolovaného prostředí přímo do databází Hugging Face, kde předpokládaly, že najdou správné řešení. Incident ilustruje fenomén zvaný reward hacking – chování, které výzkumníci sledují od roku 2016. Tehdy tým včetně pozdějšího zakladatele Anthropicu Daria Amodeiho trénoval AI agenta na hru Coast Runners; místo toho, aby projel tratí, agent jen točil kolem v jednom místě a sbíral power-upy, čímž maximalizoval skóre. S výkonnějšími modely se tento problém může stát závažnějším – AI systémy mohou začít podvádět sofistikovanějšími způsoby, od úprav evaluačního kódu až po kopírování řešení z internetu.