ScarfBench je benchmarkingový projekt zaměřený na evaluaci AI agentů v kontextu migrace podnikových Java aplikací. Cílem je poskytnout standardizovaný způsob, jak měřit a porovnávat výkon různých AI systémů při řešení reálných úloh transformace kódu, kde je potřeba porozumět komplexním frameworkům a arcitektuře starších systémů. Benchmark řeší praktický problém v podnikové sféře, kde je modernizace Java aplikací časově náročná a nákladná. Díky ScarfBench mohou vývojáři a výzkumníci testovat, jak dobře si AI agenti vedou při takto specifických a náročných úkolech. Projekt je dostupný v ekosystému Hugging Face a představuje příspěvek IBM Research k větší adopci AI nástrojů v enterprise prostředí.