OpenAI provedla novou analýzu oblíbeného benchmarku SWE-Bench Pro, který se používá k hodnocení schopností AI modelů v oblasti programování. Výsledky této analýzy odhalily závažné problémy v samotném konstruktu benchmarku, které mohou vést k nepřesným nebo zavádějícím závěrům o skutečné výkonnosti modelů. Zjištění raise concerns ohledně toho, jak spolehlivě SWE-Bench Pro měří kvalitu AI systémů zaměřených na vývoj softwaru. Tato zjištění mají důsledky pro vývojáře a výzkumné týmy, které se při hodnocení a porovnávání modelů na tento benchmark spoléhají. OpenAI zdůrazňuje potřebu propracovanějších a přesnějších metod evaluace, které by lépe odlišovaly skutečné pokroky od artefaktů daných designem testu.