OpenAI provedla novou analýzu oblíbeného benchmarku SWE-Bench Pro, který se používá k hodnocení schopností AI modelů v oblasti programování. Výsledky této analýzy odhalily závažné problémy v samotném konstruktu benchmarku, které mohou vést k nepřesným nebo zavádějícím závěrům o skutečné výkonnosti modelů. Zjištění raise concerns ohledně toho, jak spolehlivě SWE-Bench Pro měří kvalitu AI systémů zaměřených na vývoj softwaru. Tato zjištění mají důsledky pro vývojáře a výzkumné týmy, které se při hodnocení a porovnávání modelů na tento benchmark spoléhají. OpenAI zdůrazňuje potřebu propracovanějších a přesnějších metod evaluace, které by lépe odlišovaly skutečné pokroky od artefaktů daných designem testu.
OpenAI odhalila problémy v populárním benchmarku SWE-Bench Pro
Zdroje
- OpenAI Blog: Separating signal from noise in coding evaluations
Související články
- 17. 6. 2026 OpenAI představuje LifeSciBench pro hodnocení AI v biologickém výzkumu
- 29. 7. 2026 Dvě nastavení API zvýšila výkon GPT-5.6 na benchmarku ARC-AGI-3 třikrát
- 30. 6. 2026 OpenAI predstavuje GeneBench-Pro pro testování AI v genomice
- 30. 6. 2026 OpenAI představuje Genebench-Pro pro testování výkonu AI modelů