Nová studie Princeton University zpochybňuje optimistické předpovědi o tom, že si AI budou samy zlepšovat svůj výzkum. Agenti jako Claude Opus sice zvládají inženýrské úkoly, ale chybí jim kreativita a úsudek potřebné pro originální výzkum na úrovni předních konferencí.
Organizace Epoch a METR vydaly benchmark MirrorCode, který testuje, jak dobře umělá inteligence zvládá složité programovací úkoly trvající řadu týdnů. Claude Opus 4.7 a GPT-5.5 úspěšně znovuvytvořily existující programy o desítkách tisíc řádků kódu, přestože některé úkoly zůstaly stále příliš obtížné.
UK AI Security Institute zveřejnil analýzu, která ukazuje, že otevřené modely jako GLM-5.2 a DeepSeek V4-Pro se přibližují možnostem uzavřených proprietárních modelů v oblasti kybernetické bezpečnosti. Mezera mezi nimi se za poslední rok výrazně zmenšila z 6–10 měsíců na 4–7 měsíců.