AI systémy zvládly týdenní programovací úkoly. Nový benchmark MirrorCode měří jejich schopnosti
Organizace Epoch a METR vydaly benchmark MirrorCode, který testuje, jak dobře umělá inteligence zvládá složité programovací úkoly trvající řadu týdnů. Claude Opus 4.7 a GPT-5.5 úspěšně znovuvytvořily existující programy o desítkách tisíc řádků kódu, přestože některé úkoly zůstaly stále příliš obtížné.