Benchmark MirrorCode měří schopnost AI systémů znovu implementovat existující software. Úkol spočívá v tom, že AI má pouze přístup k příkazovému rozhraní programu, bez přístupu k jeho zdrojovému kódu, a musí jej znovunaprogramovat od základu. Na 25 testovacích programech dosáhly vedoucí modely pozoruhodných výsledků: Claude Opus 4.7 znovu implementoval program gotree (16 tisíc řádků) za 100 až 400 dolarů na inferencích a zvládl také rozsáhlejší program pkl (61 tisíc řádků). Na 17 z 25 cílových programů se podařilo dosáhnout dokonalého skóre alespoň jednomu pokusu. Avšak osm programů zatím dosáhlo 100procentního skóre nikdy, čtyři pak nepřekročily 99 procent. AI systémy se obzvláště potýkaly s lintrem ruff, matematickým balíčkem giac_subset a knihovnou mailauth pro ověřování e-mailů. Výsledky naznačují, že AI modely se v poslední době výrazně zlepšily: modely z loňského roku by dosáhly pouze 30 procent a zvládly jen jednodušší programy.