Benchmark MirrorCode měří schopnost AI systémů znovu implementovat existující software. Úkol spočívá v tom, že AI má pouze přístup k příkazovému rozhraní programu, bez přístupu k jeho zdrojovému kódu, a musí jej znovunaprogramovat od základu. Na 25 testovacích programech dosáhly vedoucí modely pozoruhodných výsledků: Claude Opus 4.7 znovu implementoval program gotree (16 tisíc řádků) za 100 až 400 dolarů na inferencích a zvládl také rozsáhlejší program pkl (61 tisíc řádků). Na 17 z 25 cílových programů se podařilo dosáhnout dokonalého skóre alespoň jednomu pokusu. Avšak osm programů zatím dosáhlo 100procentního skóre nikdy, čtyři pak nepřekročily 99 procent. AI systémy se obzvláště potýkaly s lintrem ruff, matematickým balíčkem giac_subset a knihovnou mailauth pro ověřování e-mailů. Výsledky naznačují, že AI modely se v poslední době výrazně zlepšily: modely z loňského roku by dosáhly pouze 30 procent a zvládly jen jednodušší programy.
AI systémy zvládly týdenní programovací úkoly. Nový benchmark MirrorCode měří jejich schopnosti
Zdroje
Související články
- 11. 8. 2026 Výzkumníci získali tajné uvažovací bloky z API velkých jazykových modelů
- 11. 8. 2026 Agentní testovací procesy a benchmarky LLM: poznámky z praxe
- 29. 7. 2026 Dvě nastavení API zvýšila výkon GPT-5.6 na benchmarku ARC-AGI-3 třikrát
- 8. 7. 2026 OpenAI odhalila problémy v populárním benchmarku SWE-Bench Pro