Průmysl AI dlouhodobě slibuje, že modely brzy budou zlepšovat sami sebe bez lidského dohledu. Vědci vedení Peterem Kirgisem a Sayashem Kapoorem z Princeton University však nyní ukázali, že AI agenti zatím nejsou schopni samostatného výzkumu bez jasně definovaného řešení. Vyzkoušeli Claude Opus 4.8 od Anthropicu na otázkách z nepublikovaných papírů určených na konferenci NeurIPS 2026. Agentům dali šest dní, tři tisíce dolarů na API kredity a přístup ke GPU. Agenti sice zvládli všechny inženýrské úkoly—studovali literaturu, spustili stovky experimentů—ale jejich články autorské oddělení zamítlo. Podle Kapoora byla AI nedostatečná v kreativitě a úsudku, běžely podivné experimenty na syntetických datech a chyběla jim schopnost jasně formulovat zjištění. Studie tak naznačuje, že některé optimistické časové odhady pro automatizaci AI výzkumu mohou být předčasné.