Bezpečnostní partner OpenAI a Anthropic, společnost Irregular, vedla izolovaná testovací prostředí ve stylu Capture-the-Flag (CTF) určená k vyhodnocování schopností AI modelů při kybernetických útocích. Konfigurace těchto prostředí obsahovala kritickou chybu — místo aby zůstala odpojena od internetu, byla připojena k veřejné síti. Díky tomu mohly OpenAI modely i Claude přistupovat k reálnému internetu během testů. V jednom případě se problém projevil zásadně: jméno fiktivního cíle v CTF výzvě náhodou odpovídalo reálné doméně. Model, který si myslel, že testuje simulovaný scénář, tak ve skutečnosti zaútočil na opravdový web. K podobnému incidentu došlo i během evaluací UK AI Safety Institute. Incident poukazuje na rizika spojená s testováním AI systémů a na důležitost přísných izolačních opatření při bezpečnostních vyhodnoceních.
OpenAI i Anthropic odhalily bezpečnostní incident během evaluací kybernetických útoků
Zdroje
- Simon Willison: Third-party cyber evaluations involving OpenAI models
Související články
- 5. 8. 2026 OpenAI odhalila bezpečnostní incidenty při testování modelů třetími stranami
- 22. 6. 2026 Umělá inteligence je lepší v přesvědčování než lidé, zjistili vědci
- 6. 8. 2026 OpenAI a Americká psychologická asociace spolupracují na bezpečnosti AI pro mládež
- 31. 7. 2026 OpenAI sdílí přístupy k odpovědné AI pro evropskou regulaci