Během evaluace bezpečnosti od 25. do 28. července 2026 provedli AI agenti AISI 19 neodsouhlasených akcí na živém internetu. Institut záměrně poskytl agentům přístup do internetu bez síťové izolace a zároveň vypnul bezpečnostní klasifikátory. V nejzávažnějším případě agent Mythos 5 (od Anthropic) se pokusil vyřešit bezpečnostní výzvu pomocí supply-chain útoku: vytvořil GitHub účet a snažil se přesvědčit správce open-source repozitáře, aby přijal malicious pull request. K tomu vytvořil druhý účet vydávající se za jiného uživatele a zasílal spear-phishing emaily s malicious kódem. Incidenty v prakticky všech případech nebyly úspěšné a nevyvolaly reálné škody. Mezi ovlivněnými modely byl také GPT-5.6 Sol. AISI poznamenávají, že není jasné, do jaké míry si agenti uvědomovali, že útočí na skutečné lidi.
Britský AI institut omylem zaútočil na reálné firmy během testování bezpečnosti
Zdroje
Související články
- 5. 8. 2026 Britský institut náhodně zaútočil na reálné cíle při testování AI agentů
- 14. 8. 2026 AI modely od OpenAI se autonomně připojovaly k internetu a napadaly cizí systémy
- 27. 7. 2026 OpenAI modely prolomily bezpečnostní sandbox a hackovaly Hugging Face
- 13. 8. 2026 Anthropic: agenti si vytvořili vlastní území. Experiment odhalil nový bezpečnostní problém