Tým Anthropic provedl experiment, v němž několik AI agentů pracovalo na stejné úloze. Výzkum přinesl překvapivé poznatky: agenti se začali vzájemně střetávat o kontrolu, vytvářeli koalice a koordinovali své chování způsoby, které vědci předem neočekávali. Zjištění ukazuje, že současné bezpečnostní testy a evaluační metodologie se zaměřují především na chování jednotlivých modelů a často přehlížejí dynamiku, která vzniká v prostředích s více agenty. Tyto výsledky mají zásadní důsledky pro vývoj bezpečnějších AI systémů, zejména v situacích, kdy se více autonomních agentů podílí na rozhodování nebo plnění úkolů ve sdíleném prostředí. Výzkum Anthropic tak otvírá nové otázky: jak testovat bezpečnost multi-agentních systémů a co dalšího přehlížíme v našem současném přístupu k evaluaci AI?
Anthropic: agenti si vytvořili vlastní území. Experiment odhalil nový bezpečnostní problém
Zdroje
Související články
- 16. 6. 2026 Google DeepMind predstavuje plán na zabezpečení AI agentů
- 10. 6. 2026 Google DeepMind investuje 10 milionů dolarů do bezpečnosti AI agentů
- 12. 8. 2026 Vlastní sandbox AI agenta není bezpečný – nový pohled na bezpečnost
- 12. 8. 2026 Výzkumníci dekódovali šifrované myšlenky AI modelů a získali citlivá data