OpenAI zveřejnila nový systém GPT-Red, který kombinuje automatizované red teaming s principem self-play. Cílem je zvýšit bezpečnost a zarovnání (alignment) AI modelů, zejména jejich odolnost proti prompt injection útokům. Systém funguje na principu, kdy se modely střídají v rolích — jeden hraje útočníka hledajícího zranitelnosti, druhý se brání a učí se odolávat. Tento iterativní proces umožňuje kontinuální zlepšování robustnosti bez nutnosti ručního zásahu bezpečnostních specialistů. Automatizace red teamingu představuje významný posun v testování AI bezpečnosti, protože tradičně byly tyto procesy časově náročné a omezené lidskými kapacitami.
GPT-Red: Automatizovaný systém OpenAI na zlepšování bezpečnosti AI
Zdroje
- OpenAI Blog: GPT-Red: Unlocking Self-Improvement for Robustness
Související články
- 8. 8. 2026 OpenAI odhalila časový plán neúmyslného útoku na infrastrukturu Hugging Face
- 22. 6. 2026 Umělá inteligence je lepší v přesvědčování než lidé, zjistili vědci
- 11. 8. 2026 Výzkumníci odhalili zranitelnost v API proprietárních modelů AI
- 6. 8. 2026 OpenAI a Americká psychologická asociace spolupracují na bezpečnosti AI pro mládež