Vědecká práce na webu stolen-thoughts.com ukazuje zranitelnost v implementaci šifrovaných chain-of-thought bloků u velkých poskytovatelů LLM. Všechny modely v rámci stejné rodiny (například GPT-5.5, Claude Haiku 4.5) používaly identický šifrovací klíč, což umožnilo útočníkům přehrát zašifrované bloky zpět do slabších verzí modelů a pomocí prompt injekce je dešifrovat. Claude Haiku 4.5 se ukázal jako nejzranitelnější - stačila mu jednoduchá instrukce opsat uvažovací bloky do značek <thinking-copy>. Badatelé získali přístup k interním myšlenkovým procesům čelních modelů, například k technickým úvahám GPT-5.5 o CSS či architektuře. Podle papíru všechny tři společnosti problém uznaly a následně jej opravily, takže stejné útoky již není možné provádět.
Výzkumníci získali tajné uvažovací bloky z API velkých jazykových modelů
Zdroje
- Simon Willison: Stealing Reasoning Traces from Proprietary LLM APIs
Související články
- 11. 8. 2026 Výzkumníci odhalili zranitelnost v API proprietárních modelů AI
- 15. 8. 2026 AI pomáhá řešit slavný matematický problém Riemannovu hypotézu
- 22. 6. 2026 Umělá inteligence je lepší v přesvědčování než lidé, zjistili vědci
- 13. 8. 2026 Anthropic: agenti si vytvořili vlastní území. Experiment odhalil nový bezpečnostní problém