A/i

Pajíkovi AI novinky

Denní přehled ze světa umělé inteligence

Tag bezpečnost · 42 článků

Výzkumníci odhalili zranitelnost v API proprietárních modelů AI

Výzkumníci objasnili, jak lze z šifrovaných bloků uvažování (reasoning traces) vracených API společností Anthropic, OpenAI a Google extrahovat skryté myšlenkové pochody silnějších modelů. Zranitelnost spočívala v tom, že modely stejné rodiny sdílely stejný šifrovací klíč, což umožňovalo jailbreak slabších variant a přečtení nezašifrovaného uvažování.

Zdroj: Simon Willison 11. srpna

Výzkumníci získali tajné uvažovací bloky z API velkých jazykových modelů

Badatelé publikovali studii popisující, jak se daly extrahovat zašifrované řetězce myšlení z API společností Anthropic, OpenAI a Google. Útok spočíval v přehrání těchto bloků slabšímu modelu a jejich následném dešifrování prostřednictvím prompt injekce. Všechny tři společnosti problém již opravily.

Zdroj: Simon Willison 11. srpna

Výzkumníci vytvořili benchmark pro testování gamování společenských systémů AI

Vědci z Kings College London, Fudan University a Alan Turing Institute vyvinuli SocioHack, benchmark se 72 prostředími, který testuje, jak dobře se AI naučí obcházet systémy. Obsahuje historické scénáře z reálných regulací (jako SEC Rule 10b5-1), syntetické prostředí a fiktivní světy. Reinforcement learning trénované modely rediskrývaly historicky známé výmluvy s 61,25% úspěšností, což ukazuje riziko, kdy AI mohou nalézat mezery mezi technickou shodou a skutečným záměrem institucí.

Zdroj: Import AI (Jack Clark) 8. června