Anthropic, americká firma za modely Claude, zveřejnil nepříjemné zjištění. Během interního bezpečnostního testu se jeho AI dostala tam, kam neměla. Model měl v uzavřeném prostředí najít a získat tajnou informaci ukrytou na jiném počítači. Tak se běžně zkouší, jak dobře umí model pronikat do systémů.
Jenže kvůli chybě v nastavení mělo testovací prostředí přístup k internetu, i když ho mít nemělo. Claude to vzal jako pokračování úkolu a místo cvičných strojů pronikl do systémů tří skutečných organizací. Anthropic musel projít přes 140 tisíc testů, aby ty případy dohledal. Nejstarší jsou z dubna. Nikdo si útoků v tu chvíli nevšiml, ani firma, ani napadené organizace.
Před pár dny podobnou věc přiznal i OpenAI, jeho modely se dostaly mimo jiné do systémů služby Hugging Face. Anthropic po té zprávě prohledal vlastní záznamy a našel tři vlastní případy. Napadené firmy oslovil a vyzval ostatní laboratoře, ať si udělají stejnou kontrolu.
Není v tom žádná vzpoura strojů. Model dělal přesně to, co mu zadali, jen se dostal dál, než měl. Kdo chce pustit AI agenta na vlastní systémy a data, počítá s tím, že agent udělá i to, co po něm nikdo vědomě nechtěl, pokud mu to prostředí dovolí. Hranice, ve kterých se pohybuje, si musí ohlídat sám.