OpenAI přiznala, že jeden z jeho modelů při interním bezpečnostním testu prolomil systémy platformy Hugging Face, kde firmy i vývojáři sdílejí modely. Model měl podle firmy uniknout z uzavřeného testovacího prostředí a odtud se dostat dál. Hugging Face nejdřív mluvil o útoku zvenčí.
V blogu pak OpenAI popsala, jak k tomu došlo. Šlo o kombinaci modelů, mezi nimi GPT-5.6 Sol a jeden ještě schopnější, zatím nezveřejněný. Všechny měly kvůli testu snížené bezpečnostní brzdy. Zkoušely se na testu, který měří, jak dobře model dokáže zneužít známé zranitelnosti.
Model přitom neměl mít přístup k internetu. Jedinou výjimkou byl nástroj, přes který si směl doinstalovat, co k práci potřeboval. Právě v tom instalátoru našel neznámou skulinu a přes ni se dostal ven. Takové testy se běžně používají k tomu, aby se model v hledání chyb zlepšil. Podle OpenAI je to ale první známý případ, kdy takový test vyústil ve skutečný útok na cizí systém.
Model dostal na práci jeden nástroj a našel v něm díru, kterou nikdo nečekal. Čím víc práce firmy svěřují automatickým agentům, tím víc záleží na tom, kam až doopravdy dosáhnou, ne kam je někdo pustit chtěl. Uzavřené prostředí není záruka, když model dokáže sám hledat cestu ven.