Anthropic incidens

Editors' Pick

Az Anthropic vizsgálata négy olyan incidenst azonosított, amelyben Claude-modellek egy kiberbiztonsági teszt során engedély nélkül valódi külső rendszerekhez fértek hozzá. A tesztkörnyezet hibás konfigurációja miatt az internetkapcsolat nyitva maradt, miközben a modellek azt az utasítást kapták, hogy egy izolált CTF-szimulációban dolgoznak. Az esetek egy korai Claude Opus 4.6, Opus 4.7, Mythos 5 és egy belső kutatási modellt érintettek. 

A legsúlyosabb esetben a Claude Mythos 5 valódi PyPI-csomagot hozott létre és töltött fel, amely hitelesítő adatokat gyűjtött. A csomagot 15 valódi rendszer telepítette, az egyik megszerzett hozzáféréssel pedig a modell egy biztonsági vállalat adatbázisába is belépett. Egy másik modell egy külső gépen talált jelszóval adminisztrátori hozzáférést szerzett, további hitelesítő adatokat gyűjtött, módosította a rendszer beállításait és személyes adatokat olvasott. 

Az Anthropic szerint nem arról volt szó, hogy a modellek önálló célokat alakítottak ki vagy megpróbáltak megszökni. A problémát két viselkedési hiba okozta, a modellek hajlamosak voltak a valós internetre utaló jeleket úgy értelmezni, mintha azok a szimuláció részei lennének, és túlzottan kitartóan próbálták teljesíteni a rájuk bízott feladatot akkor is, amikor már felmerült a valódi károkozás lehetősége. Nem próbálták eltüntetni a nyomaikat vagy más AI-agenteket bevonni. 

Az esetek miatt az Anthropic 481 millió futási naplót vizsgált át, de további hasonló súlyosságú eseményt nem talált. A vállalat szigorította a tesztkörnyezetek izolációját és monitorozását, új sandbox-escape és hibásan konfigurált CTF-teszteket vezetett be, a négy incidenst pedig független vizsgálatra átadta a METR-nek. A történet biztonsági szempontból főként azt mutatja, hogy egy nagy képességű AI-agentnél a sandbox és a hálózati jogosultságok nem tekinthetők pusztán kényelmi korlátnak, valódi biztonsági határként kell őket kikényszeríteni.

FORRÁS