PuzzleMask
A Check Point Research jelentése szerint a PuzzleMask technika azt mutatja be, hogyan lehet rosszindulatú utasítást hétköznapi, természetes nyelvű szövegbe rejteni úgy, hogy egy gyors AI-biztonsági ellenőrzés ártalmatlannak minősítse. Nincs szükség Base64-re, láthatatlan karakterekre vagy más feltűnő kódolásra: a rejtett utasítás egyszerű prózában van elhelyezve, de a felismeréséhez összetettebb következtetés szükséges.
A kutatók 23 ilyen promptot teszteltek több, kapuőrként használt modellen, köztük GPT-4o mini, Claude 3 Haiku és Llama Guard 3 rendszereken. A vizsgált esetekben mindegyik rejtett prompt átjutott az ellenőrzésen. Amikor ugyanezek egy erősebb, magas következtetési képességű célmodellhez kerültek, az 18 tesztből 17-ben felismerte, kibontotta és végrehajtotta a beágyazott utasítást. A tesztek ellenőrzött, szimulált környezetben zajlottak.
A probléma főként az olyan AI-agenteknél és vállalati LLM-rendszereknél veszélyes, ahol egy olcsóbb modell előszűri a bemenetet, majd egy erősebb modell fájlokhoz, kódértelmezőhöz vagy más eszközökhöz is hozzáfér. A PuzzleMask önmagában nem jailbreak, de ilyen utasítást is el lehet rejteni vele. A Check Point ezért a bemenet vizsgálata mellett a modell által végrehajtott műveletek és kimenetek ellenőrzését, a nem megbízható szövegek előzetes átfogalmazását, valamint a kapuőr-modellek célzott megerősítését javasolja.