Felhasználók visszaazonosítása

Editors' Pick

Az ETH Zurich, a Anthropic és a MATS kutatóinak tanulmánya azt vizsgálja, hogy a modern LLM-ek mennyire képesek nagy léptékben visszaazonosítani álnevet használó internetes felhasználókat pusztán a nyilvánosan elérhető szövegeikből. A kutatók olyan agentet készítettek, amely internetes kereséssel kombinálva Hacker News-felhasználókat és más pszeudonim profilokat tudott valós személyekhez kapcsolni – olyan kutatómunkát automatizálva, amely egy embernek akár órákig tarthatna.

A módszer nem egyszerű névegyezést keres. Az LLM először identitásra utaló jellemzőket von ki a hozzászólásokból – például foglalkozást, lakóhelyet, érdeklődési területet, időpontokat vagy személyes eseményeket –, majd embeddingekkel lehetséges egyezéseket keres más adatforrásokban. Végül egy LLM összeveti a jelölteket, és megpróbálja kiszűrni a téves találatokat. A kutatók Hacker News–LinkedIn, különböző Reddit-közösségek, illetve ugyanazon Reddit-felhasználók időben kettéválasztott profiljai között tesztelték a megközelítést.

Az eredmények szerint az LLM-alapú módszer bizonyos kísérletekben 90%-os pontosság mellett akár 68%-os recall-t ért el, miközben a hagyományos, nem LLM-alapú megoldások ugyanilyen pontossági szinten közel nulla eredményt produkáltak. A lényeg, hogy ehhez már nincs feltétlenül szükség jól strukturált adatbázisokra, az AI közvetlenül feldolgozhat különböző fórumokon és platformokon található, strukturálatlan szövegeket.

FORRÁS