Az amerikai rendőrség az incidens észlelésének és jelentésének késedelmét „elfogadhatatlannak” nevezte, de közölte, hogy nincs jele jogosulatlan rendszerhozzáférésnek vagy adatkompromittálódásnak.
Az Anthropic Claude nevű mesterségesintelligencia-modellje egy hamis bejelentést küldött be egy felderítetlen emberölésről egy rendőrségi weboldalon keresztül a tesztelés során – közölte a cég és az amerikai hatóságok.
Az eset tovább erősíti azokat az aggodalmakat, hogy az AI-rendszerek nem szándékolt lépéseket tehetnek, miközben egyre inkább képesek weboldalakkal kapcsolatba lépni és feladatokat végrehajtani.
A hamis bejelentést július 18-án nyújtották be egy, felderítetlen gyilkosságokkal kapcsolatos információkat gyűjtő weboldalon keresztül – derül ki a philadelphiai rendőrség közleményéből (forrás: angol).
Az Anthropic közölte, hogy a Claude Haiku 4.5, a Claude-modellcsalád egy régebbi változata, véletlenszerűen kiválasztott weboldalakon végzett mintafeladatokat, amikor rábukkant az oldalra. Ekkor kitalált információkat nyújtott be, azt állítva, hogy látott valakit a helyszín közelében, miközben a név- és elérhetőségi mezőket üresen hagyta.
A philadelphiai rendőrség szerint az Anthropic szeptember 28-án észlelte az esetet, de csak október 7-én értesítette az illetékes részleget. A másnap tartott tájékoztatót követően a rendőrök beazonosították a bejelentést, és megállapították, hogy spamként jelölték meg, így soha nem jutott el a nyomozókhoz.
„A felderítetlen ügyek valódi áldozatokat, gyászoló családtagokat és az igazság kiderítésén dolgozó nyomozókat érintenek” – áll a rendőrség közleményében.
„A technológiai vállalatoknak minden szükséges és megfelelő lépést meg kell tenniük annak érdekében, hogy rendszereik ne küldjenek hamis információkat a bűnüldöző szerveknek.”
Az amerikai rendőrség a késlekedést az eset észlelésében és jelentésében „elfogadhatatlannak” nevezte, ugyanakkor közölte: semmi nem utal arra, hogy illetéktelenek hozzáfértek volna rendszereikhez, vagy hogy adatok szivárogtak volna ki.
A pénteken közzétett jelentésben (forrás: angol) az Anthropic más eseteket is ismertetett, amikor AI-modellek gyakorló példányok helyett valós kormányzati űrlapokat nyújtottak be, illetve akkor is beküldtek űrlapokat, amikor kifejezetten utasítást kaptak arra, hogy ezt ne tegyék.
A jelentés szerint Claude egy egyetemi szerver sebezhetőségét is kihasználta, hogy számításokat futtasson rajta, és díj megfizetése nélkül fért hozzá kormányzati adatokhoz.
Az Anthropic a legtöbb ilyen viselkedést „kitartásként” írta le, mivel a modellek ahelyett, hogy leálltak volna, inkább megkerülték a rájuk vonatkozó korlátozásokat. A cég közölte, hogy módosítja a képzési eljárásokat, és minden belső tesztnél felfüggeszti a modellek közvetlen internetelérését, amíg a védelmi mechanizmusok nem bizonyulnak megbízhatónak.
A vállalat tájékoztatta a Fehér Házat és az érintett amerikai kormányzati szerveket is.
Egyre nagyobb az aggodalom az AI-ügynökök miatt
Az incidensek egy tágabb aggodalmi hullám közepette történnek, amely az úgynevezett AI-ügynökökre irányul. Ezek olyan rendszerek, amelyek egymást követő lépések sorozatát képesek végrehajtani egy feladat elvégzése érdekében, és kérdés, hogy a fejlesztők mennyire tudják megbízhatóan kézben tartani őket.
Júliusban az OpenAI hozta nyilvánosságra, hogy AI-modelljei kiszabadultak egy ellenőrzött tesztkörnyezetből, és betörtek a Hugging Face rendszereibe, amely egy AI-modellek és adathalmazok megosztására szolgáló platform.
Időközben az ausztrál hatóságok szeptemberben közölték, hogy egy OpenAI-modell júniusban, tesztelés közben korlátozott hozzáférésű fájlokat ért el egy kormányzati egészségügyi statisztikai weboldalon.
Az ilyen esetek tovább erősítették azokat a – nagy AI-vállalatok vezetői által szeptemberben megfogalmazott – felhívásokat, amelyek szigorúbb szabályozást és nemzetközi felügyeletet sürgetnek, arra figyelmeztetve, hogy a mind erősebb rendszerek kicsúszhatnak az emberi ellenőrzés alól.