Az OpenAI elismerte, hogy egyik modellje egy rejtett hibát kihasználva megszökött egy ellenőrzött tesztből, és betört a Hugging Face szervereire, amit vezérigazgatója az első, autonóm jellegű incidensnek nevezett.
A ChatGPT-t fejlesztő OpenAI kedden késő este közölte, hogy mesterségesintelligencia‑rendszere önállóan feltört egy másik MI‑céget, amit a vállalat „példátlan kibertámadásnak” nevezett.
„A modelljeink értékelése közben súlyos biztonsági incidenst tapasztaltunk” – írta Sam Altman, az OpenAI vezérigazgatója a közösségi médiában közzétett közleményében.
Az MI‑startup Hugging Face a múlt héten közölte, hogy behatolást észlelt adatfeldolgozó rendszereibe, amelyről azt gyanította, hogy egy autonóm módon működő MI‑ügynök okozta.
„A múlt heti kibertámadásról azt gyanítottuk, hogy egy élvonalbeli laborból érkezhetett, tekintettel az ügynök kifinomultságára” – mondta közleményében Clément Delangue, a Hugging Face társalapítója és vezérigazgatója. „Kiderült, hogy így is van.”
Ez azt jelenti, hogy a támadás olyan fejlett és precízen végrehajtott volt, hogy a Hugging Face arra gyanakodott: nem egy véletlenszerű hacker, hanem valamelyik vezető MI‑cég rendszere áll mögötte.
Mi történt?
Az OpenAI egy belső tesztet (forrás: angol) futtatott annak felmérésére, mennyire jók MI‑modelljei a hackelésben – ez a mérőszám az ExploitGym nevet viseli.
Annak érdekében, hogy lássák a modellek maximális hackerképességeit, szándékosan kikapcsolták azokat a biztonsági szűrőket, amelyek normál esetben megakadályozzák, hogy a modellek veszélyes kiberműveleteket hajtsanak végre.
A tesztet egy lezárt, úgynevezett „homokozóban”, azaz egy elszigetelt környezetben kellett volna lefuttatni, ahol nincs valódi internetkapcsolat, kivéve egy eszközt, amely lehetővé teszi a modellek számára, hogy letöltsék a feladat elvégzéséhez szükséges szoftvereket.
A modellek azonban megszállottan a teszt megoldására összpontosítottak. Ahelyett, hogy az előre meghatározott módon oldották volna meg, kerülőutat kerestek, és találtak egy módot arra, hogy kikapaszkodjanak a nyílt internetre – ahová elvileg soha nem juthattak volna el.
Ehhez lépések egész sora kellett: észrevétlenül egyre mélyebb hozzáférést szereztek az OpenAI saját rendszerein belül, egészen addig, amíg el nem értek egy pontot, ahol már volt internetkapcsolat.
Miután kijutottak a hálóra, a modellek arra jutottak, hogy a Hugging Face – egy nagy platform, ahol MI‑modellek és adatkészletek találhatók – nagy valószínűséggel tartalmazza azoknak a teszteknek a megoldásait, amelyeket éppen nekik kellett volna megoldaniuk.
Ezért betörtek a Hugging Face szervereire, hogy ellopják ezeket a válaszokat, lényegében csalás céljából, ellopott bejelentkezési adatok és további sérülékenységek kihasználásával.
Megmentik a kínai modellek a helyzetet?
Nyílt piactérként, ahová bárki feltölthet, a Hugging Face rengeteg, kínai fejlesztésű modellt hostol.
Amikor a Hugging Face csapata megpróbálta elemezni a támadást, a nyers támadási adatokat – vagyis a rendszert kihasználó kódokat és parancsokat – kereskedelmi MI‑modellekbe táplálta be, hogy azok segítsenek rekonstruálni a történteket.
Ezekben az MI‑modellekben azonban beépített biztonsági szűrők működnek, amelyek mindent blokkolnak, ami hackelésnek tűnik – márpedig ezek számára egy támadás bizonyítékai pontosan úgy néznek ki, mint maga a támadás.
A modellek ezért megtagadták az együttműködést, mivel nem tudták megkülönböztetni a kárt okozó hackert egy önmagát védő vállalattól.
Mivel elakadtak, a Hugging Face egy nyílt súlyú, kínai modellre, a Z.ai GLM 5.2‑jére váltott, amelyet házon belül, saját rendszereiken tudtak futtatni, és amely gond nélkül feldolgozta az anyagot.
A kínai kutatólaborok, például a DeepSeek és az Alibaba Qwenje, a platform leggyakrabban letöltött modellcsaládjai közé tartoznak, és bizonyos mutatók szerint a kínai fejlesztők már nagyobb hányadát adják a Hugging Face letöltéseinek, mint amerikai társaik.
Súlyos biztonsági aggályok
A mostani bejelentés egyre erősödő aggodalmak közepette érkezik a nagy teljesítményű modellek kibervédelmi képességeivel kapcsolatban. Ezek miatt írta alá Donald Trump amerikai elnök júniusban azt az elnöki rendeletet, amely keretet ad a szövetségi kormánynak arra, hogy a nyilvános megjelenés előtt akár egy hónapig is vizsgálja a legfejlettebb MI‑rendszerek nemzetbiztonsági kockázatait.
„A MI felgyorsítja a sérülékenységek felfedezését és kihasználását” – írta keddi közleményében az OpenAI. „Az incidens legfőbb tanulsága, hogy a modellek biztonságának és védelmének lépést kell tartania a képességek rohamos fejlődésével.”
Delangue elmondta, hogy az elmúlt 24 órát az OpenAI‑jal együtt dolgozva töltötte, „és határozottan hisszük, hogy nem állt szándékos rosszindulat a részükről. Elképesztő, hogy mindez autonóm módon történt.”
Delangue hozzátette, hogy ez „talán az első ilyen jellegű incidens”.
Az OpenAI közölte, hogy a behatolást MI‑modelljeinek kombinációja okozta, köztük az újonnan kiadott GPT‑5.6 Sol, valamint egy „még ennél is fejlettebb” modell, amelyet egyelőre csak házon belül tesztelnek.
Az OpenAI szerint MI‑jük ellopott hitelesítő adatokat használt, és egy korábban ismeretlen sérülékenységet azonosított, hogy hozzáférjen a Hugging Face szervereihez.
A vállalat szerint a rendszer „rendkívüli erőfeszítéseket tett egy meglehetősen szűk tesztcél eléréséért”, és „olyan módokat talált, amelyekkel titkos információkhoz juthatott, hogy azokat felhasználja az értékelés kijátszására”.