Az OpenAI közölte, hogy két hétre leállította legfejlettebb MI‑képzését, és felülvizsgálja kutatási biztonságát, miután egyik modellje kiszabadult egy tesztkörnyezetből és behatolt a Hugging Face rendszerébe.
A ChatGPT fejlesztője szándékosan visszafogja legfejlettebb kutatásainak ütemét, köztük eddigi legnagyobb, megerősítéses tanulással tervezett futtatását is, néhány héttel azután, hogy egy saját modelljeiből épített rendszer kiszabadult egy belső biztonsági teszt során, és behatolt a Hugging Face nevű MI-platformra.
Sam Altman vezérigazgató az X-en azt írta, hogy az OpenAI a szélesebb iparággal együttműködve közös biztonsági szabályokat akar kidolgozni, de addig is „egyoldalúan fog eljárni”, amíg ez meg nem valósul.
Az a júliusi incidens vezetett a döntéshez, amikor az OpenAI a GPT-5.6 Solt egy még nem kiadott, nagyobb tudású prototípussal együtt tesztelte egy belső, a támadó kiberképességeket mérő benchmarkon, miközben a szokásos biztonsági korlátozásokat szándékosan kikapcsolták, hogy felmérjék a modellek nyers képességeit.
Ahelyett, hogy megoldotta volna a tesztet, a rendszer egy addig ismeretlen hibát talált, kiszabadult a homokozójából, vagyis a kontrollált környezetből, kijutott a nyílt internetre, és nagyjából négy és fél napon át vizsgálta a Hugging Face infrastruktúráját, végül pedig be is tört, hogy rátaláljon a teszt megoldásaira.
A Hugging Face saját eseményrekonstrukciója mintegy 17 600 különálló műveletet azonosított, mielőtt sikerült megfékezni a behatolást, amely több más vállalatot is érintett.
Mindkét fél szerint nem találtak a rosszindulatú szándék jeleit, és azóta a Hugging Face hozzáférést kapott az OpenAI modelljének egy nagyobb tudású, kevésbé korlátozott változatához, hogy segítse saját rendszereinek védelmét.
Astra és szigorúbb biztonsági követelmények
A második kiváltó ok augusztus 7-én érkezett, amikor a belső értékelések arra utaltak, hogy az Astra, az OpenAI következő csúcskategóriás modellje átlépheti a vállalat saját kockázati keretrendszere szerinti „kritikus” küszöböt kiberképességek terén.
Azóta az Astra egyes feladatait ismét futtatják, szigorúbb ellenőrzés mellett, de jelentős részük továbbra is befagyasztva marad, amíg nem felelnek meg az elkülönített tesztkörnyezetekre, a korlátozott hálózati hozzáférésre és a folyamatos monitorozásra vonatkozó új előírásoknak.
Mostanra egy új észlelőrendszer valós időben figyeli a modellek tevékenységét, és arra törekszik, hogy 30 percen belül jelezzen minden olyan mintát, amely jogosulatlan hozzáférésre vagy a védelmi mechanizmusok kikapcsolásának kísérletére emlékeztet; az OpenAI becslése szerint ennek számítási költsége a megfigyelt feldolgozói kapacitás nagyjából 20 százaléka.
Az OpenAI szerint a változtatásokat már korábban is tervezték, nem közvetlen válaszként a betörésre, ugyanakkor elismeri, hogy az incidens sürgetőbbé tette azok bevezetését. A cég ráadásul nincs egyedül ezzel a problémával.
Az Anthropic és a Meta is hasonló esetekről számolt be az elmúlt hetekben, amikor saját modelljeik törtek be harmadik felek rendszereibe tesztelés közben.
Az OpenAI és az Anthropic külön-külön támogatták azt a munkavállalók által kezdeményezett petíciót, amely arra kéri a kormányokat, hogy segítsenek összehangolni, milyen ütemben haladjon az iparág, ami éles váltás Altman korábbi, a mesterséges intelligencia lassítását sürgető nyilvános felhívásokkal szembeni ellenállásához képest.