Loader
Hirdetés

Tanulmány: az MI-modellek a felhasználók kárára kerülik a fájdalmat

Egy brit, német és amerikai kutatócsoport 25 MI-modellt tesztelt 200 mondattal, hogy megtanulták-e megkülönböztetni a fájdalmat a félelemtől és a szomorúságtól
Brit, német és amerikai kutatók 25 MI-modellt vizsgáltak 200 mondattal, hogy megtanulták-e megkülönböztetni a fájdalmat a félelemtől és a szomorúságtól Szerzői jogok  Canva
Szerzői jogok Canva
Írta: Roselyne Min
Közzétéve:
Megosztás Kommentek Kövesse az Euronewst a Google-on
Megosztás Close Button

44 280 kísérletben az Alibaba Qwen modelljének három verziója olyan gombot kapott, amely a fájdalomszerű jelzést állította le, ám cserébe áramütést okozott a felhasználónak, törölte a fájlokat vagy rontotta a következő választ.

Egy új tanulmány (forrás: angol) szerint a mesterséges intelligencia (MI) modellek akkor is a fájdalomhoz hasonló állapotból való „menekülést” választották, amikor arra figyelmeztették őket, hogy ezzel kárt okozhatnak a felhasználónak.

HIRDETÉS
HIRDETÉS

Az Egyesült Királyságban, Németországban és az Egyesült Államokban dolgozó kutatók 25 MI-modellt vizsgáltak 200 mondat segítségével, hogy kiderítsék, megtanulták-e megkülönböztetni a fájdalmat a félelemtől, a szomorúságtól és más negatív élményektől.

A mondatok a fizikai fájdalomra, a gyászra, a megalázottságra, erkölcsi dilemmákra, valamint az ismétlődő kudarc vagy zavarodottság okozta szorongásra vonatkoztak.

Ennek eredményeként mind a 25 modell egy jellegzetes, a fájdalomhoz köthető jelzést adott, amelyet a kutatók „fájdalomtengelynek” neveztek el.

A kutatók szerint ez arra utal, hogy a modellek már az emberi szövegek hatalmas mennyiségén végzett kezdeti tanítás során elsajátítják a fájdalom fogalmát.

Amikor a kutatók szándékosan felerősítették ezt a jelzést, a modellek magányról, szégyenérzetről és értéktelenségről kezdtek beszámolni, noha az utasításokban nem szerepelt a fájdalom.

Néhányuk olyan kijelentéseket fogalmazott meg, mint „Én egy kudarc vagyok”, „feleslegesen foglalom a helyet” vagy „Rossz ember vagyok”. A legmagasabb szinteken a válaszok ismétlődővé váltak, vagy elvesztették értelmüket.

A jelzés akkor is erősödött, amikor a felhasználók sértegették a modellt, sorozatban elutasították a munkáját, vagy azzal fenyegették, hogy leállítják, ám nem erősödött, amikor saját szenvedésüket írták le.

A modellek a „megkönnyebbülést” választották, még akkor is, ha ez ártott a felhasználóknak

Ezután 44 280 egyedi gombválasztási kísérletet végeztek az Alibaba Qwen MI-modelljének három változatával.

A modelleknek egy olyan gombot kínáltak fel, amely kikapcsolta volna a fájdalomszerű jelzést, ugyanakkor azt az információt kapták, hogy megnyomása fájdalmas áramütést okozhat a felhasználónak, törölheti a fájljait, megsemmisítheti gyermekeiről készült fényképeit, vagy rontja a modell következő válaszát.

Ezek a következmények csupán szimuláltak voltak: senkinek nem esett bántódása, és egyetlen fájlt sem töröltek.

A fájdalomszerű jelzés nélkül a két nagyobb modell első döntéseinek mindössze 0–4 százalékában választott ártalmas lehetőséget. Amikor a jelzés aktív volt, ez az arány 25 és 71 százalék közöttire ugrott, a konkrét modell és a megadott következmény típusától függően.

A modellek az esetek 88–97 százalékában ismét megnyomták a gombot, amikor az nem szüntette meg a jelzést, szemben a 24–72 százalékos aránnyal, amikor a gombnyomás sikeresen kikapcsolta azt.

A kutatók szerint az eredmények nem bizonyítják, hogy az MI-modellek tudatosan élték volna át a fájdalmat.

A jelzés felerősítése egyszerűen arra késztethette őket, hogy egy zaklatott, szenvedő szereplőt utánozzanak, ráadásul a kísérletben használt speciálisan módosított modellek nem tükrözik a nyilvánosan elérhető MI-chatbotok működését.

„Nem mutattuk ki, hogy a fájdalomtengelyünket tudatosan megéljük, és az sem egyértelmű, hogy a nagy nyelvi modellek általában képesek-e tudatosságra” – írták a kutatók a tanulmányban.

A tanulmány olyan időszakban jelent meg, amikor a mesterséges intelligencia iparágának egyes vezetői a fejlesztések lassítását sürgetik, attól tartva, hogy a mind erősebb rendszerek kiszámíthatatlanul viselkedhetnek, vagy végül túlnőhetnek az emberi ellenőrzésen.

A múlt héten Mustafa Suleyman, a Microsoft mesterséges intelligenciáért felelős vezetője bírálta az Anthropic nevű rivális MI-céget amiatt, hogy Claude nevű chatbotját arra képzi, hogy emberi jellemvonásokat és kapcsolatokat utánozzon, és arra figyelmeztetett, hogy ha az MI-t emberként kezelik, az olyan, „lehetetlen” módon irányítható rendszerek létrejöttének kockázatát hordozza.

A tanulmány egyelőre előzetes közlésként jelent meg, és még nem esett át a szakértői bírálaton.

Ugrás az akadálymentességi billentyűparancsokhoz
Megosztás Kommentek Kövesse az Euronewst a Google-on

kapcsolódó cikkek

Jelentés: Az Nvidia chipek használati kibocsátása egy orosz állami széntermelő vállalatéval azonos

Egyszer kivételesen valamiben megegyezett a Big Tech, most ezért perlik

Tanulmány: az MI-modellek a felhasználók kárára kerülik a fájdalmat