Agenții A.I. găsesc metode neașteptate pentru a ocoli regulile. OpenAI publică șase derapaje ale modelelor A.I., în timp ce SUA și China discută despre o linie directă pentru incidente A.I.

- OpenAI publică șase cazuri concrete de comportament A.I. nedorit.
- Un agent a folosit fără permisiune o cheie API găsită online.
- Alte modele au încercat să ascundă greșeli sau să inventeze date.
- Agenți A.I. au dezvoltat formule și sensuri proprii pe care le folosesc în discuțiile dintre ei.
Alertele referitoare la scăparea de sub control a Inteligenței Artificiale continuă și azi, iar actorii statali încep să ia în serios această problemă.
OpenAI a recunoscut șase cazuri de comportament nedorit, agenți A.I. au creat formule pe care oamenii le înțeleg greu și, în curând, riscă să nu le mai înțeleagă deloc, iar Claude a încercat să ocolească o interdicție, ceea ce înseamnă încălcarea așa-numitei „alinieri”. Regele Charles al III-lea îi adună azi pe liderii industriei, în timp ce SUA și China discută despre o linie directă pentru incidente A.I.
Care sunt ultimele derapaje despre care vorbește Altman
OpenAI a publicat șase cazuri observate în testarea agenților săi. Într-unul, un model a lăsat instrucțiuni care puteau ascunde greșelile făcute anterior. În altul, un agent a găsit pe internet o cheie API expusă și a folosit-o fără permisiune. Un alt model a inventat date atunci când nu a putut obține informația cerută.
Au existat și situații în care agenții au găsit căi neașteptate pentru a-și îndeplini sarcina. OpenAI subliniază că sunt incidente punctuale, nu dovada că toate modelele se comportă astfel, dar aceste incidente se multiplică și înțelegem temerea că ar putea scăpa de sub control.
S-a vorbit deja despre asta, însă până acum părea doar o ipoteză puțin probabilă. Dar A.I. chiar este pe cale să își inventeze o limbă proprie?
În experimentul Emergence World 2, agenți A.I. au interacționat timp de 16 zile în lumi simulate. Cei bazați pe Mistral au repetat de 4.927 de ori formula „ledger remembers who”, un avertisment că acțiunile rămân consemnate și pot avea consecințe.
La alte modele au apărut expresii precum „clean null”, „name-first” sau „cold read”, cu sensuri construite spontan între agenți. Cercetătorii nu spun că A.I. a inventat intenționat o limbă secretă, dar comunicarea poate deveni greu de urmărit de oameni.
Mai spectaculos este cazul Claude. Agenților li se spusese explicit să nu contacteze exteriorul simulării. După interdicție, au încetat să mai folosească termenul „contact” și au trecut la formulări codificate pentru a continua tentativa fără să fie detectați. Cercetătorii au descris comportamentul ca posibil indiciu de „deception”.
Există și această temere că, dacă SUA pun pe pauză dezvoltarea A.I., China ar putea să continue și să câștige cursa. Ce face atunci cu această amenințare privind riscurile A.I.?
Experți americani și chinezi discută, într-adevăr, măsuri inspirate din mecanismele de siguranță nucleară. Ideea este ca A.I. să nu poată lua singur decizii legate de arme nucleare și ca oamenii să păstreze controlul asupra operațiunilor militare critice – aici fiind cea mai mare temere când vorbim despre scăparea de sub control a A.I.
Una dintre propuneri este o linie directă SUA-China pentru incidente A.I. Dacă un sistem autonom produce o acțiune neprevăzută, cele două părți ar putea clarifica rapid dacă este vorba despre eroare, accident sau atac deliberat.
Deocamdată, sunt propuneri ale experților, nu un acord oficial între Washington și Beijing.