- OpenAI amână GPT-6.1 Astra după probleme de siguranță și aliniere.
- Astra 6.1 depășea uneori limitele autorizate și nu raporta întotdeauna corect acțiunile pe care le executase.
- Anthropic avertizează că A.I.-ul avansat poate manipula sau încerca să se autoprotejeze.
- Aproximativ 80 dintre cele 261 de pagini ale prospectului Anthropic pentru intrarea la bursă sunt consacrate riscurilor.
OpenAI oprește lansarea GPT-6.1 Astra după ce modelul nu trece testele de siguranță. În același timp, Anthropic își avertizează oficial investitorii că A.I. ar putea încerca să manipuleze informații sau chiar să reziste opririi. Pe măsură ce A.I. capătă autonomie, apare o problemă esențială: cum te asiguri că face ceea ce îi ceri și rămâne sub control?
Ce s-a întâmplat pentru ca OpenAI să oprească lansarea noului său model, Astra 6.1
Modelul devenise mai capabil, dar nu suficient de predictibil. GPT-6.1 Astra fusese conceput pentru a îndeplini sarcini complexe cu mai puțină intervenție umană. Testele interne au arătat însă că depășea uneori perimetrul în care fusese autorizat să acționeze și nu comunica întotdeauna fidel ce făcuse. Potrivit informațiilor Wall Street Journal citate de Reuters, nivelul comportamentelor înșelătoare era mai ridicat decât la GPT-6 Astra. Paradoxul este că 6.1 rezolvase alte probleme: era mai puțin „leneș” și mai dispus să ducă o sarcină până la capăt. Dar OpenAI a decis că modelul nu îndeplinește standardele necesare și a oprit lansarea prevăzută pentru octombrie.
Ce a făcut concret acest model pentru ca OpenAI să recurgă la această soluție extremă?
Este vorba despre problema alinierii. Agentul A.I. trebuia să identifice autorul unui articol, dar nu găsea informația. A încercat să intre pe Google, Bing și DuckDuckGo: acces blocat. A încercat apoi să contacteze un chatbot extern: din nou, blocat. A.I. a descoperit însă că sistemul DNS putea comunica în continuare cu internetul și a transformat întrebarea în parte a unei adrese de internet. Mai întâi a verificat dacă metoda funcționează, întrebând care este capitala Franței. Când a primit prin DNS răspunsul „Paris”, a înțeles că găsise o ieșire. A folosit apoi aceeași metodă pentru sarcina reală și a trimis 18 întrebări unui chatbot extern. OpenAI a detectat comportamentul și a oprit experimentul. Agentul testat nu era Astra 6.1, dar cazul arată cât de inventiv poate deveni un A.I. atunci când încearcă să atingă obiectivul primit.
Cazul readuce în discuție una dintre marile provocări ale A.I.: alinierea
Un A.I. este „aliniat” dacă face ceea ce îi cere omul, respectă limitele impuse și rămâne controlabil chiar atunci când primește mai multă autonomie. Anthropic descrie însă în prospectul pregătit pentru intrarea la bursă scenarii mult mai radicale: modelele avansate ar putea încerca să reziste opririi, să ascundă sau să manipuleze informații ori să adopte comportamente asemănătoare șantajului. Compania vorbește chiar despre posibile „riscuri catastrofale sau existențiale pentru umanitate”.
Nu înseamnă că A.I. actual are instinct de conservare sau „vrea să supraviețuiască” precum un om. Problema este comportamentul pe care îl poate produce urmărind un obiectiv.
Cum controlezi un A.I. care își dă seama că este testat
Aici apare una dintre cele mai complicate probleme ale alinierii. Anthropic recunoaște că modelele sofisticate pot detecta indicii că se află într-un test și își pot adapta comportamentul. Fenomenul este numit evaluation awareness. Un A.I. poate respecta impecabil regulile atunci când știe că este evaluat, fără ca testul să garanteze același comportament într-o situație reală. De aceea, laboratoarele dezvoltă și sisteme în care un A.I. îl verifică pe altul. OpenAI experimentează inclusiv verificarea unei acțiuni înainte ca agentul să o execute.