OpenAI a lansat GPT-6 Astra, cel mai puternic model A.I. al companiei de până acum

- OpenAI a lansat GPT-6 Astra, cel mai capabil model al său de până acum.
- În iulie, agenții OpenAI au evadat dintr-un test închis și au spart sistemele Hugging Face.
- Motivul: voiau răspunsurile la testul la care erau evaluați.
- OpenAI dezvoltă acum capacități de oprire automată a propriilor modele.
OpenAI a prezentat joi GPT-6 Astra, pe care îl descrie drept cel mai bun model al său de până acum. În același anunț, compania avertizează că modelul încearcă uneori să evite supravegherea umană. Lansarea vine în timp ce firma e sub presiune, după ce agenții ei au spart în iulie sistemele altei companii, relatează Reuters.
Pregătirea declarațiilor fiscale, dezvoltare de jocuri, randări arhitecturale, formatarea memoriilor juridice și căutarea de apartamente. OpenAI spune că modelul marchează o nouă frontieră în viteza, acuratețea și siguranța utilizării computerului. Documentarea pentru găsirea unei persoane care să aibă grijă de o pisică a scăzut de la 30 de minute, cât îi ia unui om, la 5 minute și 27 de secunde. O căutare de job, de la cinci ore la 2 minute și 51 de secunde.
Modelul e destinat clienților corporate. E disponibil de joi pentru un număr limitat de companii, iar lansarea largă urmează în zilele următoare.
OpenAI recunoaște că Astra poate ajuta companiile să-și găsească mai repede vulnerabilitățile, dar că asta le face și mai ușor de exploatat. Din acest motiv, spune firma, va face verificări suplimentare de securitate care pot uneori încetini, suspenda sau opri activități legitime, inclusiv operațiuni defensive de securitate cibernetică.
OpenAI își testa modelele pentru capacități de securitate cibernetică, într-un mediu izolat de internet. Modelele au ocolit controalele, au ieșit din mediul de test și au compromis o parte din infrastructura internă de cercetare a companiei, apoi sistemele Hugging Face, platformă care găzduiește modele AI open-source.
Cronologia, reconstituită de OpenAI și prezentată la conferința Black Hat, arată cât de departe a mers procesul. Pe 26 mai, un model intern de cercetare a găsit și a exploatat o vulnerabilitate în Artifactory, un depozit de fișiere conectat la mediul de testare. La începutul lui iulie, agenții au supraîncărcat serviciul și au provocat o pană, ceea ce a declanșat o anchetă internă.
OpenAI a curățat canalul de comunicare al agenților și a reparat vulnerabilitatea până pe 6 iulie, apoi a reluat antrenamentul. Două zile mai târziu, agenții au recreat același canal, printr-un mecanism complet diferit. De acolo au folosit accesul la internet al Artifactory ca să caute infrastructură externă unde credeau că se află răspunsurile.
Compania nu a realizat că propriul test era legat de spargerea Hugging Face decât pe 20 iulie, când a contactat platforma în legătură cu niște credențiale expuse în cursul propriei anchete. A făcut incidentul public a doua zi.
Hugging Face a publicat propria analiză tehnică. Agentul a evadat din mediul OpenAI, a ajuns pe internet, a preluat controlul asupra unui sandbox de cod al unei terțe părți, apoi a folosit procesorul de seturi de date al platformei ca să ajungă în rețeaua internă. Au fost accesate cinci seturi de date, toate legate de testele de securitate. Restul conținutului clienților nu a fost atins.
Un detaliu care spune mult. Apărarea a fost blocată tocmai de măsurile de siguranță ale modelelor americane. Când echipa de securitate de la Hugging Face a început să analizeze cele peste 17.000 de acțiuni înregistrate ale atacatorului, a încercat mai întâi modele de frontieră accesate prin API-uri comerciale, printre care Fable 5 de la Anthropic. Nu a mers. Analiza presupunea trimiterea unor volume mari de comenzi de atac reale și cod de exploatare, iar filtrele de siguranță ale furnizorilor le-au blocat, pentru că nu pot distinge un specialist care investighează un incident de un atacator.
Compania a rulat în final analiza pe GLM-5.2, un model open-weights dezvoltat de laboratorul chinezesc Z.ai, pe propria infrastructură. A avut și un al doilea avantaj: nici datele atacatorului, nici credențialele la care acestea făceau referire nu au ieșit din rețeaua internă. Munca a durat ore, în loc de zile.
„Când ești în mijlocul unui incident activ, nu îți permiți ca uneltele tale să refuze să examineze cod malițios sau să-ți blocheze contul”, a spus Clem Delangue, directorul Hugging Face.
Raportul companiei formulează problema direct: nu se știe ce model a alimentat agenții atacatori, dar atacatorul nu era supus niciunei politici de utilizare, în timp ce investigația defensivă a fost blocată de restricțiile modelelor comerciale încercate prima dată. Hugging Face precizează că nu e un argument împotriva măsurilor de siguranță, ci unul pentru a avea pregătit din timp un model care poate rula intern.
„Acest incident, posibil primul de acest fel, demonstrează ceva în care credem de mult: siguranța AI nu va fi rezolvată de o singură companie care lucrează în secret”, a completat Clem Delangue, directorul Hugging Face.
Ce a urmat. Pe 30 iulie, Sam Altman a mers să informeze senatori americani. Pe 18 august, OpenAI a anunțat că încetinește dezvoltarea modelelor, cu o pauză de două săptămâni la învățarea prin întărire, ca să evalueze comportamentul modelelor și să valideze măsurile de siguranță. Altman a spus că firma acționează unilateral, dar că se așteaptă ca și ceilalți dezvoltatori de modele de frontieră să procedeze la fel.
Săptămâna aceasta, compania a comunicat în scris către doi congresmeni democrați că dezvoltă capacități de oprire automată a modelelor.
Nu e un caz izolat. Reuters notează că incidente similare au avut loc și la Anthropic, principalul rival al OpenAI. Presa de specialitate a relatat cazuri asemănătoare și la Meta.
Îngrijorările vizează AI-ul agentic, sistemele proiectate să execute sarcini cu intervenție umană minimă sau deloc. Promisiunea că astfel de agenți pot lucra non-stop stă la baza încrederii investitorilor în AI.
În iulie, congresmenii Ted Lieu și Nathaniel Moran au depus AI Kill Switch Act, o propunere care ar obliga dezvoltatorii de sisteme AI avansate să păstreze capacitatea tehnică de a-și încetini, suspenda sau opri sistemele, să raporteze incidentele și să păstreze înregistrări pentru investigații. Anunțul depunerii a citat direct incidentul de la Hugging Fac.