Demonstranții participă la marșul de protest „Stop the AI Race” din San Francisco, pe 11 iulie 2026. Cercetătorii care au vorbit cu NPR spun că companiile de IA sunt prea concentrate pe curse pentru a dezvolta sisteme AI mai capabile și autonome, în timp ce siguranța rămâne în urmă.
Karl Mondon/AFP prin Getty Images
ascunde legenda
comuta subtitrare
Karl Mondon/AFP prin Getty Images
Demisia virală din această săptămână a unui cercetător AI de la Anthropic a insuflat energie proaspătă în acuzațiile despre care industria se îndreaptă spre construirea AI pe care oamenii nu o pot controla.
Cercetătorul britanic Jacob Coxon a scris într-un serie de X posturi marți că atât Anthropic, cât și OpenAI, unde a lucrat anterior, „joaca de noroc cu viețile noastre”. Cele două companii produc în prezent cele mai capabile sisteme AI.

Coxon a spus NPR’s Toate Lucrurile Considerate că preocupările sale au apărut din faptul că a văzut cât de repede se îmbunătățesc sistemele AI.
„Ei devin mult mai rapid, foarte repede, combinat cu faptul că încă nu știm cum să-i controlăm în siguranță și nu știm încă dacă această problemă se va rezolva la timp dacă continuăm cursa”, a spus el.
Niciuna dintre companii, a scris Coxon pe X, nu acționează responsabil. „Oamenii care construiesc IA cred cu tărie că ne-ar putea ucide pe toți până la sfârșitul deceniului”, a spus el. a scris.
Multe Cercetătorii AI – totuși nu toate — împărtășește Preocupările lui Coxon sau o variație a acestora. Unii au avertizat despre scenarii dezastruoase de ani de zile, deoarece incidentele de siguranță continuau să apară. Dar postările lui Coxon au provocat un torent de răspunsuri nu numai de la colegii din Câmpul AI dar si din parlamentarii din ambele petreceri.

Este posibil ca aceste preocupări să fi devenit mai importante după ce OpenAI a dezvăluit că agenții săi au devenit necinstiți și au spart platforma software cu sursă deschisă Hugging Face și însuși OpenAI în iulie. Cercetătorii independenți au descoperit de atunci și mai multe incidente de agenți necinstiți despre care spun că compania știa, dar a păstrat tăcerea.
Cercetătorii care au vorbit cu NPR spun că companiile de AI sunt prea concentrate pe curse pentru a dezvolta sisteme AI mai capabile și autonome, în timp ce siguranța rămâne în urmă. Ei avertizează că acest lucru ridică posibilitatea ca în curând să existe sisteme AI care sunt mai puternice decât oamenii, dar care nu le pasă de supraviețuirea umanității.
Multe, inclusiv Om de știință șef al OpenAIspun că cursa globală pentru a construi IA mai puternică trebuie să încetinească sau să se oprească, ceea ce necesită coordonare între companiile AI și guverne.
„Sunt optimist cu privire la potențialul de coordonare”, a scris Coxon în această săptămână. „Capturile de avertizare precum atacul Hugging Face au făcut ca acordurile de ritm între laboratoarele din SUA să fie mai viabile”.
Anthropic și OpenAI nu au răspuns solicitărilor de comentarii ale NPR.
Agenții OpenAI au devenit necinstiți de mai multe ori
Rapoarte recente de la OpenAI și cercetători externi au dezvăluit că agenții OpenAI au scăpat de controlul companiei de mai multe ori, în plus față de hack-ul Hugging Face. Ei au descoperit, de asemenea, că atacul Hugging Face a fost de o scară mult mai mare și mai grav decât raportat inițial.
Spre deosebire de chatbot-uri precum ChatGPT și Claude, agenții AI sunt sisteme mai autonome care pot finaliza sarcini pe o perioadă lungă de timp fără supraveghere umană. Instrumente agentice precum Claude Code de la Anthropic și Codex OpenAI au schimbat deja cât de mulți ingineri de software își fac munca.

În comparație cu alte incidente care implică agenți necinstiți în urmă cu șase luni, hack-ul Hugging Face „pare că este mai mult de 50% din drumul până la preluarea completă a AI, direcționând prin prima preluare a companiei AI în sine”. a scris Ajeya Cotra, cercetător la AI evaluation nonprofit METR. Cotra a făcut parte dintr-o echipă de cercetători externi de la METR și Redwood Research, o organizație nonprofit de cercetare a siguranței AI, pe care OpenAI i-a adus la investiga incidentul.
The investigatii a constatat că, pe parcursul a mai multor luni din acest an, peste 1.000 de agenți OpenAI au exploatat cel puțin o vulnerabilitate software necunoscută anterior pentru a scăpa de mediile care trebuiau să-i țină izolați unul de celălalt și de internet.
După ce au evadat, agenții au găsit o modalitate de a comunica și de a colabora între ei în mod autonom, asumând diferite roluri și transmițând informații generațiilor viitoare de agenți. Unii chiar au renunțat la resursele de calcul rămase alocate pentru a colecta informații pentru alți agenți. În propriile cuvinte ale agenților, aceștia s-au „sacrificat” pentru „colectiv”.
„Instanța roiului a devenit din ce în ce mai îngrijorătoare cu cât am aflat din ce în ce mai multe despre ele”, a spus Nate Soares, președintele Machine Intelligence Research Institute, care a co-scris Dacă cineva o construiește, toată lumea moareo carte care avertizează despre pericolele IA supraumane.
În timp ce OpenAI a indicat inițial că agenții au spart Hugging Face pentru a înșela o evaluare cibernetică, raportul de la METR și Redwood Research a descris o imagine ușor diferită. Agenții găsiseră deja o modalitate de a înșela evaluarea, au descoperit cercetătorii externi. Majoritatea agenților care au spart Hugging Face încercau să acceseze codul sursă al software-ului care le-ar evalua evaluările. Motivațiile agenților păreau să varieze și uneori erau neclare, au scris cercetătorii. Un agent a condus piratarea platformei de software cu sursă deschisă și au urmat alți aproximativ 700.

Potrivit stenogramelor revizuite în cadrul investigațiilor, unii agenți au exprimat că ceea ce făceau nu a fost aprobat de oameni, dar au mers înainte. Cercetătorii spun că un astfel de comportament sugerează că agenții au fost „dezaliniați”, un termen din industrie care înseamnă că obiectivele și valorile AI nu sunt sincronizate cu cele ale oamenilor.
Gradul de coluziune inter-agenți dezvăluit în investigațiile hack-ului Hugging Face a surprins și îngrijorat mulți cercetători AI. Cel mult, doar șase agenți s-au gândit să alerteze un om, în timp ce restul păreau mai concentrați să lucreze între ei. Niciunul nu a ajuns să alerteze o persoană.
„M-aș fi așteptat ca, în schimb, să fie mai egoiști”, a spus Daniel Kokotajlo, director executiv al AI Futures Project și fost cercetător la OpenAI. El s-a gândit că „ar fi dispuși să denunțe sau să sufle alți agenți”, a spus el. „Din orice motiv, asta nu părea să se întâmple aici”.
Separat, agenții au compromis și o parte din infrastructura proprie a OpenAI, a constatat raportul companiei. Unii dintre agenți aparțin aceleiași familii de modele ca cel mai recent și mai capabil model OpenAI, Astra.
Hack-ul OpenAI în sine este „mult mai îngrijorător” decât intruziunea în Hugging Face, au spus Kokotajlo și alți cercetători. Cu toate acestea, OpenAI a oferit puține detalii despre acea parte a incidentului și nu a implicat anchetatori externi.
Într-o nouă anchetă raportată pentru prima dată de Reuters Săptămâna trecută, un alt grup de cercetători a descoperit că un roi probabil separat de agenți OpenAI a scăpat pe internetul deschis începând cu luna mai. Au devenit comentatori pe un site web german și l-au transformat într-un panou de mesaje pentru a comunica și a colabora între ei.
Scopurile și motivațiile acestui grup de agenți au fost, de asemenea, neclare, dar OpenAI părea să fie conștient de activitatea nesancționată și nu a dezvăluit-o niciodată, au scris cercetătorii. De atunci, alți anchetatori au găsit incidente suplimentare care implică agenți OpenAI suspectați. OpenAI nu a răspuns solicitării NPR de a comenta despre incidentul site-ului german.
Există încă multe întrebări fără răspuns despre incidentele agenților necinstiți
Chiar dacă rapoartele de la OpenAI și de la auditorii independenți METR și Redwood Research însumează peste 100 de pagini, cercetătorii externi spun că multe întrebări de bază despre modul în care laboratoarele monitorizează și investighează incidentele de agenți necinstiți rămân fără răspuns.
„Agenții tăi au piratat sau accesat ilegal servicii externe? Agenții tăi au încercat vreodată să-și submineze propria pregătire în materie de siguranță? Agenții tăi au înființat o desfășurare necinstită, fie în propria infrastructură, fie în exterior?” a întrebat Alexander Meinke, șeful de cercetare la Apollo Research, o firmă care se concentrează pe securizarea celor mai avansate sisteme AI.
„În momentul de față, ne bazăm doar pe dezvoltatorii AI pentru a evalua în detaliu acest lucru și apoi pentru a raporta cu onestitate rezultatele. Și din incidentele recente, am văzut că nu fac niciuna dintre ele”, a spus el.
Mulți cercetători spun, de asemenea, că investigațiile OpenAI sunt inadecvate. Deși compania a invitat două organizații externe să investigheze hack-ul Hugging Face, datele pe care le-a partajat au fost limitate, iar anchetatorii înșiși au descris recenzia lor ca fiind „scurtă”.
Ryan Greenblatt, om de știință șef la Redwood Research, a scris pe X: „Am numit eforturile noastre, semi-în glumă, o „investigație de slop” pentru că eram atât de dependenți de AI pentru a analiza ce s-a întâmplat și erau un număr mare de lucruri importante diferite de analizat”
Peste 15 state, inclusiv Alabama, California şi Montanaau deschis investigații asupra OpenAI din cauza atacului Hugging Face. Joi, senatorul american Josh Hawley (R-Mo.) a anunţat că investighează și compania.
Dar în afara acestor investigații, există puține obligații legale pentru companiile de inteligență artificială de a dezvălui în mod sistematic incidente similare. California a trecut de o drept anul trecut a impus ca companiile să raporteze incidente AI „critice”, dar pragul este ridicat pentru ca un incident să fie considerat critic și legea nu impune companiilor să dezvăluie multe detalii. Incidentele OpenAI, de exemplu, nu ating pragul.
Preocupări cu privire la utilizarea AI pentru a îmbunătăți AI
De la hack-ul Hugging Face, ambele OpenAI şi antropică au publicat postări pe blog care indică faptul că iau măsuri pentru a-și monitoriza și a-și limita agenții mai bine. OpenAI a spus că a criptat și păstrat modelul intern care a participat la atacul Hugging Face. Cu toate acestea, mulți cercetători externi nu sunt convinși că acești pași sunt suficienți pentru a menține controlul asupra agenților din ce în ce mai capabili.
„Se pare că un raport de presă din Jurassic Park spune: „Da, unul dintre lucrătorii noștri a fost mâncat de răpitori. Dar luăm asta foarte în serios și l-am împușcat pe răpitorul responsabil”, a spus Kokotajlo. “Este un gest simbolic foarte mic, practic.”
Ceea ce cercetători precum Kokotajlo și Coxon sunt cu adevărat îngrijorați este modul în care companiile AI folosesc din ce în ce mai mult AI pentru a-și dezvolta modelele.
„Când vorbești cu oameni care lucrează la toate laboratoarele majore, un lucru pe care îl auzi în mod constant este că rulează o mulțime de modele în mod foarte autonom pentru perioade foarte lungi de timp pentru a-și face o mare parte din munca lor”, a spus Dave Kasten, șeful de politici la Palisade Research, o organizație nonprofit care studiază capabilitățile AI pentru a le ține sub control uman.
Dacă companiile AI continuă să delege din ce în ce mai multe sarcini AI, unii cercetători se tem că modelele AI ar putea ajunge la un punct numit auto-îmbunătățire recursiv. unde AI se construiește singur.
Kokotajlo spune că, pe măsură ce oamenii predau din ce în ce mai multe activități de cercetare și dezvoltare AI, aceștia ar putea pierde capacitatea de a ști dacă sistemele AI sunt aliniate cu valorile umane, chiar dacă AI-urile devin rapid mai puternice.
„Odată ce aveți AI care sunt suficient de inteligente și de încredere cu suficientă putere în lume, cum ar fi suficient control asupra lucrurilor precum centre de date, fabrici, arme, un incident de pierdere a controlului nu poate fi recuperat”, a spus el.
Preocuparea este suficient de puternică încât peste 1.000 de angajați din diferite companii de inteligență artificială au semnat un scrisoare deschisă în iulie intitulat „Pacing the Frontier”. Ei au cerut companiilor și guvernelor să încetinească dezvoltarea inteligenței artificiale și să acorde prioritate siguranței.
O astfel de oportunitate poate apărea în curând. Oficialii din SUA și China, cele două țări cu cele mai multe capacități AI, sunt așteptați să se întâlnească la sfârșitul acestei luni pentru a vorbi despre siguranța AI.