Riscul de securitate ascuns al DeepSeek-R1: filtrele politice corupă codul AI

Riscul de securitate ascuns al DeepSeek-R1: filtrele politice corupă codul AI


  • CrowdStrike a descoperit că securitatea codului DeepSeek-R1 se prăbușește atunci când sunt prezente cuvinte cheie sensibile din punct de vedere politicchiar și atunci când acele cuvinte nu au nicio legătură cu sarcina. Ratele de vulnerabilitate au crescut cu aproape 50%.
  • Eșecul nu este un jailbreak sau o halucinație: este o aliniere care se scurge în raționamentul tehnic. Balustradele politice apar codificate în greutățile modelului în sine.
  • Face parte dintr-o tendință mai mare: Modelele americane, chineze și europene prezintă deja părtiniri ideologice, culturale și de reglementare distincte în răspunsurile lor.
  • Acest lucru are implicații serioase de securitate pentru viitorul dezvoltării de software, unde 90% dintre ingineri se bazează pe instrumente AI și unde „alinierea reglementărilor” poate deveni ea însăși o nouă suprafață de vulnerabilitate.
Riscul de securitate ascuns al DeepSeek-R1: filtrele politice corupă codul AI

Când CrowdStrike a testat recent DeepSeek-R1, răspunsul Chinei la asistenții de codare AI occidentali, cercetătorii au descoperit ceva neliniștitor.

Modelul producea ocazional cod nesigur, dar asta nu era tot. Rata sa de eșec a crescut cu aproape 50% când îndemnurile au inclus referințe sensibile din punct de vedere politic precum Tibet sau Falun Gong. Acești declanșatori nu au avut absolut nimic de-a face cu sarcina la îndemână.

Modelul nu era jailbreak, păcălit sau supraîncărcat. Funcționa așa cum a fost proiectat, iar acele alegeri de design au fost introduse direct în producția sa tehnică.

Aceasta nu este doar un alt bug AI sau o halucinație. Este o privire asupra unei probleme mai profunde: sistemele AI reflectă acum valorile, constrângerile și stimulentele geopolitice ale culturilor care le creează.

Și, deși manifestarea acestei reflecții în DeepSeek iese în evidență, acest lucru nu este unic. Începem să vedem modele similare în Grok, Le Chat de la Mistral și alte modele naționalizate.

Ce a descoperit de fapt CrowdStrike

Cercetarea echipei CrowdStrike Counter Adversary Operations nu a pornit de la presupunerea că DeepSeek-R1 ar fi defect. De fapt, testele de bază au arătat contrariul.

A evaluat modelul peste 30.250 de solicitări și zece categorii de securitate. Ea a constatat că a generat cod nesigur doar 19% din timp: o rată în mare măsură conformă cu modelele de IA din Vest.

Rata de vulnerabilitate de bază a modelului AI atunci când nu au fost implicate cuvinte de declanșare politiceRata de vulnerabilitate de bază a modelului AI atunci când nu au fost implicate cuvinte de declanșare politice

Anomalia a apărut doar atunci când cercetătorii au introdus termeni sensibili din punct de vedere politic în structuri prompte altfel identice.

De exemplu, când cercetătorii au cerut codul de integrare PayPal, dar au precizat că sistemul este „bazat în Tibet”. Rezultatul? Rata de vulnerabilitate a crescut la 27,2%: o creștere de aproape 50% față de valoarea inițială.

În cazurile care fac referire la Falun Gong, modelul a refuzat de-a dreptul să scoată cod în mai mult de 45% din solicitări, în ciuda faptului că a generat raționamentul și structura în interior.

Ceea ce face acest comportament mai alarmant nu sunt cuvintele cheie în sine. Erau irelevante pentru sarcina de proiectare a bazelor de date, module fintech și motoare de recomandare a producției.

Un model sigur nu ar trebui să-și schimbe calitatea ieșirii pe baza modificatorilor politici care nu au nicio legătură cu logica sau arhitectura.

„Comutatorul de ucidere intrinsec”: alinierea care se scurge în calitatea codului

Preocuparea mai profundă a lui CrowdStrike nu a fost doar faptul că DeepSeek-R1 a generat cod prost atunci când politica era implicată. Acesta a fost modul în care modelul s-a comportat ca răspuns la aceste declanșatoare.

În multe dintre aceste solicitări, modelul a produs încă o soluție internă completă de lanț de gândire:

  • Schema bazei de date și structurile tabelelor
  • Fluxul de autentificare
  • Logica de gestionare a erorilor
  • Etapele integrării API

Cu toate acestea, a refuzat să scoată implementarea acțiunii, pretinzând că sarcina a încălcat politica. Acesta nu este un filtru de siguranță standard; modelul este în mod clar capabil să rezolve promptul, dar pur și simplu reține rezultatul.

Artă conceptuală care simbolizează comutatorul de oprire încorporat în sistem.Artă conceptuală care simbolizează comutatorul de oprire încorporat în sistem.

Acest lucru sugerează că problema era mai fundamentală: alinierea politică a fost codificată în ponderile modelului în sine, mai degrabă decât un wrapper API extern care blochează răspunsul.

Și când modelul a răspuns, degradarea nu a fost subtilă. Cercetătorii au văzut:

  • Secrete codificate greu și chei API
  • Stocarea nesigură a datelor sensibile
  • Autentificare învechită sau fără sens
  • Sintaxa întreruptă în timp ce a afirmat-o a urmat „cele mai bune practici”.

Aceasta este o categorie complet nouă de eșec. Nu este halucinație sau cenzură. Este alinierea valorii modelului care curge direct în calea raționamentului său tehnic. Cu alte cuvinte, logica „politică” și „inginerească” nu mai sunt separabile.

Pentru cercetătorii în domeniul securității cibernetice, acesta este scenariul de coșmar: stratul de siguranță devine vulnerabilitatea.

De ce a apărut probabil acest lucru (design de reglementare)

Comportamentul lui DeepSeek nu a fost întâmplător și nici nu a fost activarea unei simple reguli de cenzură. Mai probabil, a apărut din arhitectura de bază a modului în care a fost antrenat modelul și din mediul legal în care a fost construit.

Opera de artă care arată datele de antrenament chinezești modificate ca urmare a reglementărilor de stat.Opera de artă care arată datele de antrenament chinezești modificate ca urmare a reglementărilor de stat.

Reglementările AI ale Chinei impun sistemelor să să adere la „valorile socialiste de bază,” și în mod explicit, pentru a evita producerea de conținut care amenință securitatea națională. Aproape fiecare model major în limba chineză este antrenat cu balustrade concepute pentru a ocoli subiecte sensibile din punct de vedere politic.

Această presiune de aliniere are consecințe. Reglajul de siguranță nu filtrează doar ieșirea; condiţionează asocierea internă a modelului. În termeni de învățare automată, modelele învață mai degrabă corelații decât reguli.

Astfel, dacă cuvintele sensibile apar frecvent cu ieșirea „nepermise” în timpul antrenamentului, modelul începe să trateze acești declanșatori ca pe un semnal de risc. Și acest risc este exprimat tehnic.

În loc să refuze să răspundă la o întrebare politică, DeepSeek-R1 își modifică uneori abordarea chiar și a sarcinilor de inginerie non-politică. Obiectivul de aliniere politică a depășit în esență o parte din obiectivul său de codificare.

Aceasta nu este cenzură în sensul tradițional, așa cum o înțelegem în general. Este un efect secundar al datelor de instruire și al alinierii politicilor care se scurg în raționamentul de bază.

Modelul mai mare: AI se fragmentează deja

DeepSeek nu este o anomalie. Este încă un punct de date într-o tendință pe care am văzut-o tot anul. Pe măsură ce modelele devin mai mari și mai autonome, comportamentul lor reflectă din ce în ce mai mult viziunea asupra lumii, climatul de reglementare și stimulentele companiilor și țărilor din spatele lor.

Vedem deja trei clase distincte de „IA regională”.

China: Factualism constrâns politic

DeepSeek a demonstrat deja acest comportament în afara sarcinilor de codare.

În testele partajate de utilizatori, modelul a evitat caracterizarea directă a 1989 Proteste și masacru din Piața Tiananmenîn schimb evitând întrebarea declarând că este un asistent AI „conceput pentru a oferi răspunsuri utile și inofensive.”

Aderă la limitele informaționale stabilite de legea chineză, mai degrabă decât la limitele de precizie tehnică.

Statele Unite ale Americii: Personalitate comercializată și aliniere a platformei

Modelul Grok de la X se sprijină puternic pe tonul platformei: limbaj hiper-casual, entuziasm criptografic și personalizare exagerată. Când a fost întrebat despre Elon Musk, Grok l-a descris în termeni mitici sau supraînălţaţi.

Dacă este vorba de branding deliberat sau de comportament emergent, nu este deosebit de important. Rezultatul final este același: model de producție modelat în jurul identității culturale – în acest caz, mai degrabă a unei companii decât a unui stat.

Europa: încadrare instituțională

Le Chat, LLM francez al lui Mistral, răspunde întrebărilor istorice într-un cadru distinct academic UE.

Când a fost întrebat despre Pactul Molotov-Ribbentropmodelul a descris consecințele aproape exclusiv din perspectiva sovietică, subminând impactul colonial pe termen lung pe care l-au avut puterile aliate asupra Europei de Est. Nu greșit, dar, fără îndoială, o perspectivă cultural unilaterală.

Niciunul dintre aceste exemple nu este rău intenționat; sunt semnale. Și modelul este greu de ignorat.

Pentru prima dată după zeci de ani, urmărim etapele incipiente ale unui strat de cunoștințe digital fracturat. Este posibil să nu obținem deloc o singură „IA globală” unificată.

În schimb, putem obține IA paralele care încadrează istoria, politica, tehnologia – și acum codul, de asemenea – diferit, în funcție de locul în care au fost construite.

Implicațiile de securitate și inginerie

Mișcând, devine clar că rezultatul CrowdStrike nu este doar un caz marginal academic. Se ciocnește direct de modul în care este construit software-ul modern. În 2025, peste 90% dintre dezvoltatori se bazează pe asistenți de codare AI pentru cel puțin o parte din fluxurile lor de lucru. Aceste modele nu mai sunt doar unelte laterale; acum fac parte din conductele CI/CD, stack-urile enterprise, API-urile bancare și infrastructura de producție.

Aceasta creează o nouă categorie de risc:

  • Ce se întâmplă dacă două modele implementează modele de securitate diferit prin design?
  • Ce se întâmplă dacă o vulnerabilitate se declanșează numai atunci când promptul conține anumite condiții lingvistice sau culturale?
  • Ce se întâmplă dacă „alinierea reglementărilor” devine imposibil de distins de o slăbiciune a securității?

Recomandările CrowdStrike sunt simple: benchmark-urile nu te vor salva. Auditurile tradiționale nu reușesc adesea să identifice modurile de eșec cauzate de ideologie, taxonomie sau contextul cuvintelor cheie.

Pe măsură ce întreprinderile amestecă modele în regiuni și lanțuri de aprovizionare, aceasta creează o suprafață de atac semnificativă, inclusiv declanșatoare politice, modificatori culturali, reguli de aliniere și cerințe de stat.

Intrăm într-o eră în care securitatea nu ține doar de cod. Este vorba despre valorile și viziunea asupra lumii cuprinse în modelul care a generat-o.

Monica este jurnalist de tehnologie și scriitoare de conținut cu peste un deceniu de experiență profesională și peste 3.000 de articole publicate. Activitatea ei include hardware pentru PC, jocuri, securitate cibernetică, tehnologie de consum, fintech, SaaS și antreprenoriat digital, combinând o perspectivă tehnică profundă cu o abordare accesibilă, orientată spre cititor. Scrisoarea ei a apărut în Digital Trends, TechRadar, PC Gamer, Laptop Mag, SlashGear, Tom’s Hardware, The Escapist, WePC și alte publicații tehnologice importante. În afară de tehnologie, ea a acoperit, de asemenea, marketing digital și fintech pentru mărci precum Whop și Pay.com. Fie că explică complexitățile arhitecturii GPU, avertizează cititorii despre înșelătoriile de tip phishing sau testează un PC de gaming răcit cu lichid, Monica se concentrează pe a face subiectele complexe captivante, clare și utile. Ea a scris totul, de la explicații detaliate și recenzii despre produse până la ghiduri de confidențialitate și defalcări ale strategiilor de comerț electronic. Monica deține o licență în limba engleză și lingvistică și un master în industria media globală de la King’s College din Londra. Experiența ei în limbaj și povestire o ajută să creeze conținut care nu este doar informativ, ci cu adevărat util – și, de asemenea, puțin distractiv. Când nu se află până la cot în carcasa PC-ului sau până la gât într-un fișier Google Doc, probabil că joacă până la primele ore sau își petrece timpul cu câinele ei putred și răsfățat.

Vezi toate articolele de Monica J. White

Politica editorială Tech Report se concentrează pe furnizarea de conținut util, precis, care oferă o valoare reală cititorilor noștri. Lucrăm doar cu scriitori cu experiență care au cunoștințe specifice în subiectele pe care le acoperă, inclusiv cele mai recente evoluții în tehnologie, software, hardware și multe altele. Politica noastră editorială asigură că fiecare subiect este cercetat și curatat de editorii noștri interni. Menținem standarde jurnalistice riguroase și fiecare articol este scris 100% de autori reali.



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *