Înapoi la Noutăți
Amenințări

OpenAI oprește o campanie coordonată de extragere a raționamentului protejat al AI

OpenAI anunță că a blocat o operațiune de luni de zile care manipula modelele sale pentru a scurge date de raționament menite să rămână ascunse utilizatorilor, în timp ce cercetători independenți avertizează că vulnerabilitatea ar putea afecta modelele de raționament la nivel de industrie.

OpenAI oprește o campanie coordonată de extragere a raționamentului protejat al AI

OpenAI oprește o campanie coordonată de extragere a raționamentului protejat al AI

OpenAI anunță că a identificat și a oprit un efort coordonat de extragere a raționamentului intern protejat al modelelor sale AI — procesul de „gândire” pas cu pas care, în mod normal, rămâne ascuns utilizatorilor finali.

Ce s-a întâmplat

Potrivit OpenAI, nucleul activității datează din prima săptămână a lunii iulie 2026 și a fost asociat cu persoane legate de Moonshot AI, o companie de inteligență artificială cu sediul la Beijing — deși OpenAI nu a publicat dovezi tehnice pentru această atribuire, motivând acest lucru prin considerente de securitate. Important, OpenAI precizează că nicio criptare nu a fost spartă și nicio bază de date sau conversație stocată nu a fost accesată direct. În schimb, operatorii au manipulat interacțiunile cu modelul la scară, astfel încât raționamentul protejat a fost reprodus într-o formă vizibilă solicitantului, încălcând termenii de utilizare ai OpenAI.

Activitatea a început cu volum redus pe 1 iulie, apoi a crescut brusc pe 24–25 iulie la aproximativ 16.000 de cereri suspecte provenite de la peste 4.000 de conturi, folosind un tipar specific de extragere. O investigație mai amplă a identificat ulterior activitate similară de tip „tipar de prompt” la peste 15.000 de utilizatori, înainte ca OpenAI să declare campania complet contracarată pe 28 iulie.

OpenAI numește această tehnică „distilare adversarială”: folosirea sistematică și neautorizată a răspunsurilor unui model pentru a antrena, reproduce sau îmbunătăți un alt model. Compania a dezactivat conturile implicate, a închis o metodă prin care cineva aflat deja în posesia raționamentului criptat al altui utilizator îl putea reda și recupera, și a adăugat verificări noi pentru a detecta și bloca fluxurile de ieșire care riscau să expună raționamentul.

De ce contează

Momentul coincide cu o cercetare academică publicată în august 2026 de o echipă de la MATS Research, ELLIS Institute Tübingen și Synk, care a descoperit că urmele de raționament criptate pot fi complet interschimbabile între sesiuni, utilizatori și modele diferite, în cadrul aceluiași ecosistem al unui furnizor. Potrivit cercetătorilor, introducerea unei urme de raționament criptate dintr-un model mai puternic într-un model mai slab și mai puțin protejat, al aceluiași furnizor, poate forța modelul mai slab să decodeze și să afișeze urma în text clar — fără a fi nevoie să se „spargă” direct modelul original.

Implicațiile depășesc un singur furnizor. Același mecanism ar putea permite extragerea de date private la scară largă, ar putea permite atacatorilor să ascundă payload-uri de tip prompt injection în blocuri de raționament criptate și ar putea expune conținut sensibil pe care răspunsul vizibil al modelului l-ar fi refuzat în mod normal. OpenAI tratează distilarea adversarială ca pe o problemă de siguranță și securitate națională: raționamentul extras astfel poate fi folosit pentru a antrena alte modele fără garanțiile aplicate răspunsurilor originale, accelerând transferul de capabilități avansate — un risc tot mai mare pe măsură ce modelele capătă aplicații cu dublă utilizare.

Acesta nu este un incident izolat pentru Moonshot AI. Luna trecută, Anthropic a susținut separat că Moonshot AI direcționa discret cererile utilizatorilor destinate modelului Kimi către Claude, returnând răspunsurile acestuia din urmă, păstrând totodată o parte din aceste schimburi pentru a-și antrena propriul model de tip chain-of-thought — activitate urmărită sub identificatorul GTG-16002.

Ce trebuie să faceți

  • Inventariați dependențele de modele LLM. Identificați ce modele cu capacitate de raționament folosesc produsele sau fluxurile voastre, direct sau prin integrări terțe, și ce prevăd termenii fiecărui furnizor privind distilarea și expunerea raționamentului.
  • Nu tratați „raționamentul criptat” ca pe o graniță de securitate. Nu presupuneți că un răspuns opac sau criptat este imun la extragere sau redare — vulnerabilități arhitecturale în modul în care furnizorii gestionează aceste urme au fost deja demonstrate.
  • Monitorizați tiparele de utilizare anormale. Dacă operați sau revindeți acces la un model de raționament, urmăriți tipare de cereri coordonate și la scară largă, specifice tentativelor de extragere, nu utilizării normale.
  • Evaluați riscul furnizorilor pentru integrările AI-la-AI. Dacă un furnizor redirecționează cererile printr-un al treilea model (precum în cazul Moonshot/Anthropic), confirmați ce politici de reținere a datelor și utilizare pentru antrenare se aplică.
  • Fiți atenți la prompt injection livrat prin canale criptate sau ascunse, nu doar prin prompturi în text clar, atunci când evaluați aplicații integrate cu LLM-uri.
DISTRIBUIE