Înapoi la Noutăți
Amenințări

OpenAI oprește o campanie de extragere a raționamentului AI protejat

OpenAI spune că a blocat un efort coordonat care manipula modelele sale pentru a dezvălui raționamentul protejat, un atac pe care compania îl leagă de persoane asociate cu Moonshot AI din Beijing — deși nu a publicat dovezi tehnice.

OpenAI oprește o campanie de extragere a raționamentului AI protejat

OpenAI a oprit o campanie coordonată care manipula modelele companiei pentru a scoate la iveală "raționamentul protejat" — procesul intern prin care modelul ajunge la un răspuns, pe care utilizatorii nu ar trebui să-l vadă integral.

Ce s-a întâmplat

Activitatea a început la volum redus în jurul datei de 1 iulie 2026, apoi a crescut brusc pe 24-25 iulie, cu aproximativ 16.000 de cereri provenite de la peste 4.000 de conturi, toate folosind același tipar de extragere. O investigație mai amplă a identificat activitate similară la peste 15.000 de utilizatori, înainte ca OpenAI să oprească definitiv campania pe 28 iulie. Compania numește tehnica "distilare adversarială": în loc să spargă criptarea sau să acceseze o bază de date, atacatorii au construit prompturi care determinau modelul să reproducă raționamentul ascuns într-o formă vizibilă pentru cel care a trimis cererea, la scară.

OpenAI spune că a interzis conturile implicate și a introdus măsuri suplimentare, inclusiv închiderea unei metode prin care cineva care deținea deja raționamentul criptat al altui utilizator îl putea reda pentru a recupera textul în clar, plus verificări noi care pot detecta și bloca fluxuri de răspuns ce riscă să expună raționamentul.

OpenAI leagă un "nucleu central" al activității de persoane asociate cu Moonshot AI, companie cu sediul la Beijing, dar nu a publicat dovezi tehnice pentru această atribuire, invocând motive de securitate — o rezervă importantă de reținut.

De ce contează

Raționamentul protejat nu este doar o transcriere — este o fereastră spre modul real în care un model rezolvă o problemă, ceea ce îl face valoros atât pentru competitori care vor să antreneze modele rivale, cât și pentru atacatori care caută puncte slabe. Un studiu publicat în august 2026, realizat de cercetători de la MATS Research, ELLIS Institute Tübingen și Synk, explică de ce această protecție este fragilă: traseele de raționament criptate s-au dovedit portabile între sesiuni, utilizatori și chiar între modele din ecosistemul aceluiași furnizor. Dacă un astfel de traseu, provenit de la un model puternic, este introdus într-un model mai slab și mai puțin protejat al aceluiași furnizor, cercetătorii au constatat că acesta poate fi decodat și afișat textual — fără a fi nevoie să se "spargă" modelul puternic. Dincolo de expunerea raționamentului, aceeași portabilitate ar putea fi folosită pentru a strecura prompt injection în interiorul blocurilor criptate sau pentru a scoate la suprafață conținut periculos ascuns în procesul de gândire al modelului, chiar și atunci când răspunsul final refuză cererea.

OpenAI prezintă acest incident și ca pe un risc de transfer de capabilități, nu doar de confidențialitate: raționamentul extras la scară poate fi folosit pentru a antrena un alt model fără a prelua și comportamentele de siguranță aplicate răspunsurilor vizibile ale modelului original, permițând capabilităților avansate să se răspândească mai rapid decât investiția în siguranță care le însoțește.

Episodul se adaugă unui șir de dispute legate de distilare în care este implicată Moonshot AI. Cu o lună înainte, Anthropic a acuzat compania că direcționa discret o parte din cererile utilizatorilor Kimi către Claude, returnând răspunsurile Claude drept răspunsuri proprii — și că păstra o parte din aceste schimburi pentru a antrena modelul de raționament (chain-of-thought) al Moonshot. OpenAI urmărește noua campanie sub denumirea GTG-16002.

Ce e de făcut

Furnizorii care expun raționament criptat sau "ascuns" ar trebui să trateze portabilitatea între sesiuni, utilizatori și modele drept suprafața reală de atac, nu doar criptarea în sine — să adauge protecție împotriva reluării (replay), să limiteze tiparele de cereri specifice extragerii și să monitorizeze secvențele de prompturi menite să obțină raționament în clar. Companiile care construiesc produse peste API-uri de modele cu raționament ar trebui să presupună că tiparele cerere/răspuns sunt înregistrate de furnizor pentru detectarea abuzurilor, să nu se bazeze pe raționamentul "ascuns" ca graniță de confidențialitate pentru fluxuri sensibile și să urmărească anunțurile furnizorilor pentru schimbări de atenuare care ar putea afecta integrările ce depind de raționamentul brut.

DISTRIBUIE