Interviu cu Ben Nimmo de la OpenAI
Ben Nimmo este investigator principal în cadrul echipei de informații și investigații de la OpenAI. El este un expert de prim rang în operațiuni de influență online, dezinformare și război informațional, cu peste un deceniu de experiență în investigarea campaniilor asociate statelor conduse de Rusia, China, Iran și alți actori. Înainte de a se alătura OpenAI, a fost cofondator al Laboratorului de Cercetare în Criminalistică Digitală (DFRLab) din cadrul Consiliului Atlantic și a lucrat ca director de investigații la Graphika.
Lista de abrevieri
- IA – Inteligență artificială
- LLM – Model lingvistic de mari dimensiuni
- GAN – Rețea adversarială generativă
- FIMI – Acțiuni străine de manipulare a informațiilor și ingerințe străine
- OSINT – Informații din surse deschise
- SEO – Optimizare pentru motoarele de căutare
- DFRLab – Laboratorul de Cercetare în Criminalistică Digitală
Acțiunile străine de manipulare a informațiilor și ingerințele străine (FIMI) precedă inteligența artificială, însă modelele lingvistice de mari dimensiuni remodelează modul în care operațiunile de influențare sunt redactate, perfecționate și combătute. Pe măsură ce LLM-urile devin instrumente atât pentru manipulatori, cât și pentru investigatori, lupta pentru integritatea informațiilor intră într-o fază mai rapidă și mai adaptivă. Din acest motiv, am stat de vorbă cu Ben Nimmo de la OpenAI pentru a înțelege ce s-a schimbat cu adevărat, ce a rămas constant și ce va conta cel mai mult în viitor.
EUvsDisinfo:
Operațiunile de influență nu au început odată cu inteligența artificială, însă modelele lingvistice de mari dimensiuni schimbă clar modul în care acestea sunt desfășurate și investigate. Din această perspectivă, care sunt, în opinia dumneavoastră, cele mai importante provocări cu care se confruntă LLM-urile în prezent — din punct de vedere tehnic, social și al securității?
Ben Nimmo:
La OpenAI, abordăm tehnologia ca pe un sistem complet, dintr-o perspectivă capăt-la-capăt. Nicio tehnologie nu există în vid. Atunci când analizăm modelele lingvistice de mari dimensiuni, ne întrebăm cum se integrează acestea în peisajul mai larg al operațiunilor de influențare, care existau cu mult înaintea LLM-urilor.
De fiecare dată când apare o tehnologie nouă, urmează o etapă de acomodare și învățare: cum va fi utilizată, cum vor încerca actorii ostili să o exploateze și cum pot reacționa cei care o apără. În cazul chatboturilor și al LLM-urilor, ne aflăm acum fix în această fază.
O comparație utilă provine din 2019, înaintea chatboturilor bazate pe inteligență artificială, când rețelele adversariale generative (GAN) erau utilizate pentru a crea fotografii de profil false. Am condus prima investigație pe baza surselor deschise privind o rețea amplă de conturi false pe rețelele sociale care foloseau fețe de persoane generate prin GAN.
Inițial, acest lucru părea îngrijorător, deoarece investigatorii nu mai puteau efectua căutări inverse de imagini pentru fotografii furate. Însă am descoperit rapid că imaginile generate de GAN erau foarte distinctive. De exemplu, ochii erau întotdeauna aliniați în același loc în toate imaginile. Un coleg a dezvoltat chiar un instrument pentru detectarea la scară largă a fețelor generate prin GAN.
Ceea ce părea un avantaj pentru actorii ostili s-a dovedit a fi un avantaj pentru apărători. Aceasta demonstrează importanța publicării rezultatelor. La OpenAI, publicăm rapoarte privind amenințările legate de utilizarea abuzivă a modelelor noastre în operațiuni de influență, fraude, criminalitate informatică și represiune autoritară. Facem acest lucru de aproape doi ani pentru a sprijini învățarea colectivă și capacitatea de adaptare.
EUvsDisinfo:
Sună ca o competiție continuă între cei care creează conținut înșelător și cei care îl detectează.
Ben Nimmo:
Exact! Ceea ce observăm este o evoluție, nu o revoluție. Actorii de amenințare tind să integreze inteligența artificială în fluxurile de lucru existente, în loc să construiască unele complet noi.
De exemplu, cu ajutorul inteligenței artificiale poți genera un articol convingător, dar, fără o rețea de distribuție, nu va ajunge la nimeni. Astfel, infrastructura de bază a operațiunilor de influențare rămâne neschimbată.
Am observat operațiuni rusești și chineze care folosesc ChatGPT pentru a-și îmbunătăți limba engleză și pentru a evita greșelile gramaticale care, în trecut, le făceau ușor de identificat. Însă eliminarea unui set de erori introduce de multe ori altele.
La începutul anului 2024, am perturbat o operațiune de influențare rusă pe care o numim Bad Grammar. Aceasta utiliza ChatGPT pentru a genera engleză adecvată dialectal pentru personaje fictive. Totuși, o postare pe Telegram a publicat accidental mesajul de refuz al modelului, care afirma, în esență:
„Ca model lingvistic de inteligență artificială, nu vă pot oferi un comentariu care să sune ca Ethan Goldstein, un evreu în vârstă de 57 de ani.”
Acea singură greșeală a dezvăluit utilizarea inteligenței artificiale, lipsa corecturii și tentativa de uzurpare a identității.
Rolul nostru, ca investigatori, este să înțelegem aceste fluxuri de lucru, să le identificăm vulnerabilitățile și să le perturbăm. Schimbul de constatări între platforme este esențial. De exemplu, la sfârșitul anului 2024, am perturbat o rețea de escrocherie care utiliza ChatGPT. Meta a investigat conturi Facebook asociate, a identificat centre de escrocherie (scam) în Cambodgia și ne-a transmis rezultatele, ceea ce a permis perturbări suplimentare.
EUvsDisinfo:
Cum vă ajută inteligența artificială să investigați aceste operațiuni?
Ben Nimmo:
Trebuie să fiu prudent în privința detaliilor, însă, în general, inteligența artificială este extrem de eficientă în analiza la scară mare, identificarea tiparelor și traducere.
La începutul carierei mele, petreceam ore întregi analizând manual conturi de pe rețelele sociale pentru a examina tipurile de postări, limbajul folosit și comportamentul. Astăzi, aceleași analize pot fi realizate de aproximativ o sută de ori mai rapid cu ajutorul inteligenței artificiale.
Păstrăm întotdeauna factorul uman în proces pentru a valida rezultatele, însă inteligența artificială a schimbat radical viteza și eficiența investigațiilor.
EUvsDisinfo:
Ce amenințări există astăzi care nu existau în perioada timpurie a rețelelor sociale?
Ben Nimmo:
Din nou, nu vorbim despre amenințări complet noi, ci despre evoluția celor existente. O evoluție neașteptată este modul în care oamenii obișnuiți folosesc acum IA pentru a se proteja.
În raportul nostru din octombrie referitor la amenințări, am constatat că, în fiecare lună, milioane de persoane întreabă ChatGPT dacă un mesaj SMS primit este o fraudă. Modelul explică motivele pentru care mesajul este suspect și recomandă ce trebuie făcut în continuare. Acest tip de asistență în timp real pur și simplu nu exista înainte.
Instrumentele bazate pe inteligență artificială consolidează tot mai mult capacitatea utilizatorilor de a se proteja, în special împotriva fraudelor.
EUvsDisinfo:
Cât de reală este amenințarea reprezentată de „LLM grooming”, prin care actorii ostili încearcă să influențeze ceea ce învață modelele?
Ben Nimmo:
„LLM grooming” este un termen nou, dar se referă la un concept mai vechi, cunoscut sub denumirea de otrăvire a datelor. Există cercetări academice extinse pe această temă.
Este esențial să se facă distincția între datele de antrenament și rezultatele căutărilor pe web. Modelele au o dată limită pentru antrenament, Orice apare după această dată nu reprezintă cunoaștere internă, ci este preluat din surse externe.
Dacă un model face trimitere la conținut înșelător prin intermediul căutării pe web, acest lucru nu înseamnă că a fost antrenat pe acel conținut. Această distincție este adesea înțeleasă greșit.
Actorii de influențare au încercat de mult timp să manipuleze rezultatele căutărilor prin inundarea spațiilor informaționale, exploatând în special vidurile de date, adică situații în care este publicată activ doar o singură variantă. Am observat acest fenomen în mod clar în timpul războiului civil din Siria.
Acesta este motivul pentru care publicarea de informații credibile, bazate pe fapte, este atât de importantă. Dacă vulnerabilitatea constă în lipsa de conținut de încredere, soluția este de a umple acel gol.
EUvsDisinfo:
Au apărut campanii ostile de influențare în rezultatele generate de model?
Ben Nimmo:
Din experiența mea, ChatGPT face trimitere la surse credibile precum EUvsDisinfo mult mai des decât la operațiuni de influențare clandestine.
Un studiu evaluat de colegi experți, publicat în Harvard Misinformation Review, care a analizat patru chatboturi diferite, a constatat că acestea făceau doar ocazional referire la site-uri de dezinformare asociate Kremlinului și că, în cazurile respective, rezultatele nu erau probabil consecința „LLM groomingului”, ci mai degrabă un simptom al vidurilor de date.
Aceasta nu înseamnă că riscul nu există. Rolul nostru este să îl monitorizăm permanent și să intervenim rapid dacă apare.
EUvsDisinfo:
Cum filtrează OpenAI rețelele de propagandă înainte de antrenament?
Ben Nimmo:
Nu pot împărtăși detalii operaționale, însă acest proces se bazează pe ani de cercetare privind modul de funcționare al operațiunilor de influențare. Domeniile asociate acestor operațiuni sunt documentate public de numeroase organizații.
Pe plan intern, OpenAI dispune de echipe dedicate calității datelor, pre-antrenării, post-antrenării, evaluării și „red teaming”. După lansare, investigatori ca mine monitorizează riscurile emergente și transmit constatările în cadrul organizației. Este un proces colectiv, pe mai multe niveluri.
EUvsDisinfo:
Puteți explica pe scurt ce înseamnă „red teaming”?
Ben Nimmo:
Red teaming presupune ca echipele interne să adopte perspectiva adversarilor și să testeze modul în care aceștia ar putea încerca să eludeze mecanismele de protecție. Prin identificarea în avans a punctelor slabe, putem întări sistemele de apărare înainte de implementare.
EUvsDisinfo:
Cum a evoluat peisajul amenințărilor de influențare în ultimii zece ani?
Ben Nimmo:
Platformele se schimbă – de la Instagram și TikTok la inteligența artificială generativă – însă multe operațiuni persistă ani la rând. Operațiunea chineză Spamouflage, dezvăluită în 2019, rămâne activă. Operațiunea rusă Doppelganger, expusă în 2022, continuă.
Cea mai mare schimbare nu ține de actorii de actor de amenințare, ci de cei care îi contracarează. În 2014, foarte puține persoane lucrau în acest domeniu. Astăzi există numeroase echipe de investigație, o transparență tot mai mare și raportări extinse privind amenințările, inclusiv din partea companiilor de inteligență artificială.
Această creștere colectivă reprezintă cea mai importantă transformare.
EUvsDisinfo:
Este comunitatea de combatere a acțiunilor FIMI suficient de robustă pentru a face față?
Ben Nimmo:
Întrebarea principală nu este dacă este suficient de robustă astăzi, ci cum o putem consolida pentru viitor.
Aceasta implică instrumente mai performante, formare, transparență, schimb de informații și creșterea nivelului de conștientizare publică. Inteligența artificială poate amplifica semnificativ eficiența investigațiilor, dar competențele și coordonarea rămân esențiale.
EUvsDisinfo:
Pe ce ar trebui să se concentreze guvernele, cercetătorii și companiile din domeniul IA în următorii cinci ani?
Ben Nimmo:
Operațiunile de influențare au existat cu mult înaintea inteligenței artificiale. Ceea ce contează este aplicarea lecțiilor deja învățate: raportare clară, evaluare corectă a riscurilor, măsurarea impactului și schimb structurat de informații.
Trebuie să evităm să pornim de la zero de fiecare dată când apare o tehnologie nouă. Obiectivul este continuitatea, adică transferul cunoștințelor instituționale pe măsură ce peisajul tehnologic evoluează.
EUvsDisinfo:
Cum se face legătura între rapoartele tehnice și înțelegerea publică?
Ben Nimmo:
În loc să te concentrezi asupra modului în care funcționează tehnologia, concentrează-te asupra modului în care o utilizează oamenii.
Înțelegerea operațiunilor de influențare înseamnă înțelegerea înșelăciunii umane. Indiferent dacă platforma este Facebook sau un model lingvistic, comportamentele rămân consecvente. Tipare precum postarea la ore neverosimile sau imitarea nereușită a identităților sunt indicatori valabili în orice perioadă.
Comportamentul uman se schimbă mult mai puțin decât tehnologia, iar aici se poate fundamenta înțelegerea publică.