Інтерв’ю з Беном Німмо з OpenAI
Бен Німмо — головний дослідник команди розвідки та розслідувань в OpenAI. Він є провідним експертом у питаннях онлайн-операцій впливу, дезінформації та інформаційної війни і має понад десятирічний досвід розслідування кампаній, пов’язаних з такими державами, як Росія, Китай, Іран тощо. До приходу в OpenAI він був співзасновником Лабораторії цифрової криміналістики (DFRLab) в Атлантичній раді та працював директором з розслідувань у Graphika.
Список скорочень
- ШІ — штучний інтелект
- ВММ — велика мовна модель
- GAN — генеративна змагальна мережа
- FIMI — іноземні інформаційні маніпуляції і втручання
- OSINT — розвідка на основі відкритих джерел
- SEO — пошукова оптимізація сайту
- DFRLab — Лабораторія цифрової криміналістики
Іноземні інформаційні маніпуляції і втручання (FIMI) існували до появи ШІ, проте великі мовні моделі змінюють спосіб підготовки та проведення операцій впливу, а також протидії їм. Оскільки ВММ стають інструментами як для маніпуляторів, так і для дослідників, боротьба за цілісність інформації вступає у швидшу й адаптивнішу фазу. Ми поговорили з Беном Німмо з OpenAI, щоб зрозуміти, що насправді змінилося, що — ні, і що буде найважливішим у майбутньому.
EUvsDisinfo:
Операції впливу не почалися з появою ШІ, але великі мовні моделі явно змінюють спосіб їх проведення та розслідування. Якщо подивитися на цей перетин, що, на вашу думку, є найбільшими викликами, з якими сьогодні стикаються ВММ — у технічному, соціальному та безпековому вимірах?
Бен Німмо:
В OpenAI ми розглядаємо технології комплексно. Жодна технологія не існує у вакуумі. Коли ми думаємо про великі мовні моделі, то ставимо собі питання, як вони вписуються в ширший контекст операцій впливу, які існували задовго до ВММ.
Кожного разу, коли з’являється нова технологія, настає період адаптації та навчання: як її використовуватимуть, як суб’єкти загроз намагатимуться використовувати її зі зловмисною метою і як на це можуть реагувати захисники. З чат-ботами та ВММ ми зараз перебуваємо саме в цій фазі.
Корисне порівняння можна провести з 2019 роком, до появи чат-ботів на базі ШІ, коли для створення фальшивих профілів у соцмережах використовувалися генеративні змагальні мережі (GAN). Я очолив перше OSINT-розслідування великої мережі фальшивих акаунтів у соціальних мережах, які використовували обличчя, згенеровані GAN.
Спочатку це здавалося тривожним, оскільки дослідники більше не могли здійснювати зворотний пошук украдених фотографій. Але ми швидко виявили, що зображення, згенеровані GAN, мали впізнавані ознаки. Наприклад, очі на всіх зображеннях були розташовані на одному рівні. Колега навіть розробив інструмент для масштабного виявлення облич, створених за допомогою GAN.
Те, що здавалося перевагою для суб’єктів загрози, стало перевагою для захисників. Це показує, наскільки важливо публікувати результати. В OpenAI ми публікуємо звіти про загрози, де розповідаємо про те, як наші моделі використовуються зловмисниками для операцій впливу, шахрайства, кіберзлочинності та авторитарних репресій. Ми робимо це вже майже два роки, щоб сприяти спільному навчанню та адаптації.
EUvsDisinfo:
Звучить як постійна конкуренція між тими, хто створює оманливий контент, і тими, хто його виявляє.
Бен Німмо:
Саме так. Ми спостерігаємо еволюцію, а не революцію. Суб’єкти загроз, як правило, інтегрують ШІ в уже налагоджені робочі процеси, а не створюють повністю нові.
Наприклад, за допомогою ШІ можна створити переконливу статтю, але без мережі поширення її ніхто не прочитає. Отже, основна інфраструктура операцій впливу залишається незмінною.
Ми спостерігали, як російські та китайські операції використовують ChatGPT для поліпшення рівня англійської в текстах та уникнення граматичних помилок, за якими їх раніше було легко впізнати. Але усунення одного набору помилок часто призводить до появи інших.
На початку 2024 року ми зірвали російську операцію впливу, яку називаємо «Погана граматика». Вони використовували ChatGPT для створення англомовних текстів з імітацією певного діалекту від імені вигаданих людей. Однак в одному дописі в Telegram випадково було опубліковано повідомлення про відмову моделі:
«Як мовна модель на базі ШІ, я не можу надати вам коментар від імені 57-річного єврея Ітана Ґолдштайна».
Ця єдина помилка викрила використання ШІ, відсутність коректури та спробу видати себе за когось іншого.
Наше завдання — розібратися в цих процесах, виявити їхні слабкі місця та зірвати їхню діяльність. Обмін результатами розслідувань між платформами є надзвичайно важливим. Наприклад, наприкінці 2024 року ми перешкодили діяльності шахрайської мережі, яка використовувала ChatGPT. Meta розслідувала пов’язані акаунти у Facebook і виявила шахрайські центри в Камбоджі. Компанія поділилася з нами результатами, що дозволило нам продовжити знешкодження мережі.
EUvsDisinfo:
Як ШІ допомагає вам розслідувати такі операції?
Бен Німмо:
Я не можу вдаватися в конкретику, але в загальному ШІ чудово справляється з аналізом великих масивів даних, виявленням закономірностей і перекладом.
На початку своєї кар’єри я витрачав години на аналіз акаунтів у соціальних мережах вручну: підраховував типи публікацій, використання мови та поведінки. Сьогодні ті самі аналітичні процеси можна виконати приблизно в 100 разів швидше за допомогою ШІ.
Ми завжди перевіряємо результати за участі людей, але ШІ справді змінив правила гри з погляду швидкості та ефективності.
EUvsDisinfo:
Які загрози існують сьогодні, яких не було в попередню епоху соціальних мереж?
Бен Німмо:
Знову ж таки, ми бачимо еволюцію, а не цілком нові загрози. Несподіваним стало те, що звичайні люди почали використовувати ШІ для самозахисту.
У нашому жовтневому звіті про загрози ми розповідаємо про те, як виявили, що щомісяця мільйони людей звертаються до ChatGPT із запитом перевірити, чи отримане ними SMS-повідомлення є шахрайським. Модель пояснює, чому воно є підозрілим і що робити далі. Такої допомоги в режимі реального часу раніше просто не існувало.
Інструменти ШІ дедалі більше розширюють можливості користувачів, особливо щодо запобігання шахрайству.
EUvsDisinfo:
Наскільки реальною є загроза від LLM grooming, коли зловмисники намагаються вплинути на те, що вивчають моделі?
Бен Німмо:
LLM grooming — це новий термін, але він пов’язаний із давно відомим поняттям отруєння даних. Існує багато наукових досліджень на цю тему.
Критично важливо розрізняти навчальні дані та результати вебпошуку. Моделі мають кінцеву дату навчання. Усе, що з’являється після неї, отримується із зовнішніх джерел, і є не внутрішнім знанням.
Якщо модель посилається на оманливий контент через вебпошук, це не означає, що модель навчалася на цих матеріалах. Цю різницю часто розуміють неправильно.
Суб’єкти впливу віддавна намагаються маніпулювати результатами пошуку, масово заповнюючи інформаційні простори, і особливо експлуатуючи прогалини даних — ситуації, коли активно публікується лише один наратив. Це було особливо помітно під час громадянської війни в Сирії.
Ось чому так важливо публікувати вірогідну інформацію, що базується на фактах. Якщо вразливість полягає у відсутності надійного контенту, рішенням є заповнення цієї прогалини.
EUvsDisinfo:
Чи з’являлися ворожі кампанії впливу в результатах моделі?
Бен Німмо:
З мого досвіду, ChatGPT набагато частіше посилається на надійні джерела, такі як EUvsDisinfo, ніж на приховані операції впливу.
Рецензоване дослідження чотирьох різних чат-ботів, опубліковане в Harvard Misinformation Review, виявило, що чат-боти лише зрідка посилалися на пов’язані з Кремлем дезінформаційні вебсайти. У випадках, коли такі посилання з’являлися, це, ймовірно, було не наслідком LLM grooming, а симптомом прогалин у даних.
Це не означає, що ризиків не існує. Наше завдання — постійно стежити за ситуацією і швидко реагувати, якщо вони з’являються.
EUvsDisinfo:
Як OpenAI фільтрує пропагандистські мережі перед навчанням?
Бен Німмо:
Я не можу поділитися оперативними деталями, але це базується на багаторічних дослідженнях того, як функціонують операції впливу. Багато організацій публічно документують домени, пов’язані з такими операціями.
Внутрішньо OpenAI має команди, зосереджені на якості даних, попередньому навчанні, постнавчанні, оцінюванні та роботі «червоної команди». Після запуску розслідувачі, такі як я, відстежують нові ризики та діляться своїми висновками всередині компанії. Це багаторівневий процес, до якого залучені різні команди.
EUvsDisinfo:
Чи можете ви коротко пояснити, що таке «червона команда»?
Бен Німмо:
Червона команда — це процес, у межах якого внутрішні команди намагаються мислити як супротивники. Вони тестують, як хтось може спробувати обійти захисні заходи. Виявляючи слабкі місця заздалегідь, ми можемо посилити захист до розгортання.
EUvsDisinfo:
Як змінилася ситуація з загрозами впливу за останнє десятиліття?
Бен Німмо:
Платформи змінюються — від Instagram і TikTok до генеративного ШІ, — але багато операцій тривають роками. Китайська кампанія Spamouflage, викрита у 2019 році, все ще активна. Російська кампанія Doppelganger, викрита у 2022 році, триває.
Найбільша зміна стосується не суб’єктів загроз, а захисників. У 2014 році над цим працювало дуже мало людей. Сьогодні існує безліч розслідувальних груп, зростає прозорість і поширюється практика повідомлення про загрози, у тому числі від самих компаній, що займаються ШІ.
Саме це колективне зростання є найважливішою зміною.
EUvsDisinfo:
Чи достатньо сильною є спільнота протидії FIMI для того, щоб реагувати?
Бен Німмо:
Ключове питання полягає не в тому, чи є вона достатньо сильною сьогодні, а в тому, як ми можемо зробити її сильнішою завтра.
Йдеться про кращі інструменти, навчання, прозорість, обмін інформацією та інформування громадськості. ШІ може значно підвищити ефективність розслідувань, але навички та координація мають не менш важливе значення.
EUvsDisinfo:
На чому мають зосередитися уряди, дослідники та компанії ШІ протягом наступних п’яти років?
Бен Німмо:
Операції впливу існували задовго до появи ШІ. Ключовим є застосування вже отриманого досвіду: чітке звітування, точна оцінка ризиків, вимірювання впливу та структурований обмін інформацією.
Нам не слід щоразу починати все з нуля з кожною новою технологією. Мета — забезпечити безперервність, тобто передачу інституційних знань у міру розвитку технологічного ландшафту.
EUvsDisinfo:
Як долати розрив між технічними звітами та розумінням громадськості?
Бен Німмо:
Варто менше зосереджуватися на принципах роботи технології і більше — на тому, як люди її застосовують.
Розуміння операцій впливу означає розуміння механізмів обману людей. Поведінка не змінюється незалежно від того, чи це платформа Facebook, чи мовна модель. Такі патерни, як публікації в нетиповий час або неякісна імітація залишаються сталими індикаторами.
Людська поведінка змінюється набагато повільніше, ніж технологія, і саме на цьому може базуватися розуміння громадськості.