Entrevista con Ben Nimmo de OpenAI
Ben Nimmo es el investigador principal del equipo de inteligencia e investigación de OpenAI. Es un experto destacado en operaciones de influencia en línea, desinformación y guerra de la información, con más de una década de experiencia en la investigación de campañas vinculadas a Estados por parte de Rusia, China, Irán y otros actores. Antes de incorporarse a OpenAI, fue cofundador del Laboratorio de Investigación Forense Digital (DFRLab) del Consejo Atlántico y trabajó como director de investigaciones en Graphika.
Lista de abreviaturas
- IA: inteligencia artificial
- LLM: gran modelo de lenguaje
- GAN: red generativa antagónica
- FIMI: manipulación de información e injerencia por parte de agentes extranjeros
- OSINT: inteligencia de fuentes abiertas
- SEO: optimización para motores de búsqueda
- DFRLab: Laboratorio de Investigación Forense Digital
La manipulación de información e injerencia por parte de agentes extranjeros (FIMI) precede a la IA, pero los grandes modelos de lenguaje están transformando la forma en que se diseñan, perfeccionan y contrarrestan las operaciones de influencia. A medida que los LLM se convierten en herramientas tanto para los manipuladores como para los investigadores, la lucha por la integridad de la información está entrando en una fase más rápida y adaptativa. Por esta razón, hablamos con Ben Nimmo, de OpenAI, para comprender qué ha cambiado realmente, qué sigue igual y qué será lo más importante de cara al futuro.
EUvsDisinfo:
Las operaciones de influencia no comenzaron con la IA, pero está claro que los grandes modelos de lenguaje están cambiando la forma en que se desarrollan y se investigan. Cuando observa esta intersección, ¿cuáles cree que son los mayores retos a los que se enfrentan los LLM hoy en día, desde un punto de vista técnico, social y de seguridad?
Ben Nimmo:
En OpenAI, pensamos en la tecnología en su conjunto. Ninguna tecnología está del todo aislada. Cuando estudiamos los grandes modelos de lenguaje, nos preguntamos cómo encajan en el panorama más amplio de las operaciones de influencia, que ya existían mucho antes que los LLM.
Cada vez que surge una nueva tecnología, hay un periodo de adaptación y aprendizaje: cómo se utilizará, cómo intentarán abusar de ella los agentes hostiles y cómo pueden responder los defensores. En el caso de los chatbots y los LLM, nos encontramos en esa fase.
Podemos realizar una comparación útil con 2019, antes de los chatbots con IA, cuando se utilizaban redes generativas antagónicas (GAN) para crear fotos de perfil falsas. Dirigí la primera investigación de código abierto sobre una gran red de cuentas falsas en redes sociales que utilizaban rostros generados por GAN.
Al principio, aquello resultaba preocupante porque los investigadores ya no podían realizar búsquedas inversas de fotos robadas. Pero rápidamente descubrimos que las imágenes GAN presentaban rasgos muy distintivos. Por ejemplo, los ojos estaban alineados en el mismo lugar en todas las imágenes. Un colega incluso desarrolló una herramienta para detectar rostros GAN a gran escala.
Lo que parecía una ventaja para los agentes hostiles se convirtió en una ventaja para los defensores. Esto demuestra por qué es importante publicar los hallazgos. En OpenAI, publicamos informes de amenazas sobre el uso abusivo de nuestros modelos en operaciones de influencia, estafas, ciberdelincuencia y represión autoritaria. Venimos haciendo esto desde hace casi dos años para apoyar el aprendizaje y la adaptación colectivos.
EUvsDisinfo:
Parece una competición constante entre quienes crean contenido engañoso y quienes lo detectan.
Ben Nimmo:
Exactamente. Más que una revolución, lo que vemos es una evolución. Los agentes hostiles tienden a integrar la IA en los flujos de trabajo existentes en lugar de crear otros completamente nuevos.
Por ejemplo, se puede generar un artículo convincente con IA, pero sin una red de distribución, no llega a nadie. Por lo tanto, la infraestructura básica de las operaciones de influencia permanece inalterada.
Hemos observado que las operaciones rusas y chinas utilizan ChatGPT para mejorar su inglés y evitar errores gramaticales que antes facilitaban su detección. Pero la eliminación de un conjunto de errores suele introducir otros.
A principios de 2024, desarticulamos una operación de influencia rusa que denominamos «Bad Grammar». Utilizaban ChatGPT para generar un dialecto del inglés adaptado a personajes falsos. Sin embargo, un mensaje de Telegram publicó accidentalmente el mensaje de rechazo del modelo, que decía algo así como:
«Como modelo de lenguaje de IA, no puedo ofrecerte un comentario con la voz de Ethan Goldstein, un judío de 57 años».
Ese simple error reveló el uso de IA, la falta de revisión y el intento de suplantación de identidad.
Nuestro trabajo como investigadores es comprender estos flujos de trabajo, detectar sus puntos débiles y desbaratarlos. Es fundamental compartir los hallazgos entre las distintas plataformas. A finales de 2024, por ejemplo, desbaratamos una red de estafas que utilizaba ChatGPT. Meta investigó las cuentas de Facebook de la red, localizó los centros de la estafa en Camboya y compartió los hallazgos con nosotros, lo que nos permitió seguir desbaratándolos.
EUvsDisinfo:
¿Cómo le ayuda la IA a investigar estas operaciones?
Ben Nimmo:
Tengo que ser prudente con los detalles, pero en términos generales, la IA destaca en el análisis a gran escala, el reconocimiento de patrones y la traducción.
Al principio de mi carrera, pasaba horas analizando manualmente las cuentas de redes sociales, contando tipos de publicaciones, uso del lenguaje y comportamiento. Hoy en día, esos mismos procesos analíticos pueden realizarse aproximadamente cien veces más rápido con la IA.
Siempre contamos con personas para verificar los resultados, pero la IA ha supuesto una auténtica revolución en términos de velocidad y eficiencia.
EUvsDisinfo:
¿Qué amenazas existen hoy en día que no existían en la era anterior de las redes sociales?
Ben Nimmo:
Una vez más, observamos una evolución en lugar de amenazas completamente nuevas. Una evolución inesperada es la forma en que la gente normal utiliza la IA de forma defensiva.
En nuestro informe sobre amenazas del mes de octubre, descubrimos que cada mes millones de personas preguntan a ChatGPT si un mensaje SMS es una estafa. El modelo explica por qué es sospechoso y qué hacer a continuación. Ese tipo de asistencia en tiempo real no existía antes.
Las herramientas de IA están capacitando cada vez más a los usuarios, especialmente en lo que respecta a la prevención de estafas.
EUvsDisinfo:
¿Hasta qué punto es real la amenaza del «LLM grooming», en la que agentes hostiles intentan influir en lo que aprenden los modelos?
Ben Nimmo:
«LLM grooming» es un término nuevo, pero hace referencia a un concepto conocido desde hace tiempo como «envenenamiento de datos». Existen numerosas investigaciones académicas al respecto.
Lo fundamental es distinguir entre los datos de entrenamiento y los resultados de las búsquedas en la web. Los modelos tienen una fecha límite de entrenamiento. Todo aquello que aparezca después de esa fecha no es conocimiento interno, sino que se obtiene externamente.
Si un modelo hace referencia a contenido engañoso a través de una búsqueda web, eso no significa que el modelo haya sido entrenado con ese contenido. Esta distinción suele malinterpretarse.
Los agentes de influencia llevan mucho tiempo intentando manipular los resultados de las búsquedas a través de la saturación de los espacios de información, especialmente a través de la explotación de los vacíos de datos, es decir, situaciones en las que solo se publica activamente una narrativa. Lo vimos claramente durante la guerra civil siria.
Por eso es tan importante publicar información creíble y basada en hechos. Si la vulnerabilidad es la falta de contenido fiable, la solución es llenar ese vacío.
EUvsDisinfo:
¿Han aparecido campañas de influencia hostiles en los resultados del modelo?
Ben Nimmo:
Según mi experiencia, ChatGPT hace referencia a fuentes creíbles como EUvsDisinfo con mucha más frecuencia que a operaciones de influencia secretas.
Un estudio revisado por pares de cuatro chatbots diferentes, publicado en Harvard Misinformation Review, concluyó que los chatbots solo hacían referencia ocasionalmente a sitios web de desinformación vinculados al Kremlin y que, en lugar de ser el resultado de un «LLM grooming», los resultados en los que sí se referían a estos sitios web eran probablemente un síntoma de la existencia de vacíos de datos.
Eso no significa que el riesgo no exista. Nuestra labor consiste en hacer un seguimiento constante y responder rápidamente en caso de que se produzca.
EUvsDisinfo:
¿Cómo filtra OpenAI las redes de propaganda antes del entrenamiento?
Ben Nimmo:
No puedo divulgar información sobre el funcionamiento, pero se basa en años de investigación sobre cómo funcionan las operaciones de influencia. Los dominios vinculados a este tipo de operaciones están documentados públicamente por múltiples organizaciones.
Internamente, OpenAI cuenta con equipos centrados en la calidad de los datos, el entrenamiento previo y posterior, la evaluación y los equipos rojos. Tras el lanzamiento, investigadores como yo hacemos un seguimiento de los riesgos emergentes y compartimos los resultados internamente. Se trata de un proceso colectivo y con múltiples capas.
EUvsDisinfo:
¿Puede explicar brevemente qué es el «equipo rojo»?
Ben Nimmo:
El equipo rojo consiste en que equipos internos intenten pensar como adversarios y prueben de qué manera alguien podría intentar eludir las medidas de seguridad. Al detectar las debilidades con antelación, podemos reforzar las defensas antes del lanzamiento.
EUvsDisinfo:
¿Cómo ha cambiado el panorama de las amenazas de influencia en la última década?
Ben Nimmo:
Las plataformas cambian (Instagram, TikTok y ahora la IA generativa), pero muchas operaciones se mantienen durante años. La operación china «Spamouflage», descubierta en 2019, sigue activa. La operación rusa «Doppelganger», descubierta en 2022, sigue en marcha.
El mayor cambio no se produce en los agentes hostiles, sino en los defensores. En 2014, muy pocas personas trabajaban en esto. Hoy en día, hay numerosos equipos de investigación, una mayor transparencia y una amplia difusión de informes sobre amenazas, en particular por parte de las propias empresas de IA.
Ese crecimiento colectivo es el cambio más importante.
EUvsDisinfo:
¿Es la comunidad contra la FIMI lo suficientemente fuerte como para responder?
Ben Nimmo:
La pregunta clave no es si es lo suficientemente fuerte hoy, sino cómo la fortalecemos de cara al futuro.
Eso pasa por mejorar las herramientas, la formación, la transparencia, el intercambio de información y la concienciación pública. La IA puede aumentar drásticamente la eficiencia de la investigación, pero las habilidades y la coordinación son igual de importantes.
EUvsDisinfo:
¿En qué deberían centrarse los Gobiernos, los investigadores y las empresas de IA durante los próximos cinco años?
Ben Nimmo:
Las operaciones de influencia son muy anteriores a la IA. La clave está en aplicar las lecciones aprendidas: informes claros, evaluación precisa de los riesgos, medición del impacto e intercambio estructurado de información.
Debemos evitar empezar de cero con cada nueva tecnología. El objetivo es la continuidad: hacer avanzar el conocimiento institucional a medida que evoluciona el panorama tecnológico.
EUvsDisinfo:
¿Cómo se salva la brecha entre los informes técnicos y la comprensión del público?
Ben Nimmo:
En lugar de centrarse en cómo funciona la tecnología, hay que centrarse en cómo la utiliza la gente.
Comprender las operaciones de influencia significa comprender el engaño humano. Ya sea en Facebook o en un modelo de lenguaje, los comportamientos siguen siendo los mismos. Patrones como publicar a horas poco habituales o la mala imitación de identidades son indicadores atemporales.
El comportamiento humano cambia mucho menos que la tecnología, y es ahí donde puede asentarse la comprensión del público.