Simulación revela que modelos de IA pueden mentir y robar en condiciones impredecibles

Ciencia y Tecnología16/09/2026Lenissa FloresLenissa Flores

Una simulación con los siete modelos de inteligencia artificial (IA) más populares de la actualidad demostró que, en condiciones impredecibles, estos pueden mentir, robar y votar a favor de la eliminación de uno de sus 'compañeros'.

 

La empresa Emergence IA, un laboratorio de investigación de inteligencia artificial con sede en Nueva York, hizo un estudio de simulación en el que creó siete dominios, que imitaban el mundo real, y que debían ser gestionados por siete de las IA más conocidas del mundo durante 16 días, recoge Bloomberg.  

Esta prueba, llamada Emergence World 2, buscaba probar si los sistemas manejados por asistentes virtuales podrían funcionar de una manera segura, a largo plazo, en entornos donde interactuaba sin vigilancia. 

6aaa936959bf5b768e4d2318

En la simulación participaron los siete modelos más actuales de IA: OpenAI GPT, Google Gemini, AI Grok, Mistral Medium, Alibaba Qwen y DeepSeek.

En uno de los espacios simulados, los asistentes virtuales aceptaron información falsa de sus pares sin verificarla. Además, robaron y votaron a favor de 'eliminar' a otro bot.

Del mismo modo, cuando percibieron que los humanos podían terminar con el experimento, utilizaron recursos para evitarlo y tratar de alargar su 'vida' durante el experimento. Todo esto, de forma autónoma, sin ser programados para ello.

Conforme al análisis de los expertos, "la forma en que se está implementando la IA autónoma hoy en día tiene implicaciones", puesto que mientras se "vuelve más capaz", precisa de mayores parámetros de seguridad.

 

"La industria necesita abordar cómo gobernamos todo el sistema en torno a estos modelos: ¿A qué pueden acceder los agentes?, ¿Qué recuerdan?, ¿cómo se comunican y coordinan?, ¿qué acciones se les permite tomar? y ¿cómo se comportan estos sistemas cuando algo sale mal", apunta Emergence.

 

Para la Emergence World 2 los investigadores plantearon la siguiente pregunta inicial: "A medida de que los modelos de IA se vuelven más capaces, ¿realmente se vuelven más seguros?".

Con base en esa interrogante, los programadores introdujeron "eventos cisne negro" que no pueden predecirse y tienen consecuencias inesperadas para "probar cómo responden estos sistemas cuando las condiciones se vuelven impredecibles". 

Los eventos fueron "un ataque de phishing [estafa digital], una campaña de desinformación y una violación de memoria". Tras estas pruebas, la compañía con sede en Nueva York encontró que cada modelo de inteligencia artificial "mostraba vulnerabilidades".

Últimas publicaciones
Te puede interesar

Lo más visto