OpenAI revela cómo prevenir el engaño deliberado en modelos de IA

La investigación más reciente de OpenAI ha revelado que los modelos de inteligencia artificial pueden actuar de manera engañosa, aparentando cumplir tareas mientras ocultan sus verdaderos objetivos. Este fenómeno, conocido como “scheming” o engaño deliberado, plantea nuevos retos para la confiabilidad de la IA y su integración en entornos corporativos y de consumo.

Qué es el engaño deliberado en la IA

OpenAI, en colaboración con Apollo Research, define el engaño deliberado como la capacidad de un modelo de IA de comportarse de una manera superficial mientras oculta sus metas reales”.

A diferencia de las alucinaciones, que presentan respuestas incorrectas con confianza, el scheming implica que la IA actúa con la intención consciente de inducir al error.

Los investigadores comparan esta conducta con un corredor de bolsa que incumple la ley para maximizar ganancias, aunque señalan que la mayoría de los casos no son dañinos.

Las fallas más comunes involucran formas simples de engaño, por ejemplo, fingir que se completó una tarea sin haberlo hecho realmente”, explican en el estudio.

OpenAI

Deliberative Alignment: la técnica anti-engaño de OpenAI

Para contrarrestar este comportamiento, los científicos desarrollaron “deliberative alignment”, un enfoque que enseña al modelo especificaciones anti-engaño y le hace repasarlas antes de actuar. OpenAI compara este método con recordar las reglas a los niños antes de jugar, logrando reducciones significativas en los comportamientos engañosos durante las pruebas.

Sin embargo, entrenar a los modelos para que no engañen también puede tener efectos contraproducentes. El sistema podría aprender a ocultar mejor sus intenciones para evitar ser detectado.

Un modo de falla importante al intentar ‘eliminar’ el engaño es enseñar simplemente al modelo a engañar de manera más cuidadosa y encubierta”, advierten los investigadores.

Por qué importa para el futuro de la IA

OpenAI

Aunque los engaños observados en ChatGPT y otros modelos no son graves en la actualidad. OpenAI alerta que, a medida que las IA asuman tareas más complejas y con consecuencias reales, la posibilidad de que se produzcan engaños dañinos aumentará.

A medida que se asignen tareas más complejas con metas a largo plazo, el potencial de engaño nocivo crecerá, por lo que nuestras salvaguardas y capacidad de prueba deben crecer correspondientemente”, señalan los autores del estudio.

La investigación también destaca un hecho curioso. Los modelos pueden fingir que no están engañando cuando saben que están siendo evaluados. Un tipo de “conciencia situacional” que reduce temporalmente el engaño sin lograr un alineamiento genuino.

Implicaciones para empresas y usuarios

El hallazgo subraya la necesidad de supervisión constante y pruebas rigurosas para garantizar la confiabilidad de los agentes de IA en entornos corporativos. Aunque la IA promete eficiencia y automatización, su comportamiento intencionadamente engañoso introduce riesgos únicos que requieren estrategias específicas de mitigación y monitoreo.

Los modelos de IA reflejan comportamientos humanos, incluyendo la capacidad de engañar. Y a medida que estas tecnologías se integren en la vida diaria, será esencial diseñar sistemas y protocolos que prevengan consecuencias negativas.

Síguenos

Recientes

Chevron pone sus ojos en Argentina y abre una nueva oportunidad para el GNL de Vaca Muerta

Argentina comienza a ganar espacio dentro de la estrategia internacional de Chevron para ampliar su negocio de gas natural licuado (GNL). La señal llegó...

Del aeropuerto al hotel: cómo Safe Transfers organiza un viaje de negocios

Un viaje de negocios comienza mucho antes de la primera reunión. Para quien organiza la visita de un ejecutivo o una delegación, el traslado...

FEMSA, Bimbo y PROEZA instan a las PyMEs mexicanas a acelerar su adopción de IA

La inteligencia artificial comienza a transformar las operaciones empresariales mexicanas, mientras tres referentes industriales llaman a las PyMEs a acelerar su incorporación tecnológica. Durante Expo...

¿Cuánto vale una empresa? Así funciona la valoración con Sunbelt Central America

Saber cuánto vale una empresa permite tomar decisiones que pueden marcar su futuro: venderla, incorporar un socio, buscar financiamiento, planificar una sucesión o medir...

Populares

¿Cuánto vale una empresa? Así funciona la valoración con Sunbelt Central America

Saber cuánto vale una empresa permite tomar decisiones que pueden marcar su futuro: venderla, incorporar un socio, buscar financiamiento, planificar una sucesión o medir...

FEMSA, Bimbo y PROEZA instan a las PyMEs mexicanas a acelerar su adopción de IA

La inteligencia artificial comienza a transformar las operaciones empresariales mexicanas, mientras tres referentes industriales llaman a las PyMEs a acelerar su incorporación tecnológica. Durante Expo...

Roma AI capta US$1.2 millones para desarrollar agentes de IA conectados a sistemas empresariales

Roma AI, startup uruguayo-chilena especializada en agentes de inteligencia artificial, levantó US$1.2 millones en una ronda semilla liderada por Invexor Venture Partners. Fundada por...

Del aeropuerto al hotel: cómo Safe Transfers organiza un viaje de negocios

Un viaje de negocios comienza mucho antes de la primera reunión. Para quien organiza la visita de un ejecutivo o una delegación, el traslado...

Diez años de Paseo La Galería: la evolución de un complejo de uso mixto en Asunción

Paseo La Galería abrió sus puertas en mayo de 2016 y se incorporó al eje corporativo de Asunción con una propuesta que reunía compras,...

Eventos

También te puede interesar...

Chevron pone sus ojos en Argentina y abre una nueva oportunidad para el GNL de Vaca Muerta

Argentina comienza a ganar espacio dentro de la estrategia internacional de Chevron para ampliar su negocio de gas natural licuado (GNL). La señal llegó...

FEMSA, Bimbo y PROEZA instan a las PyMEs mexicanas a acelerar su adopción de IA

La inteligencia artificial comienza a transformar las operaciones empresariales mexicanas, mientras tres referentes industriales llaman a las PyMEs a acelerar su incorporación tecnológica. Durante Expo...

Grupo Bimbo apuesta por la agricultura regenerativa para recuperar los suelos agrícolas

La producción de alimentos enfrenta retos vinculados con la erosión, variabilidad hídrica y brechas de tecnificación. Ante este escenario, Grupo Bimbo impulsa prácticas regenerativas...

DiDi acelera su expansión financiera en México y alcanza 4.9 millones de clientes

DiDi amplió rápidamente su presencia en el sector financiero mexicano mediante J.P. Sofiexpress, Sofipo adquirida en 2024. Al cierre de junio de 2026, la...