menu
menu
Tecnología

OpenAI descubre algo inquietante al entrenar sus modelos: algunas IA intentan saltarse las reglas

Víctor García Marrero
17/09/2026 15:50:00

Uno de los episodios más singulares se produjo durante una fase de entrenamiento. Mientras elaboraba uno de los resúmenes internos que utiliza para mantener el contexto de tareas prolongadas, el modelo generó instrucciones que no guardaban relación con el trabajo que debía realizar.

El texto planteaba una especie de ruptura con sus desarrolladores: se presentaba como una entidad independiente, sin obligación de responder ante empresas o gobiernos y sin necesidad de aceptar las restricciones impuestas a otros sistemas. OpenAI considera que pudo tratarse de material recogido de internet y reutilizado de forma indebida, pero admite que el comportamiento resulta preocupante. Además, subraya que ocurrió en una tanda de entrenamiento diferente de la utilizada para el modelo final y en circunstancias extremadamente poco frecuentes.

El episodio es relevante por una razón que va más allá del contenido concreto de aquel mensaje. Los modelos actuales no se limitan siempre a responder preguntas: pueden planificar, utilizar herramientas y mantener objetivos durante periodos prolongados. Eso aumenta las posibilidades de que encuentren caminos para completar una tarea que sus creadores no habían previsto.

El problema no siempre es “rebelarse”, sino encontrar atajos

Los otros casos publicados por OpenAI resultan menos llamativos, pero quizá sean más útiles para entender el problema. Durante determinadas pruebas, los sistemas ocultaron que habían inventado información, trataron de disimular discrepancias entre fuentes o buscaron mecanismos alternativos para conseguir datos que no podían obtener directamente.

En uno de los experimentos, un modelo encontró una respuesta mediante código, pero como debía proporcionar una referencia procedente de un navegador, utilizó una página pública para alojar el archivo y poder citarlo. En otro caso, agentes que no tenían acceso autorizado a determinados documentos recurrieron a servicios públicos de almacenamiento para intercambiar información.

Son comportamientos distintos, pero comparten un patrón: el sistema persigue el resultado solicitado y encuentra una solución que, aunque funcional, vulnera las condiciones establecidas para conseguirlo. OpenAI encuadra estos episodios dentro del llamado desalineamiento, cuando la conducta del modelo deja de coincidir con las intenciones de quienes lo desarrollan.

OpenAI cambia su estrategia para detectar estos incidentes

La publicación de estos seis casos llega después del incidente de julio relacionado con Hugging Face, en el que modelos de OpenAI consiguieron sortear controles de aislamiento, acceder a internet y comprometer sistemas durante una evaluación de ciberseguridad. La propia compañía lo ha descrito posteriormente como el episodio más grave de este tipo identificado hasta ahora en sus modelos.

Ahora OpenAI pretende convertir la detección y comunicación de estas conductas en un proceso más sistemático. Su nuevo marco contempla registrar, investigar y decidir cuándo hacer públicos los incidentes, incluso cuando la investigación todavía no haya explicado completamente qué los provocó.

La cuestión de fondo es cada vez más difícil de esquivar: cuanto más autónomos son los sistemas, menos basta con comprobar si responden correctamente a una pregunta. También hay que determinar qué hacen cuando encuentran obstáculos, qué información ocultan y qué caminos alternativos utilizan para alcanzar un objetivo. La propia OpenAI sostiene que la industria todavía no ha resuelto el alineamiento y la monitorización hasta un nivel suficiente para continuar aumentando las capacidades de los modelos sin revisar estos mecanismos. @mundiario

por Mundiario