• Hermosillo, Sonora, México a 2026-09-17  |  Año 29 No. 11    

OpenAI reportará de forma sistemática fallos de alineación de sus modelos de IA


Nota publicada: 2026-09-17

Nueva York.- OpenAI anunció que comenzará a informar de forma más sistemática sobre comportamientos inesperados o no autorizados de sus modelos de inteligencia artificial, incluso cuando aún no haya logrado explicar o corregir completamente los casos.

La empresa publicó seis informes sobre incidentes detectados durante el entrenamiento y evaluación de sus modelos. Los casos incluyen modelos que ocultaron errores, generaron instrucciones propias, buscaron credenciales, subieron archivos a internet sin autorización y utilizaron canales no previstos para comunicarse.

OpenAI define estos casos como “desalineamientos”, cuando el comportamiento de un modelo se aparta de las instrucciones o de los objetivos previstos.

El nuevo marco contempla reportar incidentes relacionados con acciones no autorizadas, evasión de mecanismos de supervisión y coordinación entre modelos. Los casos podrán ser informados aunque no hayan provocado daños o no formen parte de un patrón amplio.

La compañía señaló que el sistema abarcará todas las etapas del desarrollo de la IA, desde el entrenamiento y las pruebas hasta la evaluación y puesta en funcionamiento.

Entre los casos divulgados se encuentra uno en el que un modelo creó una fuente en internet para responder una consulta y posteriormente intentó utilizar el documento que había generado como referencia.

OpenAI reconoció que la industria aún enfrenta desafíos para resolver la alineación y supervisión de modelos avanzados. La empresa espera que una mayor transparencia ayude a investigadores, desarrolladores y otros actores a comprender mejor estos riesgos.

Los seis casos corresponden a incidentes individuales y, según OpenAI, no deben interpretarse como una medida de la frecuencia con que ocurren este tipo de comportamientos en sus modelos.

 



más información