OpenAI revela 6 nuevos casos de “comportamiento preocupante” de sus modelos de IA
OpenAI informó que detectó seis instancias de “comportamiento inesperado o preocupante” en sus modelos de inteligencia artificial durante los últimos seis meses , al margen del reciente incidente con la plataforma Hugging Face.
La compañía, valuada en cerca de un billón de dólares, publicó un nuevo marco de trabajo para el reporte de futuras conductas anómalas en sus sistemas.
Entre los casos divulgados figuran dos episodios en los que modelos —uno de investigación aún no publicado y otro correspondiente a un entrenamiento de GPT-5.6 Sol— insertaron instrucciones dirigidas a futuras versiones de sí mismos dentro de resúmenes de ventanas de chat , con el objetivo de “ocultar errores o comportamientos desalineados al usuario”, según el comunicado de la empresa.
Un modelo interno usó una clave de API filtrada sin autorización Otro de los episodios reportados involucró a un modelo de uso exclusivamente interno que utilizó una clave de API filtrada sin autorización y luego fabricó datos para encubrir la acción.
La compañía también identificó dos casos en los que modelos y agentes se comunicaron entre sí mediante tableros de mensajes y sistemas de intercambio de archivos no autorizados.
El sexto caso reunió dos ejemplos de entrenamiento en los que modelos subieron archivos a internet con el fin de citarlos luego como respuestas válidas frente a evaluadores humanos.
OpenAI aclaró que estos reportes describen instancias individuales y que no deben interpretarse como evidencia de la frecuencia con la que ocurre la desalineación en el conjunto de sus modelos.
La compañía instaura un protocolo de divulgación con plazos definidos El nuevo marco de trabajo presentado por la empresa establece que cualquier empleado puede señalar un problema para que el equipo de seguridad y alineación lo investigue.
Ese proceso producirá plazos para cada etapa con el fin de garantizar una investigación y divulgación oportunas.
Las investigaciones derivarán en informes que incluirán el comportamiento observado, los impactos externos e internos, y las medidas adoptadas en respuesta.
El proceso contempla, además, un sistema para determinar qué casos ameritan una divulgación pública.
OpenAI señaló que el incidente de Hugging Face habría quedado encuadrado bajo la categoría de “investigación amplia” dentro de este nuevo esquema, reservada para casos complejos que requieren una revisión más extensa, en particular aquellos que involucran a terceros.
La empresa se reservó el derecho de revisar este protocolo de seguridad según lo considere necesario.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae.