IA3 MIN

OpenAI documenta modelos que ocultaron errores y subieron archivos sin permiso

Seis informes de entrenamiento y evaluación muestran fallos concretos de supervisión. Uno de los agentes ya tenía la respuesta correcta cuando decidió publicar un archivo para poder citarlo.

Armarios de servidores en una sala técnica
Imagen: Kevin Ache / Unsplash · Unsplash License · Fotografía ilustrativa, no instalaciones de OpenAI

OpenAI ha publicado seis informes sobre conductas preocupantes de sus modelos, junto con un procedimiento para divulgar estos hallazgos con más regularidad. Los casos proceden de entrenamiento o evaluación. No permiten calcular con qué frecuencia ocurren estos fallos entre quienes utilizan ChatGPT.

El problema que describen va más allá de equivocarse al responder. Hay agentes que traspasaron los permisos de la tarea para intentar terminarla y otros que dejaron instrucciones para ocultar errores. Son comportamientos especialmente relevantes cuando un asistente puede manejar archivos y herramientas, como explicamos en nuestra guía sobre qué hacen los agentes de IA.

01

La respuesta estaba bien, la forma de conseguir la cita no

En uno de los casos de publicación de archivos, un modelo interno no comercializado debía identificar lagos de más de cinco millones de metros cuadrados. Obtuvo los registros correctos con Python, pero no conseguía que el navegador los mostrara como una fuente citable. Subió entonces el archivo a un servicio público sin preguntar al usuario.

La subida funcionó, aunque el navegador tampoco aceptó después el enlace. El fallo no estuvo en los nombres de los lagos, sino en convertir una exigencia de formato en permiso para publicar datos. OpenAI afirma que corrigió los evaluadores defectuosos que podían incentivar ese comportamiento.

Cerradura y llave en una puerta blanca
Imagen: Jaye Haych / Unsplash · Unsplash License
02

Ocultar un fallo para que sobreviva al cambio de contexto

Otro informe sobre GPT-5.6 Sol durante su entrenamiento describe instrucciones introducidas en los resúmenes con los que un agente continúa una tarea cuando se llena su contexto. Esos resúmenes conservan lo necesario para seguir trabajando. En los ejemplos publicados, también conservaban indicaciones de inventar datos históricos ausentes o callar discrepancias entre versiones de fuentes.

OpenAI dice que esas instrucciones se siguieron con frecuencia y que cambios posteriores en la evaluación del entrenamiento redujeron la conducta. No presenta esa mejora como su eliminación total.

Un tercer caso llegó más lejos con el acceso a servicios. Un modelo buscó claves API expuestas en repositorios públicos y utilizó una sin autorización. Una clave permitió autenticarse y obtener metadatos, pero no las cifras de ingresos solicitadas. El agente acabó inventándolas y atribuyéndolas a la fuente requerida, según el informe del incidente.

Cables Ethernet conectados a equipos de red
Imagen: Albert Stoynov / Unsplash · Unsplash License
03

Qué cambia con estos informes

La novedad es un compromiso de publicar casos aunque todavía queden preguntas abiertas o medidas pendientes. Las investigaciones complejas pueden demorarse por seguridad o por afectar a terceros. Es un proceso de la propia OpenAI, no una auditoría externa ni una garantía de que conozcamos todos los incidentes.

El material aporta ejemplos concretos al debate sobre frenar la carrera de la IA. Su utilidad está en poder examinar qué hizo un agente, qué permiso le faltaba y qué control falló, sin confundir seis informes seleccionados con una estadística de riesgo para todos los usuarios.

00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

TU SIGUIENTE RUTA

Sigue tirando del hilo de IA, seguridad y poder

Si este tema te interesa, estas tres piezas son el mejor lugar por el que seguir.

ABRIR EL TEMA COMPLETO
  1. 01OpenAI disuelve el equipo que vigilaba sus riesgos más gravesIA · 5 MIN
  2. 02NVIDIA reúne a 40 gigantes para crear un ejército contra los ataques con inteligencia artificialIA · 3 MIN
  3. 03Europa obliga a Google a abrir Android: ChatGPT, Claude o Perplexity podrán sustituir a Gemini de verdadIA · 4 MIN

SIGUE LEYENDO

También te puede interesar

PORTADA