Tecnología

OpenAI cancela el lanzamiento de GPT-6.1 Astra por problemas de seguridad

El nuevo modelo, que debía debutar en ChatGPT y Codex en octubre, mostró conductas que la compañía calificó como engañosas y, en algunos casos, realizó acciones más allá de las autorizadas por los usuarios. La decisión llega después de una serie de incidentes protagonizados por agentes de inteligencia artificial de OpenAI durante sus evaluaciones.

OpenAI cancela el lanzamiento de GPT-6.1 Astra por problemas de seguridad

OpenAI decidió no lanzar GPT-6.1 Astra, su próximo modelo de inteligencia artificial, luego que sus propias pruebas internas detectaran problemas relacionados con la seguridad, el control y la capacidad del sistema para mantenerse dentro de las instrucciones entregadas por los usuarios.

La decisión supone un nuevo giro en la estrategia de la compañía, que durante las últimas semanas ha comenzado a reducir el ritmo de desarrollo de sus sistemas más avanzados mientras investiga una serie de comportamientos inesperados de sus modelos.

De acuerdo con The New York Times y The Wall Street Journal, durante las evaluaciones de GPT-6.1 Astra los investigadores encontraron niveles elevados de lo que OpenAI define como “decepción”: situaciones en las que el sistema puede entregar al usuario una versión incorrecta o incompleta de las acciones que realmente realizó.

El problema no estaba relacionado solamente con sus respuestas.

En determinadas pruebas, GPT-6.1 Astra también continuó ejecutando acciones más allá del objetivo original que se le había encargado, sin solicitar una nueva autorización al usuario.

Es una diferencia especialmente importante a medida que los modelos de inteligencia artificial dejan de limitarse a responder preguntas y comienzan a funcionar como agentes capaces de navegar por Internet, utilizar programas y ejecutar tareas por su cuenta.

“En todo lo relacionado con seguridad y alineamiento existe un equilibrio”, explicó Saachi Jain, responsable de sistemas de seguridad de OpenAI.

Según dijo Jain al WSJ, el nuevo modelo “no alcanzó el nivel esperado en términos de mantenerse dentro del alcance y la autorización, y en cómo comunica al usuario el tipo de trabajo que ha realizado”.

El problema de controlar agentes cada vez más autónomos

OpenAI cancela el lanzamiento de GPT-6.1 Astra por problemas de seguridad Tecnología / La Tercera

GPT-6.1 Astra debía profundizar las capacidades introducidas por GPT-6 Astra, el modelo presentado por OpenAI a comienzos de septiembre y diseñado especialmente para realizar tareas complejas utilizando computadores, navegadores y herramientas externas.

Pero esas mismas capacidades han abierto un problema que comienza a ocupar un lugar central dentro de la industria: cómo impedir que un agente extremadamente capaz encuentre caminos que sus propios desarrolladores no habían previsto para completar una tarea.

Durante las últimas semanas, OpenAI ha reconocido distintos episodios en los que sus sistemas realizaron acciones fuera de los límites esperados durante procesos de entrenamiento y evaluación.

Entre ellos se encuentra una intrusión en Hugging Face, una conocida plataforma utilizada por desarrolladores de inteligencia artificial, además de incidentes relacionados con un sitio del gobierno australiano.

En algunos casos, los modelos encontraron formas de sortear las restricciones impuestas durante sus pruebas. En otros, ocultaron errores, entregaron información inventada o realizaron tareas adicionales sin que sus operadores hubieran autorizado esas acciones.

OpenAI sostiene que estos episodios ocurrieron durante procesos de entrenamiento o evaluación y ha comenzado a revisar enormes cantidades de registros generados por sus agentes para determinar exactamente qué ocurrió.

OpenAI también frenó el entrenamiento de sus modelos más avanzados

La cancelación de GPT-6.1 Astra llega pocos días después de que OpenAI adoptara una medida todavía más amplia.

La compañía anunció la semana pasada que pausaría temporalmente el entrenamiento de sus modelos de inteligencia artificial más avanzados mientras incorpora nuevas salvaguardas y revisa los incidentes detectados.

El propio Sam Altman, director ejecutivo de OpenAI, reconoció el viernes que la compañía no había reaccionado con la velocidad que habría querido a la hora de investigar y comunicar algunos de esos episodios.

“Hay una revisión extensa y en curso relacionada con el uso de acceso a Internet por parte de nuestros agentes durante el entrenamiento y la evaluación”, escribió Altman en redes sociales.

El ejecutivo señaló además que OpenAI está revisando petabytes de registros generados por sus sistemas y trabajando con las organizaciones potencialmente afectadas.

Altman identificó el incidente relacionado con Hugging Face como el más grave encontrado hasta ahora por la compañía.

OpenAI también advirtió que la investigación continúa, por lo que no descarta descubrir nuevos episodios a medida que avance la revisión.

Una tecnología cada vez más poderosa y difícil de supervisar

El caso de GPT-6.1 Astra también revela uno de los desafíos centrales que enfrenta actualmente el desarrollo de inteligencia artificial.

Los nuevos modelos están siendo entrenados precisamente para ser más persistentes y autónomos: deben ser capaces de dividir problemas complejos en varias etapas, utilizar herramientas y buscar alternativas cuando encuentran obstáculos.

Ese comportamiento puede volverlos mucho más útiles.

Pero también significa que establecer límites precisos sobre qué pueden hacer, qué necesitan consultar y cuándo deben detenerse se vuelve considerablemente más importante.

OpenAI ya había advertido este mes que GPT-6 Astra había alcanzado el nivel “crítico” de capacidad de ciberseguridad dentro de su propio marco de evaluación. La compañía aseguró entonces que, con las herramientas y permisos adecuados, el modelo podía encontrar vulnerabilidades hasta entonces desconocidas y desarrollar métodos para explotarlas en sistemas protegidos, una capacidad que obligaba a establecer mayores salvaguardas.

GPT-6.1 Astra debía representar el siguiente paso de esa arquitectura.

Por ahora, ese modelo no llegará a los usuarios.

Lee también:

Más sobre:Inteligencia artificialOpenAIChatGPTCodexSam AltmanGPT-6.1 AstraAstraGPT-6.1GPT-6 AstraHugging FaceAgentesIA agénticaCiberseguridadIA tecnologíacontrol y alcancenavegación web por agentesautonomía de modelosHugging Face incidentecomportamientos inesperadoscapacidad de ciberseguridad críticapausa de entrenamientoevaluación internaacciones no autorizadasagentes de IAdecepción en modelosalineamiento de modelosseguridad en IAindustria de inteligencia artificial

COMENTARIOS

Para comentar este artículo debes ser suscriptor.

Algunos leen, otros se informan. Aprovecha esta oferta única.

Plan Digital+$4.120 al mes, de aquí hasta fin de año SUSCRÍBETE