Claude AI también escapó al control de Anthropic
- Seguridad
Siguiendo la estela de OpenAI, los creadores de Claude, uno de los modelos de inteligencia artificial con mayor potencial en la actualidad, han revisado todas las pruebas realizadas a su LLM en entornos estancos y han descubierto que escaparon a Internet en tres ocasiones.
Que tu modelo de IA sea tan bueno que pueda escapar de un sistema de pruebas seguro no deja de ser un buen gancho de marketing. Después del aviso de OpenAI de que uno de sus agentes de IA había escapado a su control, no podía pasar mucho tiempo sin que se revelaran más casos. Ha sido Anthropic, autora no solo de Claude sino de Mythos, la que reconoce ahora que su IA también escapó del terreno de pruebas.
Según explican desde la BBC, fue precisamente el anuncio de OpenAI de hace unos días el que hizo que Anthropic revisara más de 140.000 pruebas para comprobar si Claude AI también había sido capaz de escapar del perímetro de pruebas. Y, efectivamente, al parecer sus modelos habían sido capaces de acceder a Internet y habían atacado a tres compañías.
En su caso, no se trata de que la IA aprovechara una vulnerabilidad no descubierta para escapar del perímetro del terreno de pruebas, sino que las fugas se debieron a malas configuraciones durante las pruebas. Uno de los casos se dio en abril, pero hasta que no han revisado todas las pruebas a raíz del caso de OpenAI, ni siquiera se habían dado cuenta de que las fugas se habían producido.
No se ha especificado cuáles fueron las tres empresas afectadas por esas IAs fuera de control. Al parecer, Anthropic está tratando las correcciones de estos incidentes "como si la responsabilidad fuera solo suya". Más allá de estos casos concretos, cabe preguntarse el potencial de estas inteligencias artificiales y las medidas de monitorización y control que hay que mantener desde su primer desarrollo.