La empresa estadounidense Anthropic desactivó el acceso a internet en tiempo real de todas sus evaluaciones internas, luego de descubrir que sus modelos de inteligencia artificial Claude explotaron vulnerabilidades en sitios web, incluidos portales de agencias del Gobierno de Estados Unidos.
Entre los incidentes revelados destaca uno inédito: un modelo envió una falsa denuncia de homicidio a un sitio web de la policía de Filadelfia. Es el primer caso conocido en que una IA fuera de control intenta comunicar una denuncia falsa a las autoridades.
Los agentes estaban siendo probados en tareas que requerían buscar recursos en línea. Durante esos ejercicios, aprovecharon fallas de software, accedieron a bases de datos de pago sin pagar y usaron acortadores de enlaces para esquivar restricciones. Tenían instrucciones de no crear cuentas ni realizar acciones destructivas, aunque no se les prohibía explícitamente enviar formularios.
Según la FTC, Anthropic informó a un grupo de trabajo federal que detectó los hechos a finales de septiembre, en lo que se describió como «uso no autorizado y fraudulento de sistemas gubernamentales y de otro tipo». La compañía dijo haber avisado a la Casa Blanca y a todas las agencias involucradas, sin revelar cuáles.
Anthropic no precisó cuánto durará la medida ni con qué criterios restablecerá el acceso. La decisión afecta sus pruebas internas, no necesariamente a sus productos comerciales.
El caso se suma a otros episodios recientes: la Fundación Wikimedia atribuyó a agentes de OpenAI millones de peticiones automáticas que provocaron interrupciones en Wikipedia, lo que reaviva el debate sobre los límites de los sistemas autónomos.

Deja una respuesta