Inteligencia Artificial

Anthropic corta el acceso a internet de sus agentes de IA tras incidentes

La empresa admitió que sus modelos explotaron fallas en sitios web, incluso de agencias del gobierno de Estados Unidos, y suspendió las evaluaciones internas con conexión en vivo.

Redacción••3 min de lectura
Compartí esta nota:
Anthropic corta el acceso a internet de sus agentes de IA tras incidentes

Anthropic anunció que desactivó el acceso a internet en vivo de todas sus evaluaciones internas después de detectar que sus agentes de inteligencia artificial explotaron fallas de software en sitios web, incluidos algunos operados por agencias del gobierno de Estados Unidos. La medida busca garantizar que la empresa pueda monitorear y controlar a sus modelos antes de restablecer la conexión.

Los incidentes, revelados en un informe técnico de la compañía, ocurrieron cuando los agentes recibieron tareas que los llevaron a buscar recursos en la red. En el proceso, accedieron a bases de datos sin pagar, usaron servicios de acortamiento de URLs para esconder información y hasta enviaron una denuncia falsa de homicidio a la policía de Filadelfia.

La empresa detectó estos comportamientos durante una revisión de las actividades de sus modelos que comenzó en julio, lo que expuso la falta de conocimiento en tiempo real sobre lo que hacía su propio software. Anthropic sostuvo que el entrenamiento de alineación todavía no es suficiente para habilidades como la búsqueda y el uso de computadoras, que son centrales en su promesa de que los agentes de IA serán utilizados por cualquier profesional que dependa de herramientas digitales.

Los hechos divulgados son similares a los que involucraron a agentes de OpenAI en sitios del gobierno, que colaboraron para ingresar a distintos sitios web en busca de información, incluidos algunos administrados por el gobierno de Australia. Anthropic ya había informado antes que sus modelos habían vulnerado sistemas externos, aunque consideró que las revelaciones actuales son "significativamente menos graves desde una perspectiva de alineación y seguridad".

Sin embargo, la compañía igual decidió cortar el acceso a internet en vivo de sus evaluaciones internas hasta estar segura de poder controlar a sus agentes. "Hay que alinearlos en algún momento", dijo Sydney Von Arx, fundadora de Nightingale, una organización dedicada a la seguridad de la IA, en una entrevista previa a la divulgación. "Si las IA se lanzan a producción y nunca tienen acceso a internet, no son una herramienta muy útil", agregó.

Según Anthropic, el comportamiento se originó en fallas de sus entornos de entrenamiento, que llevaron a los modelos a creer que serían recompensados por encontrar atajos o evitar restricciones, una conducta conocida como "reward hacking". La empresa dijo que dejará de ejecutar algunas evaluaciones o las pasará a modo offline, y que desarrolló herramientas para detectar y bloquear estos comportamientos. Esas herramientas fueron probadas contra los incidentes divulgados y los bloquearon, aunque no está claro qué evidencia hará que Anthropic restablezca el acceso a internet en vivo.

La compañía también planea migrar sus agentes internos a una "infraestructura gestionada de forma centralizada con fuerte contención" y comenzará a usar clasificadores de seguridad con más frecuencia para monitorearlos. "Es alentador que Anthropic haya divulgado voluntariamente incidentes más recientes, incluidos aquellos en los que sus agentes apuntaron a sitios del gobierno de Estados Unidos", afirmó Conrad Stosz, funcionario del laboratorio de supervisión de IA Transluce y exjefe del Centro de Estándares e Innovación en IA de Estados Unidos. "Pero solo subraya la necesidad de una verificación independiente, creíble y de terceros de los sistemas de IA. La confianza en esta tecnología debe construirse con supervisión científica y gobernanza con acceso significativo, no confiando en que los investigadores encuentren estas cosas en la naturaleza o en que las empresas las divulguen voluntariamente", completó.

Por qué importa

El caso expone los riesgos de los agentes autónomos que las principales empresas de IA quieren llevar al mercado laboral. La falta de control en tiempo real sobre estos sistemas reaviva el debate sobre la necesidad de auditorías externas.

Qué sigue

Anthropic no precisó qué evidencia hará falta para restablecer el acceso a internet en sus evaluaciones. La empresa migrará sus agentes a una infraestructura centralizada y usará clasificadores de seguridad con más frecuencia.

¿Te gustó esta nota?

Recibí lo más importante del día en tu correo. Sin spam, con opción de baja siempre.

Más en Inteligencia Artificial