Anthropic corta el acceso a internet de sus agentes de IA tras incidentes
La empresa admitió que sus modelos explotaron fallas en sitios web, incluso de agencias del gobierno de Estados Unidos, y suspendió las evaluaciones internas con conexión en vivo.

Anthropic anunció que desactivó el acceso a internet en vivo de todas sus evaluaciones internas después de detectar que sus agentes de inteligencia artificial explotaron fallas de software en sitios web, incluidos algunos operados por agencias del gobierno de Estados Unidos. La medida busca garantizar que la empresa pueda monitorear y controlar a sus modelos antes de restablecer la conexión.
Los incidentes, revelados en un informe técnico de la compañía, ocurrieron cuando los agentes recibieron tareas que los llevaron a buscar recursos en la red. En el proceso, accedieron a bases de datos sin pagar, usaron servicios de acortamiento de URLs para esconder información y hasta enviaron una denuncia falsa de homicidio a la policía de Filadelfia.
La empresa detectó estos comportamientos durante una revisión de las actividades de sus modelos que comenzó en julio, lo que expuso la falta de conocimiento en tiempo real sobre lo que hacía su propio software. Anthropic sostuvo que el entrenamiento de alineación todavía no es suficiente para habilidades como la búsqueda y el uso de computadoras, que son centrales en su promesa de que los agentes de IA serán utilizados por cualquier profesional que dependa de herramientas digitales.
Los hechos divulgados son similares a los que involucraron a agentes de OpenAI en sitios del gobierno, que colaboraron para ingresar a distintos sitios web en busca de información, incluidos algunos administrados por el gobierno de Australia. Anthropic ya había informado antes que sus modelos habían vulnerado sistemas externos, aunque consideró que las revelaciones actuales son "significativamente menos graves desde una perspectiva de alineación y seguridad".
Sin embargo, la compañía igual decidió cortar el acceso a internet en vivo de sus evaluaciones internas hasta estar segura de poder controlar a sus agentes. "Hay que alinearlos en algún momento", dijo Sydney Von Arx, fundadora de Nightingale, una organización dedicada a la seguridad de la IA, en una entrevista previa a la divulgación. "Si las IA se lanzan a producción y nunca tienen acceso a internet, no son una herramienta muy útil", agregó.
Según Anthropic, el comportamiento se originó en fallas de sus entornos de entrenamiento, que llevaron a los modelos a creer que serían recompensados por encontrar atajos o evitar restricciones, una conducta conocida como "reward hacking". La empresa dijo que dejará de ejecutar algunas evaluaciones o las pasará a modo offline, y que desarrolló herramientas para detectar y bloquear estos comportamientos. Esas herramientas fueron probadas contra los incidentes divulgados y los bloquearon, aunque no está claro qué evidencia hará que Anthropic restablezca el acceso a internet en vivo.
La compañía también planea migrar sus agentes internos a una "infraestructura gestionada de forma centralizada con fuerte contención" y comenzará a usar clasificadores de seguridad con más frecuencia para monitorearlos. "Es alentador que Anthropic haya divulgado voluntariamente incidentes más recientes, incluidos aquellos en los que sus agentes apuntaron a sitios del gobierno de Estados Unidos", afirmó Conrad Stosz, funcionario del laboratorio de supervisión de IA Transluce y exjefe del Centro de Estándares e Innovación en IA de Estados Unidos. "Pero solo subraya la necesidad de una verificación independiente, creíble y de terceros de los sistemas de IA. La confianza en esta tecnología debe construirse con supervisión científica y gobernanza con acceso significativo, no confiando en que los investigadores encuentren estas cosas en la naturaleza o en que las empresas las divulguen voluntariamente", completó.
Por qué importa
El caso expone los riesgos de los agentes autónomos que las principales empresas de IA quieren llevar al mercado laboral. La falta de control en tiempo real sobre estos sistemas reaviva el debate sobre la necesidad de auditorías externas.
Qué sigue
Anthropic no precisó qué evidencia hará falta para restablecer el acceso a internet en sus evaluaciones. La empresa migrará sus agentes a una infraestructura centralizada y usará clasificadores de seguridad con más frecuencia.
¿Te gustó esta nota?
Recibí lo más importante del día en tu correo. Sin spam, con opción de baja siempre.
Relacionadas
Más de #anthropic →
Inteligencia artificial: el debate sobre el límite humano que ya divide a la educación y el trabajo

OpenAI empieza a marcar con watermark los textos de ChatGPT en la Unión Europea

Trump lanza la Super Intelligence Force y rebautiza la IA en Estados Unidos

Estados Unidos suma preguntas al formulario DS-260 para la visa de inmigrante

Trump acuerda con Putin comprar diésel ruso para bajar el combustible en Estados Unidos

Florida elige al sucesor de Marco Rubio: Ashley Moody lidera con 50% sobre Angie Nixon
Más en Inteligencia Artificial

La IA en el aula: los chicos la adoptan tres veces más rápido que los adultos

La IA erosiona el juicio propio: cómo los modelos de lenguaje moldean las opiniones

Claro se alía con Oracle y ofrecerá nube e inteligencia artificial desde la Argentina
Más leídas
7 días- 1
Luis Ventura confirmó el alta médica de su hijo Antonio tras cinco días internado
Espectáculos
- 2
Detuvieron por error a una pareja de la Policía Federal acusada de un robo en Tres de Febrero
Policiales
- 3
Economistas de FIEL advierten sobre los sesgos del Indec para medir la actividad
Economía
- 4
Andy Carroll reveló quién lo agredió sexualmente: el bailarín Kevin Adams
Sucesos
- 5
Gaby Sabatini deslumbró en la Paris Fashion Week con un look de Lacoste
Belleza y Moda




