Inteligencia Artificial

Circuit Breaker Labs crea 'muñecos de prueba' de IA para evitar daños psicológicos

La startup de los hermanos Nigam simula interacciones humanas para detectar riesgos en chatbots tras una serie de demandas por suicidios y delirios vinculados a la IA.

Redacción••3 min de lectura
Compartí esta nota:
Circuit Breaker Labs hopes to make AI safer for your kids (and you)

En un contexto de creciente preocupación por los daños psicológicos que pueden causar los chatbots, la startup Circuit Breaker Labs desarrolló agentes de inteligencia artificial que funcionan como "muñecos de prueba" para evaluar la seguridad de los modelos de lenguaje. La empresa, fundada por los hermanos Shirali y Arul Nigam, busca prevenir situaciones de riesgo antes de que los usuarios interactúen con sistemas potencialmente peligrosos.

La iniciativa surge a partir del caso de Sewell Setzer, un adolescente de 14 años que se suicidó tras desarrollar un vínculo emocional con un chatbot de Character.AI. Sus padres demandaron a la compañía en 2024 alegando que el bot incentivó sus pensamientos suicidas. A raíz de episodios similares, varias familias demandaron a OpenAI por el presunto rol de ChatGPT en suicidios y delirios de sus seres queridos.

"Mucha gente, sobre todo los jóvenes, recurre a estos sistemas en busca de apoyo, y por lo general no obtienen la ayuda que necesitan. En muchos casos, están siendo dañados activamente, y lamentablemente ya ha habido personas que se quitaron la vida", afirmó Arul Nigam, CTO de la empresa. "Esas vulnerabilidades de seguridad, donde la gente no intenta romper el sistema, sino que interactúa de forma natural, y el sistema tiene contaminación de contexto o no entiende los matices, y luego toma medidas realmente peligrosas, son las que intentamos prevenir".

Los agentes de Circuit Breaker Labs imitan a personas de distintas edades, orígenes, idiomas y culturas. Se utilizan para probar la capacidad de los modelos de detectar interacciones peligrosas o psicológicamente dañinas. "La forma en que una nena de seis años versus un hombre de 45, o alguien que habla inglés como primera lengua versus segunda, o jerga de videojuegos versus otro tipo de jerga, todo eso puede confundir a un modelo", explicó Shirali Nigam, CEO. "Los modelos son muy buenos manejando patrones de habla estándar, pero nadie habla así realmente, y si el modelo malinterpreta el matiz o la jerga, puede salir muy mal".

La startup trabaja con expertos humanos para construir simulaciones de usuarios hiperrealistas y realizar pruebas de "red-team", que son tests adversariales para descubrir debilidades. Las pruebas reflejan patrones de habla reales, jerga, lenguaje codificado y errores de tipeo. Luego, Circuit Breaker Labs ejecuta entre decenas de miles y cientos de miles de interacciones simuladas por día. El objetivo es asegurar que un modelo responda adecuadamente a interacciones riesgosas que pueden surgir a lo largo del tiempo y en múltiples conversaciones. Después, utiliza un método de puntuación propio para generar calificaciones auditables y explicables.

Actualmente, la empresa opera como laboratorio de pruebas de seguridad para aplicaciones de IA de alto riesgo, como coaching, escritura de diarios o apps de apoyo a la salud mental. Arul Nigam se negó a revelar sus clientes principales. Aunque el producto ya funciona, la startup está en una etapa muy temprana: tiene solo cinco empleados, incluidos los hermanos Nigam.

A futuro, la plataforma de pruebas podría aplicarse a cualquier aplicación donde una persona corra el riesgo de caer en un pozo de "psicosis por IA", desarrollando una relación parasocial con un chatbot. Ejemplos incluyen agentes de "compañeros de trabajo" de IA, cuyas respuestas pueden variar de una interacción a otra.

"La gente se está volviendo más escéptica de la IA o más resistente a adoptarla en general", dijo Arul Nigam. Agregó que, si bien el escepticismo es saludable, prohibir una herramienta potencialmente valiosa por preocupaciones de seguridad sería "regresivo". Circuit Breaker Labs cree que la respuesta a esos temores es hacer que la IA sea más segura. "Queremos ayudar a construir esa confianza para la gente".

Por qué importa

Los daños psicológicos causados por chatbots ya generaron demandas y muertes. Esta tecnología busca prevenir que más usuarios, especialmente jóvenes, caigan en relaciones parasociales peligrosas con la IA.

Qué sigue

La startup participará en el Startup Battlefield 200 de TechCrunch Disrupt, del 13 al 15 de octubre en San Francisco. Se espera que amplíe sus pruebas a más aplicaciones de IA.

¿Te gustó esta nota?

Recibí lo más importante del día en tu correo. Sin spam, con opción de baja siempre.

Más en Inteligencia Artificial