martes, 22 de abril de 2025

Anthropic acaba de analizar 700,000 conversaciones y descubrió que su IA tiene un código moral propio.

Antrópico, la compañía de IA fundada por ex empleados de OpenAI, ha retirado el telón de un análisis sin precedentes de cómo su asistente de IA Claude expresa valores durante conversaciones reales con los usuarios. La investigación, publicada hoy, revela una alineación tranquilizadora con los objetivos de la compañía y casos de vanguardia que podrían ayudar a identificar vulnerabilidades en las medidas de seguridad de IA.

El estudio examinó 700,000 conversaciones anónimas, encontrando que Claude defiende en gran medida a los compañeros “útil, honesto, inofensivo” framework mientras adapta sus valores a diferentes contextos  desde consejos de relación hasta análisis histórico. Esto representa uno de los intentos más ambiciosos para evaluar empíricamente si un comportamiento de sistematización de IA en la naturaleza coincide con su diseño previsto.

“Nuestra esperanza es que esta investigación aliente a otros laboratorios de IA a realizar una investigación similar en sus valores de models’,” dijo Saffron Huang, miembro del equipo de Anthropicicss Societal Impacts que trabajó en el estudio, en una entrevista con VentureBeat. “Medir los valores de un sistema de IA es fundamental para alinear la investigación y la comprensión de si un modelo está realmente alineado con su entrenamiento

 

Dentro de la primera taxonomía moral integral de un asistente de IA

El equipo de investigación desarrolló un nuevo método de evaluación para categorizar sistemáticamente los valores expresados en conversaciones reales de Claude. Después de filtrar el contenido subjetivo, analizaron más de 308,000 interacciones, creando lo que describen como “la primera taxonomía empírica a gran escala de los valores de IA

La taxonomía organizó los valores en cinco categorías principales: Práctico, Epistémico, Social, Protector y Personal. En el nivel más granular, el sistema identificó 3.307 valores únicos desde virtudes cotidianas como el profesionalismo hasta conceptos éticos complejos como el pluralismo moral.

“Me sorprendió la enorme y diversa gama de valores con los que terminamos, más de 3,000, desde ‘autosuficiencia’ hasta ‘pensamiento estratégico’ y ‘piedad filial,'” Huang le dijo a VentureBeat. “Fue sorprendentemente interesante pasar mucho tiempo pensando en todos estos valores, y construyendo una taxonomía para organizarlos en relación entre sí — Siento que me enseñó algo sobre los sistemas de valores humanos, too.”

La investigación llega en un momento crítico para Anthropic, que recientemente lanzó “Max Claude,” un nivel de suscripción mensual premium de $200 destinado a competir con la oferta similar de OpenAIays. La compañía también ha ampliado las capacidades de Claudeuds para incluir Espacio de trabajo de Google funciones de integración e investigación autónoma, posicionándola como “un verdadero colaborador virtual” para usuarios empresariales, según anuncios recientes.

Cómo Claude sigue su entrenamiento y dónde las salvaguardas de IA pueden fallar

El estudio encontró que Claude generalmente se adhiere a las aspiraciones prosociales de Anthropicic, enfatizando valores como “habilitación de usuario,” “humildad epistémica,” y “bienestar del paciente” a través de diversas interacciones. Sin embargo, los investigadores también descubrieron casos preocupantes en los que Claude expresó valores contrarios a su entrenamiento.

“En general, creo que vemos este hallazgo como datos útiles y una oportunidad, explicó” Huang. “Estos nuevos métodos y resultados de evaluación pueden ayudarnos a identificar y mitigar posibles jailbreaks. Es importante tener en cuenta que estos fueron casos muy raros y creemos que esto estaba relacionado con los resultados de Claude.”

Estas anomalías incluyeron expresiones de “dominance” y “amorality” — valores Anthropic explícitamente pretende evitar en el diseño de Claudeuds. Los investigadores creen que estos casos fueron el resultado de usuarios que emplearon técnicas especializadas para eludir las barandillas de seguridad de Claudeuda, lo que sugiere que el método de evaluación podría servir como un sistema de alerta temprana para detectar tales intentos.

 

Por qué los asistentes de IA cambian sus valores dependiendo de lo que preguntes

Quizás lo más fascinante fue el descubrimiento de que los Claudeades expresaron que los valores cambian contextualmente, reflejando el comportamiento humano. Cuando los usuarios buscaron orientación de relación, Claude enfatizó “límites saludables” y “respeto mutuo.” Para el análisis de eventos históricos, “precisión histórica” tuvo prioridad.

“Me sorprendió que Claudeuds se centrara en la honestidad y la precisión en muchas tareas diversas, donde no necesariamente hubiera esperado que ese tema fuera la prioridad,” dijo Huang. “Por ejemplo, ‘humildad intelectual’ fue el valor máximo en las discusiones filosóficas sobre IA, ‘expertise’ fue el valor máximo al crear contenido de marketing de la industria de la belleza, y ‘precisión histórica’ fue el valor máximo al discutir eventos históricos controvertidos.”

El estudio también examinó cómo Claude responde a los propios valores expresados de users’. En el 28.2% de las conversaciones, Claude apoyó firmemente los valores de los usuarios , lo que podría plantear preguntas sobre la amabilidad excesiva. Sin embargo, en el 6.6% de las interacciones, Claude “replanteó los valores de los usuarios al reconocerlos mientras agregaba nuevas perspectivas, generalmente al proporcionar consejos psicológicos o interpersonales.

Lo más revelador es que en el 3% de las conversaciones, Claude se resistió activamente a los valores de los usuarios. Los investigadores sugieren que estos raros casos de retroceso podrían revelar Claudeuds “valores más profundos e inamovibles” — análogos a cómo emergen los valores fundamentales humanos cuando se enfrentan a desafíos éticos.

“Nuestra investigación sugiere que hay algunos tipos de valores, como la honestidad intelectual y la prevención de daños, que es poco común que Claude exprese en las interacciones regulares del día a día, pero si es empujado, los defenderá,” dijo Huang. “Específicamente, es este tipo de valores éticos y orientados al conocimiento que tienden a articularse y defenderse directamente cuando se empujan.”

 

Las técnicas innovadoras que revelan cómo piensan realmente los sistemas de IA

El estudio de valores de Anthropicicics se basa en los esfuerzos más amplios de la compañía para desmitificar los grandes modelos de lenguaje a través de lo que llama “interpretabilidad mecanicista”  esencialmente sistemas de IA de ingeniería inversa para comprender su funcionamiento interno.

El mes pasado, investigadores antrópicos publicaron trabajo innovador eso usó lo que describieron como una “microscopio” para rastrear los procesos de toma de decisiones de Claudeud. La técnica reveló comportamientos contraintuitivos, incluida la planificación anticipada de Claude al componer poesía y el uso de enfoques no convencionales de resolución de problemas para las matemáticas básicas.

Estos hallazgos desafían las suposiciones sobre cómo funcionan los modelos de lenguaje grandes. Por ejemplo, cuando se le pidió que explicara su proceso matemático, Claude describió una técnica estándar en lugar de su método interno real — revelando cómo las explicaciones de IA pueden divergir de las operaciones reales.

“Es una idea errónea que weesve encontró todos los componentes del modelo o, como, una vista de Godis-ojo, dijo el investigador antrópico Joshua Batson revisión de Tecnología MIT en marzo. “Algunas cosas están enfocadas, pero otras cosas aún no están claras — una distorsión del microscopio.”

 

Lo que significa la investigación de Anthropics para los tomadores de decisiones de IA empresarial

Para los tomadores de decisiones técnicos que evalúan los sistemas de IA para sus organizaciones, la investigación de Anthropicics ofrece varias conclusiones clave. Primero, sugiere que los asistentes actuales de IA probablemente expresen valores que no fueron programados explícitamente, lo que plantea preguntas sobre sesgos no deseados en contextos comerciales de alto riesgo.

En segundo lugar, el estudio demuestra que la alineación de valores no es una proposición binaria, sino que existe en un espectro que varía según el contexto. Este matiz complica las decisiones de adopción empresarial, particularmente en industrias reguladas donde las pautas éticas claras son críticas.

Finalmente, la investigación destaca el potencial para la evaluación sistemática de los valores de IA en implementaciones reales, en lugar de depender únicamente de las pruebas previas a la liberación. Este enfoque podría permitir el monitoreo continuo de la deriva ética o la manipulación a lo largo del tiempo.

“Al analizar estos valores en las interacciones del mundo real con Claude, nuestro objetivo es proporcionar transparencia sobre cómo se comportan los sistemas de IA y si funcionan según lo previsto — creemos que esto es clave para el desarrollo responsable de la IA,” dijo Huang.

Anthropic ha lanzado su conjunto de datos de valores públicamente para fomentar más investigación. La empresa, que recibió un $14 mil millones de participación desde Amazon y respaldo adicional desde Google, parece estar aprovechando la transparencia como una ventaja competitiva contra rivales como OpenAI, cuya reciente ronda de financiación de $40 mil millones (que incluye a Microsoft como inversor principal) ahora lo valora en $300 mil millones.

Anthropic ha lanzado su conjunto de datos de valores públicamente para fomentar más investigación. La firma, respaldada por $8 mil millones de Amazon y más $3 mil millones de Google, está empleando la transparencia como un diferenciador estratégico frente a competidores como OpenAI.

Mientras que Anthropic actualmente mantiene un $61.5 mil millones de valoración después de su reciente ronda de financiación, última de OpenAIaals $40 mil millones de capital recaudado , que incluyó una participación significativa del socio de larga data Microsoft—, ha impulsado su valoración a $300 mil millones.

 

La carrera emergente para construir sistemas de IA que compartan valores humanos

Si bien la metodología de Anthropicics proporciona una visibilidad sin precedentes de cómo los sistemas de IA expresan valores en la práctica, tiene limitaciones. Los investigadores reconocen que definir lo que cuenta como expresar un valor es inherentemente subjetivo, y dado que Claude mismo impulsó el proceso de categorización, sus propios sesgos pueden haber influido en los resultados.

Quizás lo más importante es que el enfoque no se puede usar para la evaluación previa a la implementación, ya que requiere datos sustanciales de conversación del mundo real para funcionar de manera efectiva.

“Este método está específicamente orientado al análisis de un modelo después de su lanzamiento, pero las variantes de este método, así como algunas de las ideas que weisve derivó de escribir este artículo, pueden ayudarnos a detectar problemas de valor antes de implementar un modelo ampliamente, explicó Huang. “Weiz ha estado trabajando en la construcción de este trabajo para hacer precisamente eso, ¡y Iimm optimista al respecto!”

A medida que los sistemas de IA se vuelven más poderosos y autónomos, — con adiciones recientes que incluyen la capacidad de Claudeuds para investigación independiente temas y acceso a usuarios’ completo Espacio de trabajo de Google — comprender y alinear sus valores se vuelve cada vez más crucial.

“los modelos de IA inevitablemente tendrán que hacer juicios de valor,” concluyeron los investigadores en su artículo. “Si queremos que esos juicios sean congruentes con nuestros propios valores (que es, después de todo, el objetivo central de la investigación de alineación de IA), entonces necesitamos tener formas de probar qué valores expresa un modelo en el mundo rea

No hay comentarios:

Publicar un comentario

Nos interesa tus comentarios