Antrópico, la compañía de IA fundada por ex empleados de OpenAI, ha retirado el telón de un análisis sin precedentes de cómo su asistente de IA Claude expresa valores durante conversaciones reales con los usuarios. La investigación, publicada hoy, revela una alineación tranquilizadora con los objetivos de la compañía y casos de vanguardia que podrían ayudar a identificar vulnerabilidades en las medidas de seguridad de IA.
El estudio examinó 700,000 conversaciones
anónimas, encontrando que Claude defiende en gran medida a los compañeros “útil,
honesto, inofensivo” framework mientras adapta sus valores a diferentes
contextos desde consejos de relación
hasta análisis histórico. Esto representa uno de los intentos más ambiciosos
para evaluar empíricamente si un comportamiento de sistematización de IA en la
naturaleza coincide con su diseño previsto.
“Nuestra esperanza es que esta investigación aliente a
otros laboratorios de IA a realizar una investigación similar en sus valores de
models’,” dijo Saffron Huang, miembro del equipo de Anthropicicss Societal
Impacts que trabajó en el estudio, en una entrevista con VentureBeat. “Medir
los valores de un sistema de IA es fundamental para alinear la investigación y
la comprensión de si un modelo está realmente alineado con su entrenamiento
Dentro de
la primera taxonomía moral integral de un asistente de IA
El equipo de investigación desarrolló un nuevo método de
evaluación para categorizar sistemáticamente los valores expresados en
conversaciones reales de Claude. Después de filtrar el contenido subjetivo,
analizaron más de 308,000 interacciones, creando lo que describen como “la
primera taxonomía empírica a gran escala de los valores de IA
La taxonomía organizó los valores en cinco categorías
principales: Práctico, Epistémico, Social, Protector y Personal. En el nivel
más granular, el sistema identificó 3.307 valores únicos desde virtudes
cotidianas como el profesionalismo hasta conceptos éticos complejos como el
pluralismo moral.
“Me sorprendió la enorme y diversa gama de valores con
los que terminamos, más de 3,000, desde ‘autosuficiencia’ hasta ‘pensamiento
estratégico’ y ‘piedad filial,'” Huang le dijo a VentureBeat. “Fue
sorprendentemente interesante pasar mucho tiempo pensando en todos estos
valores, y construyendo una taxonomía para organizarlos en relación entre sí —
Siento que me enseñó algo sobre los sistemas de valores humanos, too.”
La investigación llega en un momento crítico para
Anthropic, que recientemente lanzó “Max Claude,” un nivel de suscripción
mensual premium de $200 destinado a competir con la oferta similar de
OpenAIays. La compañía también ha ampliado las capacidades de Claudeuds para
incluir Espacio de trabajo de Google funciones de integración e
investigación autónoma, posicionándola como “un verdadero colaborador virtual”
para usuarios empresariales, según anuncios recientes.
Cómo
Claude sigue su entrenamiento y dónde las salvaguardas de IA pueden fallar
El estudio encontró que Claude generalmente se adhiere a
las aspiraciones prosociales de Anthropicic, enfatizando valores como
“habilitación de usuario,” “humildad epistémica,” y “bienestar del paciente” a
través de diversas interacciones. Sin embargo, los investigadores también
descubrieron casos preocupantes en los que Claude expresó valores contrarios a
su entrenamiento.
“En general, creo que vemos este hallazgo como datos
útiles y una oportunidad, explicó” Huang. “Estos nuevos métodos y resultados de
evaluación pueden ayudarnos a identificar y mitigar posibles jailbreaks. Es
importante tener en cuenta que estos fueron casos muy raros y creemos que esto
estaba relacionado con los resultados de Claude.”
Estas anomalías incluyeron expresiones de “dominance” y
“amorality” — valores Anthropic explícitamente pretende evitar en el diseño de
Claudeuds. Los investigadores creen que estos casos fueron el resultado de
usuarios que emplearon técnicas especializadas para eludir las barandillas de
seguridad de Claudeuda, lo que sugiere que el método de evaluación podría
servir como un sistema de alerta temprana para detectar tales intentos.
Por qué
los asistentes de IA cambian sus valores dependiendo de lo que preguntes
Quizás lo más fascinante fue el descubrimiento de que los
Claudeades expresaron que los valores cambian contextualmente, reflejando el
comportamiento humano. Cuando los usuarios buscaron orientación de relación,
Claude enfatizó “límites saludables” y “respeto mutuo.” Para el análisis de
eventos históricos, “precisión histórica” tuvo prioridad.
“Me sorprendió que Claudeuds se centrara en la honestidad
y la precisión en muchas tareas diversas, donde no necesariamente hubiera
esperado que ese tema fuera la prioridad,” dijo Huang. “Por ejemplo, ‘humildad
intelectual’ fue el valor máximo en las discusiones filosóficas sobre IA,
‘expertise’ fue el valor máximo al crear contenido de marketing de la industria
de la belleza, y ‘precisión histórica’ fue el valor máximo al discutir eventos
históricos controvertidos.”
El estudio también examinó cómo Claude responde a los
propios valores expresados de users’. En el 28.2% de las conversaciones, Claude
apoyó firmemente los valores de los usuarios , lo que podría plantear preguntas
sobre la amabilidad excesiva. Sin embargo, en el 6.6% de las interacciones,
Claude “replanteó los valores de los usuarios al reconocerlos mientras agregaba
nuevas perspectivas, generalmente al proporcionar consejos psicológicos o
interpersonales.
Lo más revelador es que en el 3% de las conversaciones,
Claude se resistió activamente a los valores de los usuarios. Los
investigadores sugieren que estos raros casos de retroceso podrían revelar
Claudeuds “valores más profundos e inamovibles” — análogos a cómo emergen los
valores fundamentales humanos cuando se enfrentan a desafíos éticos.
“Nuestra investigación sugiere que hay algunos tipos de
valores, como la honestidad intelectual y la prevención de daños, que es poco
común que Claude exprese en las interacciones regulares del día a día, pero si
es empujado, los defenderá,” dijo Huang. “Específicamente, es este tipo de
valores éticos y orientados al conocimiento que tienden a articularse y
defenderse directamente cuando se empujan.”
Las
técnicas innovadoras que revelan cómo piensan realmente los sistemas de IA
El estudio de valores de Anthropicicics se basa en los
esfuerzos más amplios de la compañía para desmitificar los grandes modelos de
lenguaje a través de lo que llama “interpretabilidad mecanicista” esencialmente sistemas de IA de ingeniería
inversa para comprender su funcionamiento interno.
El mes pasado, investigadores antrópicos publicaron trabajo
innovador eso usó lo que describieron como una “microscopio” para rastrear
los procesos de toma de decisiones de Claudeud. La técnica reveló
comportamientos contraintuitivos, incluida la planificación anticipada de
Claude al componer poesía y el uso de enfoques no convencionales de resolución
de problemas para las matemáticas básicas.
Estos hallazgos desafían las suposiciones sobre cómo
funcionan los modelos de lenguaje grandes. Por ejemplo, cuando se le pidió que
explicara su proceso matemático, Claude describió una técnica estándar en lugar
de su método interno real — revelando cómo las explicaciones de IA pueden
divergir de las operaciones reales.
“Es una idea errónea que weesve encontró todos los
componentes del modelo o, como, una vista de Godis-ojo, dijo el investigador
antrópico Joshua Batson revisión de Tecnología MIT en marzo. “Algunas
cosas están enfocadas, pero otras cosas aún no están claras — una distorsión
del microscopio.”
Lo que
significa la investigación de Anthropics para los tomadores de decisiones de IA
empresarial
Para los tomadores de decisiones técnicos que evalúan los
sistemas de IA para sus organizaciones, la investigación de Anthropicics ofrece
varias conclusiones clave. Primero, sugiere que los asistentes actuales de IA
probablemente expresen valores que no fueron programados explícitamente, lo que
plantea preguntas sobre sesgos no deseados en contextos comerciales de alto
riesgo.
En segundo lugar, el estudio demuestra que la alineación
de valores no es una proposición binaria, sino que existe en un espectro que
varía según el contexto. Este matiz complica las decisiones de adopción
empresarial, particularmente en industrias reguladas donde las pautas éticas
claras son críticas.
Finalmente, la investigación destaca el potencial para la
evaluación sistemática de los valores de IA en implementaciones reales, en
lugar de depender únicamente de las pruebas previas a la liberación. Este
enfoque podría permitir el monitoreo continuo de la deriva ética o la
manipulación a lo largo del tiempo.
“Al analizar estos valores en las interacciones del mundo
real con Claude, nuestro objetivo es proporcionar transparencia sobre cómo se
comportan los sistemas de IA y si funcionan según lo previsto — creemos que
esto es clave para el desarrollo responsable de la IA,” dijo Huang.
Anthropic ha lanzado su conjunto de datos de valores públicamente
para fomentar más investigación. La empresa, que recibió un $14 mil
millones de participación desde Amazon y respaldo adicional desde Google,
parece estar aprovechando la transparencia como una ventaja competitiva contra
rivales como OpenAI, cuya reciente ronda de financiación de $40 mil millones
(que incluye a Microsoft como inversor principal) ahora lo valora en $300 mil
millones.
Anthropic ha lanzado su conjunto de datos de valores públicamente
para fomentar más investigación. La firma, respaldada por $8 mil millones
de Amazon y más $3 mil millones de Google, está empleando la
transparencia como un diferenciador estratégico frente a competidores como
OpenAI.
Mientras que Anthropic actualmente mantiene un $61.5
mil millones de valoración después de su reciente ronda de financiación,
última de OpenAIaals $40 mil millones de capital recaudado , que
incluyó una participación significativa del socio de larga data Microsoft—, ha
impulsado su valoración a $300 mil millones.
La
carrera emergente para construir sistemas de IA que compartan valores humanos
Si bien la metodología de Anthropicics proporciona una
visibilidad sin precedentes de cómo los sistemas de IA expresan valores en la
práctica, tiene limitaciones. Los investigadores reconocen que definir lo que
cuenta como expresar un valor es inherentemente subjetivo, y dado que Claude
mismo impulsó el proceso de categorización, sus propios sesgos pueden haber
influido en los resultados.
Quizás lo más importante es que el enfoque no se puede
usar para la evaluación previa a la implementación, ya que requiere datos
sustanciales de conversación del mundo real para funcionar de manera efectiva.
“Este método está específicamente orientado al análisis
de un modelo después de su lanzamiento, pero las variantes de este método, así
como algunas de las ideas que weisve derivó de escribir este artículo, pueden
ayudarnos a detectar problemas de valor antes de implementar un modelo
ampliamente, explicó Huang. “Weiz ha estado trabajando en la construcción de
este trabajo para hacer precisamente eso, ¡y Iimm optimista al respecto!”
A medida que los sistemas de IA se vuelven más poderosos
y autónomos, — con adiciones recientes que incluyen la capacidad de Claudeuds
para investigación independiente temas y acceso a usuarios’
completo Espacio de trabajo de Google — comprender y alinear sus
valores se vuelve cada vez más crucial.
“los modelos de IA inevitablemente tendrán que hacer
juicios de valor,” concluyeron los investigadores en su artículo. “Si queremos
que esos juicios sean congruentes con nuestros propios valores (que es, después
de todo, el objetivo central de la investigación de alineación de IA), entonces
necesitamos tener formas de probar qué valores expresa un modelo en el mundo
rea
No hay comentarios:
Publicar un comentario
Nos interesa tus comentarios