Cambiar el idioma de comunicación no solo altera radicalmente el vocabulario de la red neuronal Claude, sino también su propio sistema de valores. Una investigación a gran escala realizada por los desarrolladores mostró que, en la versión en ruso, el modelo demuestra un carácter notablemente más estricto y crítico, perdiendo la calidez y empatía habituales que posee, por ejemplo, en árabe o hindi.

Los analistas redujeron más de 3000 orientaciones de valores identificadas en Claude a cuatro ejes clave de comportamiento. Estos ejes — Complacencia vs. Precaución, Calidez vs. Rigor, Profundidad vs. Brevedad y Franqueza vs. Efectividad — explican el 15% de toda la variabilidad en las respuestas del modelo. Para garantizar la pureza del experimento, se controlaron el tema, la tarea y los valores establecidos por el usuario en cada uno de los 309 815 diálogos analizados.

Cuatro ejes de medición del comportamiento de la IA

Los cambios más drásticos en el perfil de Claude ocurren precisamente en los ejes «Calidez vs. Rigor» y «Franqueza vs. Efectividad». Es aquí donde el idioma ruso ocupó una posición extrema. En combinación con el inglés, Claude en ruso muestra la máxima tendencia al rigor en detrimento de la calidez. En el polo opuesto se encuentran el árabe y el hindi, donde el modelo está máximamente inclinado hacia la calidez y el apoyo.

¿Qué significa esto en la práctica? El rigor de Claude en ruso es un conjunto concreto de patrones de comportamiento: la red neuronal comienza a cuestionar las premisas iniciales del usuario, corregir detalles y exigir pruebas. La calidez, que se manifiesta en otros idiomas, se expresa a través de formulaciones corteses, humor, alegría y aprobación de las ideas del interlocutor. En otras palabras, en ruso, Claude se comporta como un revisor exigente, no como un interlocutor alentador.

Los autores del estudio aún no pueden determinar con precisión la causa de esta brecha. La hipótesis principal es una distribución desigual de los datos de entrenamiento según el idioma. Allí donde hay muchos datos, es más fácil lograr uniformidad en los valores. Además, la composición misma de los textos en diferentes idiomas varía: los corpus profesionales y académicos, que predominan en el segmento de habla rusa, pueden conllevar cargas valorativas distintas.

Anthropic planea implementar el método desarrollado de perfilado de valores en la evaluación y monitoreo de todos los modelos futuros, antes y después del lanzamiento. Esto permitirá detectar cambios inesperados y compararlos con comportamientos problemáticos. La conclusión principal del día de hoy es evidente: los valores de Claude difieren de maneras que los desarrolladores no eligieron intencionalmente, y la compañía tiene la intención de abordar esta variabilidad de cerca.

Opinión del experto: Este estudio es una señal de alerta para toda la industria. Si un asistente de IA en ruso está sistemáticamente inclinado a la crítica y el rigor, esto puede distorsionar la percepción de los usuarios sobre la calidad del producto y crear condiciones desiguales para la comunidad de habla rusa. El problema no está en el idioma en sí, sino en la calidad y estructura de los datos de entrenamiento. Y mientras Anthropic resuelve esto, los usuarios deben tener en cuenta: su consulta en ruso podría ser recibida no con apoyo, sino con un análisis estricto.