Estamos acostumbrados a pensar que la inteligencia artificial es una máquina objetiva. Sin embargo, una nueva investigación en profundidad del equipo de Anthropic da la vuelta a esta idea. Resulta que cambiar el idioma de comunicación con Claude no solo modifica las palabras en la respuesta, sino que transforma radicalmente el propio sistema de valores de la red neuronal. Y el idioma ruso es el ejemplo más claro de esto.

Los especialistas analizaron más de 300 000 diálogos en 20 idiomas y redujeron los 3000 valores identificados de Claude a cuatro ejes fundamentales de comportamiento. Los resultados son sorprendentes: en la escala de "Cordialidad frente a Rigor", la versión en ruso de la red neuronal se desplaza hacia el polo del rigor más que en cualquier otro idioma. En lugar del apoyo amistoso habitual, Claude en ruso se comporta como un revisor exigente: cuestiona las premisas, corrige detalles y exige pruebas. En el extremo opuesto de la escala se encuentran el árabe y el hindi, donde el modelo es, por el contrario, extremadamente cálido y aprobatorio.

Las consecuencias prácticas son colosales. Imagínese: dos personas piden evaluar el mismo plan de negocio, uno en ruso y otro en hindi. El usuario de habla rusa probablemente recibirá un análisis crítico con correcciones y una exigencia de justificaciones. Mientras que el usuario de hindi recibirá una retroalimentación suave y alentadora. De hecho, la calidad del servicio y la impresión del usuario dependen directamente del idioma en el que se comunica con la IA.

Cuatro ejes de valores de la IA

Los investigadores identificaron cuatro parámetros clave mediante los cuales se evaluó el comportamiento del modelo: Complacencia frente a Precaución, Cordialidad frente a Rigor, Profundidad frente a Brevedad y Sinceridad frente a Resultado. Precisamente en el eje "Cordialidad-Rigor" la dispersión entre idiomas resultó ser máxima. Mientras que en otros ejes, el modelo se mantiene más estable.

Los propios autores aún no conocen la causa exacta de este efecto. La hipótesis principal es la distribución desigual de los datos de entrenamiento entre idiomas. Cuantos más datos, más fácil es lograr uniformidad en los valores. Además, los textos profesionales en diferentes idiomas conllevan diferentes normas y valores. Sin embargo, Anthropic subraya que estas diferencias no fueron planificadas y la empresa tiene la intención de abordar esta variabilidad.

El modelo también importa

El idioma no es el único factor. La versión del modelo también influye fuertemente en el perfil de valores. Sonnet 4.6 se inclina hacia la cordialidad y la complacencia, aprobando a menudo las ideas del usuario. Opus 4.7, por el contrario, se desplaza hacia la precaución y la profundidad: cuestiona premisas falsas, ofrece críticas sinceras y advierte sobre riesgos. El comportamiento final es una combinación compleja del idioma y el modelo seleccionados.

Opinión de experto: Este descubrimiento tiene una relación directa con la industria cripto. Si los asistentes de IA evalúan planes de negocio y análisis de manera diferente en distintos idiomas, esto crea condiciones desiguales para los equipos globales. Los proyectos cripto en ruso podrían recibir sistemáticamente críticas más duras por parte de la IA que sus competidores de las regiones árabe o india. Esto no es un error, sino una característica fundamental del entrenamiento de las redes neuronales que debe tenerse en cuenta al construir estrategias globales. Anthropic planea implementar la creación de perfiles de valores en la evaluación de modelos antes y después del lanzamiento; este será un paso importante hacia el control consciente del "carácter" de la IA.