Una investigación a gran escala realizada por analistas del Pew Research Center ha arrojado luz sobre la rápida expansión de los modelos generativos en el espacio web. Según los datos obtenidos, aproximadamente el 10% de todas las páginas web existentes llevan rastros de generación automática o de una edición significativa. Sin embargo, el indicador más preocupante se oculta en la dinámica: entre el contenido publicado después del debut de ChatGPT en noviembre de 2022, la proporción de textos sintéticos supera el 33%. Esto significa que uno de cada tres materiales nuevos en internet ha sido creado o sustancialmente reelaborado por una red neuronal.
La metodología de la investigación merece una atención especial. La base del análisis fue una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026 a través del archivo Common Crawl. Para identificar la «huella digital» de la IA, se utilizó un modelo especializado de aprendizaje automático, configurado para buscar patrones lingüísticos característicos de los algoritmos generativos. Este enfoque permite detectar marcadores estadísticamente significativos, pero no constituye una prueba cien por cien fiable de autoría.
El sector comercial, la principal zona afectada
La distribución del contenido de IA por zonas de dominio muestra una clara correlación con los incentivos económicos. El sector comercial lidera con gran ventaja: en la zona .com, los indicios de generación se detectan en una de cada diez páginas (alrededor del 10%). En comparación, en la zona no comercial .org este indicador es dos veces menor: 4,6%. Los recursos educativos y gubernamentales siguen siendo los más «limpios»: en los dominios .edu y .gov, la proporción de contenido sintético apenas alcanza el 1%.
Esta desproporción se explica por la estructura del contenido. Las plataformas comerciales utilizan activamente la IA para automatizar volúmenes de texto rutinarios: descripciones de productos, artículos SEO, materiales de referencia y notas de noticias. Al comienzo de la era de ChatGPT, no se observaba tal brecha entre zonas; la divergencia se intensificó a medida que las tecnologías evolucionaban.
Salvedades metodológicas y perspectivas
Es importante destacar que la investigación no es un recuento exacto, sino más bien una estimación de la autoría probable. Pew no analizó el historial de creación de las páginas ni entrevistó a los autores. Las conclusiones se basan exclusivamente en el análisis lingüístico, que puede presentar márgenes de error. Además, la categoría de contenido «sustancialmente editado» excluye las correcciones menores realizadas con IA.
Ante estos datos, resulta comprensible la decisión de Anthropic de implementar un etiquetado global para el contenido creado por los modelos Claude. En un contexto donde el contenido sintético se convierte en una parte inseparable de la web, la cuestión de la confianza en la información y la transparencia del origen de los textos pasa a un primer plano. El mercado ya se ha enfrentado al problema del «ruido informativo», donde los algoritmos generan contenido para algoritmos, lo que plantea a la industria preguntas fundamentales sobre la calidad y la fiabilidad de los datos.
Mi comentario: La tendencia hacia la sintetización total del contenido conlleva riesgos ocultos no solo para los lectores, sino también para los propios motores de búsqueda y los modelos de IA que se entrenan con estos datos. Se produce un efecto de «degeneración» de la información, cuando los modelos aprenden de sus propias salidas. En los próximos años, inevitablemente llegaremos a la necesidad de implementar estándares criptográficos de verificación de contenido; de lo contrario, el ecosistema digital corre el riesgo de convertirse en un bucle cerrado de autoengaño.