El panorama digital está cambiando rápidamente, y mis datos más recientes arrojan luz sobre la escala de penetración de los modelos generativos en el contenido web. El análisis de una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026, muestra que alrededor del 10% de todas las páginas web en internet presentan signos evidentes de texto creado o significativamente editado por inteligencia artificial. Sin embargo, esto es solo la punta del iceberg.
Dominio total de la IA en el contenido nuevo
La conclusión clave de mi investigación es el crecimiento explosivo de contenido sintético entre los materiales recientes. Si consideramos solo las páginas publicadas después del lanzamiento de ChatGPT en noviembre de 2022, el panorama cambia radicalmente: se detectan signos de autoría de IA en más de un tercio de dichas páginas. Esto significa que los modelos generativos —ChatGPT, Claude, Gemini y sus competidores— se han convertido en la herramienta principal para la producción de textos en una parte significativa de las publicaciones web. Las páginas antiguas, creadas antes de la era de los LLM modernos, diluyen las estadísticas generales, enmascarando la intensidad real del proceso.
Zonas comerciales: el principal campo de pruebas para la IA
La distribución del contenido de IA entre las zonas de dominio muestra un patrón claro. En la zona .com, se detectaron signos de generación en aproximadamente una de cada diez páginas, el doble que en .org (4,6%). Los recursos académicos (.edu) y gubernamentales (.gov) resultaron ser los más resistentes: allí la proporción de contenido sintético es solo de alrededor del 1%. Esta desproporción es explicable: las plataformas comerciales utilizan activamente la IA para automatizar tareas rutinarias, desde descripciones de productos hasta artículos SEO y notas de noticias, donde la velocidad y el volumen son más importantes que la unicidad de la voz del autor. Al inicio de la expansión de ChatGPT, estas diferencias eran menos pronunciadas, lo que indica una adaptación acelerada de la tecnología precisamente en el sector comercial.
Importantes salvedades metodológicas
Cabe destacar que mi análisis no es una verificación total del historial de creación de cada página. Utilicé un modelo de aprendizaje automático que identifica patrones lingüísticos estadísticamente significativos, característicos de las redes generativas. Por lo tanto, los resultados son una estimación de la autoría probable, no un recuento exacto. Además, la categoría de contenido «escrito o significativamente editado» por IA excluye los casos de corrección menor del texto por una red neuronal, lo que significa que la influencia real de la IA podría ser incluso más amplia de lo que muestran las cifras.
Comentario experto: El aumento de la proporción de contenido sintético no es solo una curiosidad estadística, sino un cambio fundamental en la economía de la atención. El mercado ya se enfrenta a la devaluación de las estrategias SEO tradicionales y a la depreciación del ruido informativo. En los próximos años, el activo clave no será el volumen, sino la calidad verificable y la confianza de la audiencia, lo que inevitablemente conducirá a requisitos más estrictos de transparencia sobre el origen del contenido. Inversores y analistas deberían seguir de cerca el desarrollo de sistemas de etiquetado, como el que ya está implementando Anthropic para sus modelos Claude.