El panorama digital se transforma rápidamente: mi análisis de datos recientes muestra que aproximadamente el 10% de todas las páginas web en internet presentan claros rastros de generación automática o edición profunda. Sin embargo, una cifra mucho más alarmante se esconde en la dinámica: entre los materiales publicados después del debut de ChatGPT, la proporción de contenido sintético supera el 33%.
La escala de la expansión: del 10% a un tercio
Durante el estudio se analizó una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026 a través del archivo Common Crawl. Para la identificación se utilizó un modelo de aprendizaje automático configurado para buscar patrones lingüísticos característicos de las redes neuronales generativas. A primera vista, el 10% es un indicador moderado, pero incluye una enorme capa de contenido "prehistórico" creado antes de la era de los LLM avanzados.
Si filtramos ese contenido heredado y nos centramos exclusivamente en las publicaciones aparecidas después de noviembre de 2022, el panorama cambia radicalmente. Más de un tercio de esas páginas muestran una alta probabilidad de autoría de IA. Esto es una prueba directa de que los modelos generativos se han convertido en la principal herramienta de producción de textos para una parte significativa de la web.
Geografía de la síntesis: el comercio lidera
La distribución del contenido de IA entre las zonas de dominio es extremadamente desigual, lo que indica un uso pragmático de la tecnología. En la zona .com, los signos de generación se detectan en aproximadamente una de cada diez páginas. En comparación, en la zona no comercial .org, este indicador es dos veces menor: 4,6%. Los recursos educativos (.edu) y gubernamentales (.gov) siguen siendo los más "limpios", donde la proporción de contenido sintético apenas alcanza el 1%.
Esta diferenciación es explicable: las plataformas comerciales automatizan activamente la creación de textos SEO, fichas de productos y fuentes de noticias. Al inicio de la expansión de ChatGPT, la brecha entre zonas era mínima, pero ahora el mercado se ha segmentado claramente según el grado de adopción de la IA.
Prudencia metodológica
Es importante comprender las limitaciones de esta evaluación. El estudio no verifica el historial de ediciones de cada página ni entrevista a los autores. Las conclusiones se basan en un análisis estadístico de marcadores lingüísticos que se correlacionan con la generación por IA. Se trata de una estimación probabilística, no de un recuento exacto. Además, la categoría de contenido "significativamente editado" excluye la corrección ligera, lo que hace que las estimaciones sean incluso algo conservadoras.
Mi comentario: El mercado ya ha pasado el punto de no retorno. No estamos observando una simple tendencia, sino un cambio fundamental en la economía del contenido. Sin embargo, la carrera por el volumen mediante la IA crea el riesgo de devaluación de la información y el aumento del "ruido digital". En los próximos años, el activo clave no será la velocidad de generación, sino la confianza en la fuente y la calidad de la verificación de datos. Los actores que logren construir procesos editoriales híbridos, donde la IA potencie, y no reemplace, el análisis, obtendrán una ventaja decisiva.