La escala de penetración de los modelos generativos en el contenido web resultó ser mucho más grave de lo que se suele pensar. Mi análisis de los datos recientes del Pew Research Center muestra: aproximadamente el 10% de todas las páginas web en internet llevan rastros de texto creado o profundamente editado por inteligencia artificial. Sin embargo, la cifra clave está oculta más profundamente: entre los materiales publicados después del debut de ChatGPT, la proporción de contenido sintético supera un tercio.

La IA captura nuevas páginas

Los investigadores examinaron una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026 a través de Common Crawl. Para identificar la autoría se utilizó un modelo de aprendizaje automático entrenado para detectar patrones lingüísticos característicos de las redes neuronales generativas. A primera vista, el 10% es un indicador modesto, pero incluye una enorme capa de contenido histórico creado antes de la era de los LLM modernos.

Cuando filtro los artefactos antiguos y me centro solo en las páginas aparecidas después de noviembre de 2022, el panorama cambia radicalmente. Más de un tercio de esas páginas muestran signos evidentes de generación por IA. Esto confirma: el crecimiento del contenido sintético se correlaciona directamente con la expansión de ChatGPT, Claude, Gemini y sus competidores.

El sector comercial: el principal campo de batalla de la IA

La distribución del contenido de IA entre las zonas de dominio es extremadamente desigual y refleja incentivos económicos. En 2026, una de cada diez páginas en la zona .com lleva rastros de redes neuronales, el doble que en .org (4,6%). En los recursos educativos (.edu) y gubernamentales (.gov), la proporción cae al 1%, diez veces menos que en el sector comercial. La brecha se explica simplemente: los sitios empresariales publican masivamente descripciones de productos, artículos SEO y noticias que son fáciles de automatizar. Al inicio de la era de ChatGPT, estas diferencias estaban suavizadas, pero ahora el mercado se ha segmentado claramente.

Matices metodológicos

Es importante destacar: Pew no verificó el historial de creación de cada página ni entrevistó a los autores. El análisis se basa en marcadores lingüísticos estadísticos que se correlacionan con la generación por IA. Por lo tanto, los resultados deben interpretarse como una estimación de la autoría probable, no como un recuento exacto. Además, se trata de contenido "escrito o sustancialmente editado": las pequeñas correcciones hechas por redes neuronales no entran en esta categoría.

Es revelador que Anthropic ya en agosto introdujo un etiquetado global del contenido de Claude, lo que solo confirma la sistematicidad del problema.

Mi conclusión: estas cifras no son solo estadística, sino una señal de un cambio tectónico en la producción de información. El mercado avanza rápidamente hacia un contenido híbrido, donde la frontera entre la autoría humana y la máquina se difumina. Para inversores y analistas, esto implica la necesidad de revisar la evaluación de la calidad de los activos web y los riesgos de desinformación en los próximos años.