La escala de penetración de la inteligencia artificial generativa en el entorno web resultó ser mucho más grave de lo que se suele pensar. Mi análisis de los datos recientes muestra: alrededor del 10% de todas las páginas web existentes presentan claros rastros de autoría sintética. Sin embargo, esto es solo la punta del iceberg: entre el contenido publicado después del debut de ChatGPT, la proporción de textos de IA supera un tercio.
La nueva realidad del panorama digital
Durante una investigación a gran escala, se analizó una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026 a través del archivo Common Crawl. Para la identificación se utilizó un modelo de aprendizaje automático configurado para detectar patrones lingüísticos característicos de las redes neuronales modernas.
La cifra del 10% puede parecer moderada, pero es engañosa. En la muestra entró una enorme capa de contenido heredado, creado mucho antes de la era de los modelos generativos. Si filtramos la capa histórica y nos centramos exclusivamente en los materiales publicados después de noviembre de 2022, el panorama cambia radicalmente: más del 33% de las páginas nuevas muestran signos de generación por IA.
El sector comercial — la principal zona afectada
La distribución de contenido sintético por zonas de dominio es extremadamente desigual y dice mucho. Lidera el segmento comercial .com, donde una de cada diez páginas contiene rastros de IA, el doble que los indicadores de .org (4,6%). Los recursos educativos (.edu) y gubernamentales (.gov) resultaron ser diez veces más limpios, alrededor del 1%.
Esta desproporción es explicable: los sitios comerciales automatizan activamente la producción de descripciones de productos, artículos SEO y notas de noticias. Son formatos voluminosos y plantillados que se prestan perfectamente a la algoritmización. Es notable que en los inicios de la expansión de ChatGPT la brecha entre zonas era mínima; ahora observamos una polarización rápida.
Matices metodológicos y conclusiones
Es importante destacar: la investigación no es un recuento exacto, sino más bien una estimación probabilística. Los autores no verificaron el historial de ediciones ni encuestaron a los webmasters. El análisis se basó en marcadores lingüísticos estadísticos, por lo que parte de las páginas podría haber sido escrita por humanos, pero imitando estilísticamente a la IA, o viceversa, haber pasado por una edición mínima sin caer en la categoría de «sustancialmente modificadas».
Sin embargo, la tendencia es evidente: estamos observando un cambio tectónico en la producción de contenido en internet. Es notable que, en este contexto, Anthropic ya haya introducido el etiquetado obligatorio para sus modelos Claude, un paso que probablemente se convertirá en el estándar de la industria.
Mi comentario: El mercado está al borde de un «colapso inflacionario» del contenido. Cuando un tercio de las páginas nuevas se genera mediante máquinas, el valor de la información textual como tal cae drásticamente, y pasan a primer plano la confianza y la verificación de fuentes. Este es un desafío fundamental para la industria SEO y los medios, que requerirá revisar los propios principios de clasificación y derechos de autor.