La escala de penetración de los modelos generativos en el espacio web resultó ser mucho más grave de lo que se suele pensar. Mi análisis de datos recientes muestra: aproximadamente una de cada diez páginas web en internet presenta signos evidentes de generación automática o de una edición sustancial. Sin embargo, si observamos el contenido publicado después del debut de ChatGPT en noviembre de 2022, el panorama cambia radicalmente: más de un tercio de estas páginas tienen un origen sintético.

Metodología y escala del fenómeno

Durante el estudio se analizó una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026 a través del archivo Common Crawl. Para la identificación se utilizó un modelo de aprendizaje automático configurado para buscar patrones lingüísticos característicos de las redes neuronales generativas. El índice general del 10% puede parecer modesto, pero se diluye debido a la enorme capa de contenido obsoleto creado mucho antes de la era de los LLM modernos.

Cuando descartamos la web "prehistórica" y nos centramos exclusivamente en las publicaciones aparecidas después del lanzamiento de ChatGPT, vemos una rápida expansión de la IA. Un tercio de las páginas nuevas no es un nicho marginal, sino una tendencia sistémica que solo se intensificará a medida que Claude, Gemini y otros modelos se integren en los flujos de trabajo cotidianos.

El sector comercial, el principal impulsor

La distribución de contenido sintético por zonas de dominio subraya el trasfondo económico del fenómeno. En la zona .com, los signos de generación por IA se detectan en una de cada diez páginas, el doble que en la zona no comercial .org (4,6%). Aún más reveladora es la brecha con los dominios educativos y gubernamentales (.edu y .gov), donde la proporción apenas alcanza el 1%.

Esta desproporción es lógica: las plataformas comerciales automatizan activamente la creación de descripciones de productos, textos SEO y fuentes de noticias. Son formatos voluminosos y plantillados donde la velocidad y el ahorro de recursos importan más que una perspectiva autoral única. Al comienzo del auge de ChatGPT, estas diferencias estaban suavizadas, pero ahora el mercado se ha segmentado claramente.

Importantes salvedades metodológicas

Cabe destacar que no se trata de un recuento exacto de lo "escrito por un robot", sino de una estimación probabilística. Los investigadores no verificaron el historial de ediciones ni entrevistaron a los autores. El análisis se basó en marcadores lingüísticos estadísticos que también pueden estar presentes en un texto escrito por humanos pero sometido a una edición agresiva con IA. Además, los pequeños ajustes realizados con redes neuronales generalmente no entran en esta categoría.

En este contexto, resulta reveladora la reciente decisión de Anthropic sobre el etiquetado global del contenido creado por Claude. La industria comienza a darse cuenta: sin una identificación clara del contenido sintético, corremos el riesgo de perder definitivamente la frontera entre el hecho y el simulacro.

Mi conclusión: no estamos ante una simple tendencia, sino ante un cambio tectónico en la economía del contenido. La web se está transformando rápidamente en un entorno donde la autoría humana se convierte en un producto premium en medio de una masa mecánica barata y sin rostro. La cuestión no es si alguien lo detendrá, sino cómo adaptaremos los algoritmos de búsqueda y confianza a esta nueva realidad.