La escala de penetración de los modelos generativos en el espacio web resultó ser mucho más significativa de lo que se suele pensar. Mi análisis de datos, basado en una muestra de 10 000 páginas en inglés recopiladas en julio de 2026 a través de Common Crawl, muestra que alrededor del 10% de toda la web presenta rastros evidentes de generación sintética. Sin embargo, esta es una temperatura promedio general: difumina la imagen real debido al enorme volumen de contenido obsoleto creado antes de la era de los LLM modernos.
Cambio crítico después de ChatGPT
La clave está en la dinámica. Si filtramos las páginas publicadas después de noviembre de 2022, el momento del lanzamiento de ChatGPT, las cifras se vuelven verdaderamente alarmantes. Más de un tercio de todos los materiales nuevos en la red muestran signos de autoría automática o edición sustancial por parte de redes neuronales. Esto no es solo estadística, es un marcador de una transformación fundamental del panorama informativo, donde los algoritmos se han convertido en las principales fábricas de textos.
Geografía de lo sintético: comercio vs academia
La distribución del contenido de IA por zonas de dominio revela un patrón claro. En la zona .com, la proporción de dichas páginas alcanzó el 10%, el doble que en .org (4,6%). Aún más reveladora es la brecha con los sectores académico y gubernamental: en .edu y .gov este indicador apenas llega al 1%. Es notable que en los inicios de la expansión de ChatGPT estas diferencias eran casi imperceptibles, lo que indica una rápida adaptación de las plataformas comerciales a la automatización de contenido rutinario: descripciones de productos, textos SEO y feeds de noticias.
Prudencia metodológica
Es importante comprender los límites de esta evaluación. El análisis se basa en marcadores lingüísticos que correlacionan estadísticamente con los modelos generativos, no en la verificación del historial de creación de cada página. Se trata de una estimación probabilística, no de un recuento exacto. Además, la categoría incluye tanto materiales completamente generados como aquellos editados sustancialmente por IA, lo que deja espacio para debates sobre la naturaleza de la «coautoría».
Mi comentario: Estas cifras son solo la punta del iceberg. La proporción real de contenido sintético probablemente sea mayor, ya que los modelos son cada vez más sofisticados y sus resultados son más difíciles de distinguir del texto humano. El mercado necesita urgentemente estándares de verificación y etiquetado; de lo contrario, corremos el riesgo de ahogarnos en un flujo de información plausible pero no verificable, donde la confianza en la web como fuente de conocimiento se verá definitivamente socavada.