La escala de penetración de las redes neuronales generativas en el contenido web resultó ser mucho más profunda de lo que se suele pensar. Mi análisis de datos recientes muestra: aproximadamente el 10% de todas las páginas web existentes presentan rastros evidentes de generación sintética o edición significativa por algoritmos. Sin embargo, el indicador más alarmante es que, entre los materiales publicados después del debut de ChatGPT, la proporción de dicho contenido supera un tercio.
Metodología y cifras clave
Durante el estudio se analizó una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026 a través del archivo Common Crawl. Para la identificación se utilizó un modelo de aprendizaje automático configurado para buscar patrones lingüísticos específicos característicos de los LLM modernos.
El hecho de que en el conjunto general solo una de cada diez páginas tenga indicios de IA puede resultar engañoso. Esto se explica porque en la muestra se incluyó una gran cantidad de contenido "legacy", creado antes de la era de la IA generativa. Si filtramos la capa histórica y nos centramos exclusivamente en las publicaciones posteriores a noviembre de 2022, el panorama cambia radicalmente: más del 33% de las páginas nuevas han sido creadas o editadas de alguna manera por redes neuronales.
Dónde se siente cómoda la IA
La distribución de contenido sintético entre las zonas de dominio es extremadamente desigual, y esto dice mucho. En la zona .com, se detectaron indicios de IA en aproximadamente una de cada diez páginas. En comparación, en .org este indicador es del 4,6%, y en los dominios académicos (.edu) y gubernamentales (.gov), alrededor del 1%.
Esta desproporción es lógica. El sector comercial históricamente depende de grandes volúmenes de contenido: descripciones de productos, textos SEO, feeds de noticias. Estos formatos son los más fáciles de automatizar, que es lo que observamos en la práctica. Al comienzo del auge de ChatGPT, la brecha entre zonas era menos pronunciada, lo que indica una comercialización acelerada del contenido sintético.
Importantes salvedades
Cabe destacar que el estudio no es un "detector de mentiras" para cada página específica. La metodología evalúa la probabilidad, no el hecho exacto del uso de IA. Se trata de textos donde la proporción de intervención automática es significativa; una pequeña corrección o revisión por una red neuronal probablemente haya quedado fuera del alcance.
Mi comentario: Estas cifras son solo la punta del iceberg. Según mis estimaciones, hasta la fecha la proporción de contenido sintético en el contenido nuevo ya ha superado el 50%, especialmente en agregadores de noticias y blogs de nicho. Nos dirigimos hacia un punto de no retorno donde los algoritmos de búsqueda y los sistemas de recomendación se verán obligados a reconsiderar por completo los criterios de clasificación, o simplemente se ahogarán en el flujo de ruido generado. La cuestión no es si internet será sintético, sino cómo aprenderemos a separar el grano de la paja.