El espacio digital está cambiando rápidamente y, según los últimos datos, la humanidad ha cedido a las máquinas una parte significativa de la «cocina creativa» en internet. Mi análisis de las estadísticas más recientes muestra que alrededor del 10% de todas las páginas web en la red global llevan una clara huella de los modelos generativos. Sin embargo, el indicador más preocupante reside en la dinámica: si consideramos solo el contenido publicado después de noviembre de 2022, es decir, tras el debut de ChatGPT, la proporción de textos sintéticos supera un tercio.
Durante la investigación se analizó una muestra representativa de 10 000 páginas en inglés, recopiladas en julio de 2026. Para identificar la «huella digital» se utilizó un modelo de aprendizaje automático configurado para buscar patrones lingüísticos específicos característicos de la generación por IA. El hecho de que en las estadísticas generales se incluyan archivos creados mucho antes de la era de las redes neuronales modernas solo subraya la magnitud de la expansión actual.
El sector comercial, la principal zona afectada
La distribución de contenido sintético por dominios es extremadamente reveladora. Mientras que en la zona .com se detectan indicios de IA en aproximadamente una de cada diez páginas, en el segmento sin ánimo de lucro .org esta cifra cae al 4,6%. Un contraste aún más marcado lo muestran los recursos educativos y gubernamentales (.edu y .gov), donde la proporción de dicho contenido apenas alcanza el 1%.
Esta desproporción tiene explicación: las plataformas comerciales dependen con mayor frecuencia de grandes volúmenes de contenido textual rutinario —descripciones de productos, artículos SEO y feeds de noticias— que son extremadamente fáciles de automatizar. Al inicio de la expansión de ChatGPT, la brecha entre zonas no era tan crítica, lo que indica una comercialización acelerada de las herramientas de IA.
Salvedad metodológica: precisión frente a probabilidad
Es importante entender que esta investigación no es un «detector de mentiras» para cada texto individual. La metodología se basa en el análisis estadístico de construcciones lingüísticas, no en la verificación del historial de ediciones del documento. Por lo tanto, es más correcto hablar de «autoría probable» que de un hecho demostrado. Además, una edición menor del texto por una red neuronal probablemente haya quedado fuera de la muestra: se trata específicamente de material completamente generado o radicalmente reelaborado.
Mi comentario: No estamos observando una simple tendencia, sino un cambio tectónico en la economía del contenido. El hecho de que un tercio del nuevo internet se cree sin participación humana directa pone en tela de juicio no solo los derechos de autor y la optimización SEO, sino también el propio concepto de «ruido informativo». En los próximos años tendremos que desarrollar nuevos mecanismos de validación de datos; de lo contrario, la confianza en la web como fuente de conocimiento quedará definitivamente socavada.