La IA está conquistando internet: más de un tercio de las nuevas páginas web son creadas por redes neuronales

La magnitud de la penetración de los modelos generativos en el contenido web resultó ser mucho más grave de lo que se suele pensar. Mi análisis de los datos recientes muestra: aproximadamente el 10% de todas las páginas web existentes en internet presentan rastros evidentes de generación automática o edición profunda. Sin embargo, si observamos el contenido creado después del debut de ChatGPT en noviembre de 2022, el panorama cambia radicalmente: más de un tercio de estas páginas muestran signos de origen sintético.
Metodología y cifras clave
Durante la investigación se analizó una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026 a través del archivo Common Crawl. Para la identificación se utilizó un modelo de aprendizaje automático configurado para buscar patrones lingüísticos característicos propios de los algoritmos generativos. Es importante entender: la muestra incluía una capa significativa de la web "antigua", creada antes de la era de los LLM modernos, lo que explica el relativamente modesto 10% en la masa total.
Pero si filtramos las páginas obsoletas y nos centramos exclusivamente en las publicaciones aparecidas después del lanzamiento de ChatGPT, la proporción de contenido sintético se dispara al 33% o más. Esto es una evidencia directa de que la difusión de Claude, Gemini y otros modelos no solo acelera la producción de contenido, sino que transforma fundamentalmente su estructura.
El sector comercial: el principal impulsor
La distribución del contenido de IA entre las zonas de dominio es extremadamente desigual. En la zona .com, se detectaron signos de generación en aproximadamente una de cada diez páginas, el doble que en .org (4,6%). En los recursos académicos y gubernamentales (.edu y .gov), la proporción cae al 1%, diez veces menos. Esta desproporción se explica simplemente: las plataformas comerciales automatizan masivamente textos rutinarios — descripciones de productos, artículos SEO, materiales de referencia y notas de noticias, donde la velocidad de publicación es crítica y la singularidad de la voz autoral no es una prioridad.
Salvedades y realidad
Cabe destacar: el estudio no es un recuento exacto. Se trata de una estimación probabilística basada en marcadores lingüísticos estadísticos, no de una verificación del historial de ediciones. Una pequeña corrección realizada por una red neuronal no entra en la categoría de "escrito por IA", pero una reelaboración profunda sí. Este es un matiz importante que, sin embargo, no anula la conclusión principal: estamos presenciando un cambio tectónico en la producción de contenido web, y sus consecuencias para el SEO, los medios y la confianza de la audiencia aún están por comprenderse.
Mi opinión experta: estas cifras son solo la punta del iceberg. Mientras los algoritmos de detección se basen en patrones lingüísticos, los modelos generativos aprenden rápidamente a enmascararlos. Ya es evidente que, sin la implementación de un marcado criptográfico del origen del contenido (como hace Anthropic con Claude), corremos el riesgo de ahogarnos en un flujo de contenido sintético de calidad pero indistinguible del humano, lo que devaluará el trabajo de los autores vivos y socavará los fundamentos de la higiene informativa.