La magnitud de la penetración de la inteligencia artificial generativa en el espacio web resultó ser mucho más grave de lo que se suele pensar. Mi análisis de datos recientes muestra: aproximadamente el 10% de todas las páginas web existentes presentan rastros evidentes de generación automática o edición sustancial. Sin embargo, el indicador más alarmante es que, entre el contenido publicado después del debut de ChatGPT, la proporción de textos sintéticos supera un tercio.
Metodología y cifras clave
Durante el estudio se analizó una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026 a través del archivo Common Crawl. Para la identificación se utilizó un modelo de aprendizaje automático que detecta patrones lingüísticos característicos propios de los modelos generativos. El hecho de que en la muestra se incluyera un volumen significativo de contenido "antiguo", creado antes de la era de las redes neuronales modernas, suaviza un poco el panorama general. Si se filtran los materiales obsoletos y se centra exclusivamente en las páginas publicadas después de noviembre de 2022, el panorama cambia radicalmente: se detectan signos de autoría de IA en más del 33% de dichos documentos.
El sector comercial: la principal zona afectada
La distribución del contenido sintético por zonas de dominio es extremadamente desigual. En la zona .com, se registran signos de IA en aproximadamente una de cada diez páginas, lo que duplica las cifras de .org (4,6%). Los recursos educativos (.edu) y gubernamentales (.gov) muestran una presencia mínima, de alrededor del 1%. Esta desproporción es comprensible: las plataformas comerciales utilizan activamente la automatización para generar descripciones de productos, textos SEO y notas de noticias, donde la velocidad importa más que la originalidad.
Advertencias importantes
Cabe destacar: el estudio no afirma que cada texto detectado haya sido escrito por IA desde cero. La metodología se basa en el análisis estadístico de construcciones lingüísticas, no en la verificación del historial de creación del documento. Se trata de una estimación de la autoría probable, no de un recuento exacto. Además, la categoría de contenido "editado sustancialmente" excluye los casos de corrección menor del texto por parte de una red neuronal.
Mi comentario: estas cifras son solo la punta del iceberg. Ya es evidente que nos dirigimos hacia una web donde el contenido sintético se convertirá en la norma, no en la excepción. La cuestión no es cómo detener este proceso, sino cómo construir sistemas de confianza y verificación de la información en las nuevas realidades. El etiquetado de contenido, similar al que Anthropic implementó para Claude, es solo el primer paso en este camino.