La escala de penetración de las redes neuronales generativas en el espacio web resultó ser mucho más profunda de lo que se suele pensar. Mi análisis de datos recientes muestra: aproximadamente una de cada diez páginas web en internet lleva rastros de autoría sintética. Sin embargo, si observamos el contenido publicado después del lanzamiento de ChatGPT, la situación parece mucho más radical: más de un tercio de estas páginas muestran signos evidentes de generación o edición significativa por inteligencia artificial.

Metodología y cifras clave

Durante el estudio se analizó una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026. Para la identificación se utilizó un modelo de aprendizaje automático entrenado para detectar patrones lingüísticos característicos de los LLM modernos. A primera vista, el 10% del total es una cifra moderada. Pero no hay que olvidar: en la muestra entró una gran cantidad de la web "antigua", creada mucho antes de la era de la IA generativa.

Si descartamos el legado del pasado y nos centramos exclusivamente en los materiales publicados después de noviembre de 2022, el panorama cambia drásticamente. Se detectan rastros sintéticos en más de un tercio de las páginas nuevas. Esto es una prueba directa de que ChatGPT, Claude, Gemini y sus similares se han convertido en los principales "autores" del contenido moderno.

Quién lidera en generación

La distribución de contenido sintético por zonas de dominio es extremadamente desigual, y esto refleja la lógica económica. En la zona .com, los signos de IA se detectan en una de cada diez páginas (alrededor del 10%), el doble que en .org (4,6%). En cambio, los recursos educativos (.edu) y gubernamentales (.gov) muestran solo alrededor del 1%, diez veces menos.

Esta desproporción se explica por la naturaleza del contenido. El sector comercial inunda la red con textos masivos: descripciones de productos, artículos SEO y notas de noticias. Precisamente estos formatos son los más fáciles de automatizar. Al comienzo del auge de ChatGPT, la brecha entre zonas era menos notable, pero ahora el mercado se ha adaptado plenamente a las capacidades de la IA.

Importantes salvedades

Cabe destacar: el estudio no afirma que cada uno de estos textos haya sido escrito por un bot. La metodología se basa en el análisis estadístico de marcadores lingüísticos, no en la verificación del historial de creación de archivos. Esto es más una estimación de autoría probable que un recuento exacto. Además, la categoría de "escrito o editado" por IA implica un procesamiento significativo, no solo el uso de autocorrección o pequeños ajustes.

Mi comentario: Estos datos son una llamada de atención para el mercado de contenido. Estamos al borde de una inflación del ruido informativo, donde los buscadores y agregadores se ahogan en contenido sintético. La industria necesita nuevos estándares de verificación y etiquetado; de lo contrario, la confianza en la web como fuente de conocimiento se verá definitivamente socavada. Iniciativas como el etiquetado de contenido de Anthropic son solo un primer paso en la dirección correcta, pero la industria tiene un largo camino por recorrer.