La escala de penetración de las redes neuronales generativas en el espacio web resultó ser mucho más significativa de lo que se suele pensar. Mi análisis de datos recientes muestra: aproximadamente una de cada diez páginas web en internet lleva rastros evidentes de generación automática o edición profunda. Sin embargo, esto es solo la punta del iceberg: si consideramos únicamente el contenido publicado después del debut de ChatGPT en noviembre de 2022, el panorama se vuelve verdaderamente alarmante: más del 33% de esas páginas ya muestran signos de origen sintético.

Metodología y escala del fenómeno

La base de estas conclusiones es el análisis de una muestra representativa de 10 000 páginas en inglés, recopiladas en julio de 2026. Para la identificación se utilizó un modelo de aprendizaje automático configurado para detectar patrones lingüísticos específicos característicos de los LLM modernos. Es importante entender: en las estadísticas generales también se incluyó la "web antigua", creada mucho antes de la era de la IA generativa, lo que explica el relativamente modesto 10% en cifras absolutas.

La dinámica es evidente: el aumento de la proporción de contenido sintético se correlaciona directamente con la expansión de ChatGPT, Claude, Gemini y sus similares. Cuanto más se implementan estas herramientas, más contenido producen.

¿Dónde se siente cómoda la IA?

La distribución del texto automático por zonas de dominio es extremadamente desigual y reveladora. Lidera el sector comercial (.com), con alrededor del 10% de las páginas. Esto es el doble que en la zona no comercial .org (4,6%). En cambio, los recursos educativos (.edu) y gubernamentales (.gov) muestran una "pureza" casi total: solo alrededor del 1% de contenido sintético.

Esta polarización es explicable: la web comercial está orientada a volúmenes y SEO. Descripciones de productos, artículos de referencia, feeds de noticias: todo esto es un terreno ideal para la automatización. Mientras que los ámbitos académico y gubernamental exigen estándares más altos de autoría y verificación, lo que frena el uso indiscriminado de redes neuronales.

Importantes salvedades

Cabe destacar: no se trata de un recuento exacto, sino de una estimación probabilística. La metodología no implica verificar el historial de ediciones ni encuestar a los autores. El análisis se basa en marcadores lingüísticos estadísticos que pueden ser tanto un indicio claro de generación como el resultado de una estilización. Además, en la categoría de "escrito o editado sustancialmente" no se incluye la corrección ligera del texto por parte de humanos.

Mi comentario: Estamos al borde de un cambio fundamental. La web se está transformando rápidamente en un entorno donde el contenido sintético se convierte en la norma, no en la excepción. Esto pone en tela de juicio no solo la fiabilidad de la información, sino también la propia economía del contenido: los algoritmos de búsqueda y las redes publicitarias ya no logran filtrar la basura. Iniciativas de etiquetado, como la que implementó Anthropic, son solo un primer paso tímido. Sin estándares globales de verificación e identificación, corremos el riesgo de ahogarnos en un mar de información verosímil pero sin sentido, donde la voz humana será finalmente silenciada por las máquinas.