El ecosistema digital está mutando rápidamente. Mi análisis de datos recientes muestra que aproximadamente una de cada diez páginas web de acceso público presenta rastros evidentes de IA generativa. Sin embargo, esto es solo la punta del iceberg: si filtramos el contenido «prehistórico», creado antes de la era de los grandes modelos de lenguaje, el panorama se vuelve mucho más alarmante para los autores tradicionales.

Magnitud del fenómeno: del 10% al 34%

Examiné una muestra de 10 000 páginas aleatorias en inglés, recopiladas en julio de 2026. La metodología se basó en aprendizaje automático que detecta patrones lingüísticos característicos de los modelos generativos. Entre todas las páginas, la proporción de «sintéticos» fue de alrededor del 10%. Pero eso es solo un promedio general.

La clave está en otro punto. Si consideramos exclusivamente los materiales publicados después del debut de ChatGPT en noviembre de 2022, los indicios de autoría de IA se detectan en más de un tercio de las páginas. Esto significa que no estamos ante una simple tendencia, sino ante un cambio fundamental en la producción de contenido en internet, que se acelera con cada nuevo modelo, desde Claude hasta Gemini.

Geografía de lo sintético: el comercio lidera

La distribución del contenido de IA entre los dominios es extremadamente desigual, y es lógico. En la zona .com, los rastros de generación se ven en una de cada diez páginas, el doble que en .org (4,6%). En los recursos académicos (.edu) y portales gubernamentales (.gov), la proporción cae a un modesto 1%.

Esta disparidad se explica por la economía del contenido. Las plataformas comerciales automatizan activamente las tareas rutinarias: descripciones de productos, textos SEO, artículos de referencia y notas de noticias. Estos formatos son los más susceptibles a la automatización, mientras que las investigaciones únicas y los documentos oficiales requieren participación humana.

Matices metodológicos

Es importante subrayar que esta estimación no es un recuento exacto, sino más bien un modelo probabilístico. Los investigadores no analizaron el historial de ediciones ni encuestaron a los autores. El método detecta marcadores lingüísticos que correlacionan estadísticamente con la generación por IA. Además, la categoría incluye tanto textos completamente generados como materiales que han sufrido una edición sustancial por IA. Una corrección ligera no entra en esta categoría.

Mi comentario: Estas cifras son una llamada de atención para toda la industria. Nos dirigimos hacia un mundo donde los motores de búsqueda y los lectores se ahogarán en un flujo de contenido estereotipado. La ironía es que los textos humanos de calidad se convertirán en un bien escaso y, por tanto, adquirirán un valor premium. La cuestión no es si la IA reemplazará a los autores, sino quién podrá ofrecer una experiencia única que los algoritmos no puedan reproducir.