El análisis del espacio web global demuestra una impresionante expansión de los modelos generativos. Según mis datos, basados en una investigación a gran escala de una muestra aleatoria de 10 000 páginas en inglés, recopiladas en julio de 2026, alrededor del 10% de todo el contenido indexado presenta claras huellas de generación automática. Sin embargo, la conclusión clave va más allá: entre los materiales publicados después del lanzamiento de ChatGPT en noviembre de 2022, la proporción de textos sintéticos supera el 33%.

Metodología y escala real del fenómeno

Para la identificación se utilizó un modelo de aprendizaje automático que analiza patrones lingüísticos característicos de los LLM modernos. Es importante entender que incluir en la muestra contenido "antediluviano" reduce artificialmente el porcentaje general. Si filtramos todo lo creado antes de la era de la IA generativa, el panorama se vuelve radical: uno de cada tres textos nuevos en internet es producto de algoritmos. Esto no es solo estadística, sino un marcador de un cambio de paradigma en la producción de información.

El sector comercial — el principal campo de batalla de la IA

La distribución de contenido sintético por zonas de dominio confirma la motivación económica. En la zona .com, los indicios de IA se detectan en una de cada diez páginas (10%), el doble que en .org (4,6%). Aún más reveladoras son las cifras para recursos académicos y gubernamentales (.edu y .gov), donde la proporción no supera el 1%. Esta desproporción es explicable: las plataformas comerciales automatizan activamente la producción de textos SEO, descripciones de productos y feeds de noticias, donde la velocidad y el volumen importan más que una perspectiva autoral única.

Advertencias importantes y riesgos ocultos

Cabe destacar que se trata de una estimación de autoría probable, no de un hecho verificado. La metodología no revisa el historial de ediciones ni entrevista a los autores, por lo que es posible un margen de error en ambas direcciones. Además, la categoría de contenido de IA "sustancialmente editado" es difusa: una corrección menor de gramática por una red neuronal puede no entrar en la muestra, mientras que los artículos completamente generados sí.

Mi análisis: El mercado ya se enfrenta a una crisis de confianza en el contenido textual. El aumento de la proporción de IA en el segmento comercial conduce inevitablemente a la devaluación del ruido informativo y al fortalecimiento de los filtros. Estamos al borde de que los algoritmos comiencen a combatir activamente el contenido de otros algoritmos, y en esta guerra, el gran perdedor podría ser el lector humano, que pierde la capacidad de distinguir hechos de una generación verosímil.