Mi análisis muestra que Amazon está llevando a cabo una operación encubierta de digitalización masiva de publicaciones impresas que sorprende incluso a los libreros más experimentados. No se trata solo de escanear: los libros se destruyen físicamente después del procesamiento. Es un enfoque sistemático que revela el apetito de los gigantes tecnológicos por datos únicos para entrenar redes neuronales.
Cómo se destapó el esquema
Todo comenzó con pedidos anómalos a vendedores de libros raros. Compradores anónimos adquirían cientos de ediciones de diferentes épocas y temáticas, incluidos ejemplares únicos. En julio, una de las librerías de viejo recibió un pedido de mil libros a través de la plataforma Biblio. El vendedor, sospechando algo raro, aceptó rastrear el destino del lote ocultando un rastreador GPS Apple AirTag en uno de los volúmenes.
El dispositivo condujo a una instalación de Amazon en el norte de Las Vegas. Allí se encuentra la división VGT3, que, según se descubrió, se dedica al procesamiento de libros impresos. Tras examinar publicaciones de empleados y hablar con exempleados, reconstruí el panorama completo de lo que ocurre.
La cadena de destrucción del conocimiento
El proceso es el siguiente. Primero, los empleados registran cada edición y escanean los códigos de barras o ISBN. Luego viene lo más bárbaro: se cortan las encuadernaciones de los libros, convirtiéndolos en pilas de hojas sueltas. Estas hojas se cargan en escáneres de alta velocidad. Este enfoque acelera al máximo la digitalización, pero hace imposible restaurar el libro físico.
Según los trabajadores, el escaneo es la función principal de VGT3. También hay indicios indirectos de la escala: a principios de 2026, incluso se observaron interrupciones en el suministro en la plataforma, tal era la demanda de nuevos lotes de libros para procesar.
La posición oficial y la realidad
Amazon, al comentar la situación, confirmó que compra publicaciones impresas a través de canales comerciales. La corporación declaró que los libros se utilizan para el «desarrollo y mejora de productos y servicios». Sin embargo, la empresa omite obstinadamente la escala de las compras, los plazos del programa y los productos específicos para los que se preparan los datos.
Este silencio es más elocuente que cualquier palabra. Es evidente que Amazon está construyendo su propio conjunto de datos de entrenamiento, prefiriendo los archivos físicos a los digitales, probablemente debido a problemas de derechos de autor y a la calidad de los conjuntos de datos existentes.
Mi veredicto: Estamos presenciando una nueva carrera armamentista en la industria de la IA. La compra y destrucción de libros raros no es solo una forma de obtener texto, sino un paso estratégico para crear contenido exclusivo para el entrenamiento. Mientras los reguladores discuten sobre la piratería digital, las corporaciones están adoptando métodos de recopilación de datos mucho más agresivos que permanecen fuera del marco legal. La pregunta es cuándo el público tomará conciencia del precio que pagamos por el progreso de los algoritmos.