Un servicio llamado ISBNdb permite a empresas de inteligencia artificial encargar libros raros hasta por un millón de unidades en un solo pedido, y una parte de esos pedidos termina triturada apenas se completa el escaneo. La plataforma factura los pedidos de compradores anónimos y, según libreros consultados por medios especializados, ejemplares con muy pocas copias sobrevivientes también entran en ese circuito.
La práctica no es aislada: forma parte de una carrera por conseguir texto de entrenamiento que no haya sido contaminado por contenido generado con inteligencia artificial. Un juez federal ya calificó el proceso de uso legítimo (fair use), lo que despejó el camino legal para que empresas como Anthropic lo aceleren.
TL;DR
- ISBNdb facilita pedidos de hasta un millón de libros y mantiene en el anonimato a los compradores.- Empresas de IA escanean los libros con máquinas de alta velocidad que cortan el lomo y luego destruyen el original.- Los libros publicados antes de 2022 cotizan con sobreprecio porque no contienen texto generado por IA.- Un juez federal dictaminó que la práctica es fair use porque, al eliminar el original, solo queda una copia en circulación a la vez.- Anthropic contrató al exdirector de asociaciones de Google Books para un proyecto interno conocido como Project Panama.- Según documentos judiciales citados en el reporte, el objetivo declarado del proyecto era escanear destructivamente todos los libros del mundo.- ISBNdb ofrece acuerdos de confidencialidad (NDA) a sus clientes y sugiere describir la práctica como preservación digital.
Introducción
El fenómeno de los libros raros triturados después de escanearlos volvió a circular esta semana a partir de un hilo del analista Hedgie (@HedgieMarkets), que reconstruyó cómo operan algunos proveedores de datos de entrenamiento para modelos de lenguaje. El caso conecta tres piezas: un servicio de intermediación (ISBNdb), un fallo judicial que habilita la destrucción del original y una empresa, Anthropic, que según el hilo fichó personal especializado en digitalización masiva de bibliotecas.
La cadena empieza con la compra. ISBNdb permite ordenar volúmenes completos de un catálogo, incluidos títulos descatalogados o con tirajes pequeños, sin que el vendedor sepa quién compra ni para qué. Ese anonimato es parte del servicio, no un efecto secundario: la propia plataforma lo ofrece como una característica más para atraer compradores institucionales.
Qué pasó con los libros raros
Según el relato, compañías de inteligencia artificial compran libros raros en bloque, los procesan en máquinas de escaneo de alta velocidad que cortan el lomo para poder alimentar cada hoja por separado, y destruyen lo que queda del volumen físico una vez terminado el proceso. Un juez federal determinó que esa práctica es fair use: el argumento central es que, al eliminar el original en el momento de digitalizarlo, nunca existen dos copias (una física y una digital) circulando al mismo tiempo, lo que evita el problema de duplicación que suele preocupar a la ley de derechos de autor.
El hilo también señala que Anthropic contrató al exresponsable de asociaciones de Google Books, la división que en la década de 2000 escaneó millones de volúmenes de bibliotecas universitarias, con el objetivo declarado, según el planteo interno citado, de obtener todos los libros del mundo. Ese esfuerzo se conoce puertas adentro como Project Panama, de acuerdo con documentos de la causa judicial mencionados en el hilo, y habría implicado un gasto de decenas de millones de dólares.
Un detalle explica la urgencia del mercado: los libros publicados antes de 2022 cotizan con sobreprecio frente a ediciones más recientes. La razón es que el contenido posterior a esa fecha tiene más probabilidad de incluir texto generado o reescrito con IA, algo que los equipos de datos quieren evitar para no entrenar un modelo con su propia salida sintética.
Ejemplares con pocas copias sobrevivientes también entran en el circuito, según libreros consultados.
Contexto e historia
La digitalización masiva de libros no es nueva. Google Books, lanzado a mediados de la década de 2000, escaneó millones de volúmenes de bibliotecas como Harvard, Stanford y la Bodleian de Oxford, y terminó en una demanda larga, Authors Guild v. Google, resuelta a favor de Google en 2015 bajo el argumento de que mostrar fragmentos de un libro con fines de búsqueda es fair use. Ese precedente es la base legal sobre la que hoy se apoyan los laboratorios de IA para defender el entrenamiento con obras protegidas.
La diferencia con el escenario actual es que ahora la copia digital no convive con el original: el libro físico se destruye. Esa variante ya fue evaluada en el litigio conocido como Bartz v. Anthropic, donde un tribunal federal distinguió entre entrenar con libros pirateados (lo cual sí generó responsabilidad) y entrenar con libros comprados legalmente, incluso si el proceso de digitalización implica destruir el ejemplar físico.
Ese matiz es clave para entender por qué el mercado de libros raros se volvió, sin quererlo, un insumo estratégico de la industria de IA: comprar en bloque y destruir después es, según ese razonamiento judicial, más defendible legalmente que escanear y conservar dos copias. Es, además, la primera vez que un tribunal estadounidense avala explícitamente la destrucción del original como parte de una práctica de digitalización a gran escala.
Detalles técnicos y rendimiento
El proceso de escaneo destructivo no es exótico: es el mismo método que usan archivos y editoriales para digitalizar tirajes masivos cuando no importa preservar el objeto físico. Una guillotina industrial corta el lomo del libro, las hojas sueltas pasan por un escáner de alimentación automática a alta velocidad y un pipeline de OCR convierte cada página en texto plano, que después se limpia y estructura para entrenamiento.
flowchart TD
A["Comprador anonimo ordena en ISBNdb"] --> B["Se adquieren ejemplares fisicos, hasta 1.000.000 por pedido"]
B --> C["Guillotina corta el lomo del libro"]
C --> D["Escaner de alta velocidad digitaliza cada hoja"]
D --> E["OCR y limpieza del texto"]
E --> F[("Corpus de entrenamiento de IA")]
C --> G["El volumen fisico se tritura"]
La tabla siguiente compara el método destructivo que describe el hilo de Hedgie con el escaneo no destructivo que usan bibliotecas y archivos patrimoniales cuando sí necesitan conservar el objeto original:
MétodoCuándo se usaVentajaLimitaciónEscaneo destructivo (guillotina + alimentador de hojas)Volumen alto, sin intención de conservar el ejemplar físicoMayor velocidad y calidad de OCR uniforme por página planaDestruye el original: es irreversibleEscaneo no destructivo (escáner cenital u overhead)Libros raros, archivos y colecciones patrimonialesPreserva el objeto físico intactoMás lento y requiere manipulación manual cuidadosa
No hay, en el material disponible, una cifra pública de páginas por hora o costo por volumen del pipeline de Anthropic: ISBNdb y las empresas compradoras no publican esos números. Lo que sí es verificable es el mecanismo de compra: cualquier persona puede consultar el catálogo de ISBNdb y comprobar que el servicio está diseñado para pedidos masivos por ISBN, no para compras individuales de coleccionista.
El lomo se corta antes de escanear para alimentar hojas sueltas al equipo.
Cómo verificarlo
Para confirmar el fallo judicial que habilita esta práctica, lo más directo es revisar el expediente público del caso Bartz v. Anthropic en CourtListener, donde quedan archivadas las órdenes y mociones de tribunales federales de Estados Unidos. Ahí figuran las referencias a Project Panama que cita el hilo original.
Para una librería o un vendedor independiente, la manera de chequear si un ejemplar propio está en riesgo de terminar en este circuito es simple: antes de vender un lote grande a un comprador anónimo vía ISBNdb u otro intermediario similar, conviene buscar el ISBN en WorldCat y ver cuántas bibliotecas del mundo todavía reportan tener ese título en su catálogo. Si el número es bajo, de una sola cifra, ese ejemplar es candidato a pieza irremplazable y conviene ofrecerlo primero a una biblioteca con mandato de preservación antes que a un comprador que no revela su identidad.
Impacto y análisis
El razonamiento legal detrás del fallo (una sola copia existente evita el problema de duplicación) tiene una consecuencia que el propio hilo de Hedgie señala: la destrucción es irreversible. Un sitio web se puede volver a subir. Un bestseller se puede reimprimir. Las últimas copias sobrevivientes de un texto del siglo XVIII no se pueden recuperar una vez trituradas.
⚠️ Ojo: a diferencia de datos scrapeados de la web, un libro triturado no admite corrección posterior. Si en apelación un tribunal superior revierte el criterio de fair use, el objeto físico que habría permitido volver a evaluarlo ya no existiría.
ISBNdb, según el hilo, es consciente del problema de percepción: su propio sitio reconoce que una empresa de IA destruye dos millones de libros no es un titular que genere simpatía, y aun así construyó un modelo de negocio alrededor de facilitarlo con discreción, incluyendo acuerdos de confidencialidad para sus clientes y la sugerencia de describir el proceso como preservación digital.
El otro efecto es de mercado: al volverse valiosos los libros libres de contaminación de texto generado por IA, se crea un incentivo económico directo para que más libreros vendan lotes completos en lugar de ofrecer títulos sueltos a coleccionistas o bibliotecas, que suelen pagar menos y comprar de a un ejemplar. Eso desplaza volumen de venta desde el circuito tradicional de libros raros hacia intermediarios orientados a compradores institucionales de datos.
Qué sigue
Con el respaldo legal ya confirmado en tribunales, la expectativa, según el propio hilo, es que la práctica se acelere en lugar de frenarse. No hay, hasta la fecha de esta nota, ninguna propuesta legislativa específica en Estados Unidos que distinga entre digitalizar y conservar el original versus digitalizar y destruirlo. Mientras esa distinción no exista en la ley, el criterio judicial que avaló la destrucción como parte del fair use sigue siendo el único marco de referencia.
Bibliotecarios y organizaciones de preservación patrimonial, citados indirectamente en la conversación que generó el hilo, plantean que la respuesta más realista a corto plazo no es legal sino logística: identificar y comprar primero los títulos más raros antes de que lleguen a un intermediario como ISBNdb.
Probalo vos: buscá el ISBN de algún libro raro o descatalogado que tengas a mano en isbndb.com y compará cuántas bibliotecas lo tienen registrado en WorldCat antes de decidir qué hacer con él.
📖 Resumen en Telegram: Ver resumen
Preguntas frecuentes
¿Qué es Project Panama?
Es el nombre interno, citado en documentos judiciales según el hilo original, de un proyecto de Anthropic orientado a conseguir la mayor cantidad posible de libros para entrenamiento, incluida su digitalización destructiva.
¿Por qué destruyen el libro en lugar de conservarlo después de escanearlo?
Según el criterio judicial citado, mantener solo una copia (la digital, tras eliminar la física) evita el problema legal de que existan dos versiones del mismo contenido en circulación simultánea.
¿Es legal comprar y triturar libros raros para entrenar un modelo de IA?
Un juez federal calificó la práctica de fair use en el marco del litigio Bartz v. Anthropic, siempre que los libros hayan sido adquiridos legalmente antes de digitalizarlos.
¿Por qué los libros anteriores a 2022 valen más para este mercado?
Porque tienen menor probabilidad de contener texto generado o reescrito con inteligencia artificial, algo que los equipos de datos evitan para no entrenar un modelo con su propia salida sintética.
¿Qué es ISBNdb y qué rol cumple?
Es un servicio que permite ordenar libros por ISBN en bloque, hasta un millón de unidades por pedido, y que mantiene el anonimato de quien compra.
¿Qué puede hacer una biblioteca para proteger un ejemplar raro?
Verificar en catálogos colectivos como WorldCat cuántas copias sobreviven a nivel mundial y priorizar la conservación o adquisición de los títulos con menos ejemplares registrados antes de que se vendan a compradores anónimos.
Referencias
- Hilo de @HedgieMarkets en X (vía XCancel): relato original sobre ISBNdb, Project Panama y el fallo judicial.- CourtListener: archivo público de expedientes judiciales federales de Estados Unidos, incluido el litigio Bartz v. Anthropic.- ISBNdb: sitio oficial del servicio de pedidos masivos de libros por ISBN.- Google Books (Wikipedia): contexto histórico sobre la digitalización masiva de bibliotecas y el litigio Authors Guild v. Google.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (0)