
Pintura de Tag Hartman-Simkins / Futurismo. Fuente: Getty Images
Anthropic destrozó millones de libros de física para entrenar su modelo Claude AI, y nueva evidencia sugiere que sabía muy bien lo feo que se vería si alguien se enterara.
La iniciativa secreta, denominada Proyecto Panamá, fue revelada el verano pasado en una demanda presentada por un grupo de autores contra Anthropic, que la compañía finalmente resolvió en agosto por 1.500 millones de dólares.
Desde entonces, ha salido a la luz más información sobre lo que sucedió detrás de escena después de que un juez de distrito ordenara la publicación de más documentos del caso, según un nuevo comunicado del departamento. Correo de Washington.
Los documentos revelan cómo la dirección de Anthropic considera que los libros son «cruciales» para entrenar sus modelos de IA, y uno de sus fundadores afirma que enseñan a los robots «cómo escribir bien» en lugar de imitar «conversaciones de Internet de baja calidad».
Comprar, escanear y luego destruir millones de libros usados era una forma de hacerlo, y tenía la ventaja de ser barato y posiblemente legal. Esta práctica dañina utilizó un concepto legal conocido como doctrina de la primera venta, que permite a los compradores hacer lo que quieran con su compra sin interferencia del propietario de los derechos de autor. (Es lo que permite un mercado para los medios usados). Y en agosto, un juez determinó que convertir los archivos de papel a digital contribuyó a la capacidad de Anthropic de «transformar» el texto original, dictaminando que la startup no creó más copias físicas ni redistribuyó el texto existente. Eso fue suficiente para considerarse uso legítimo, y destruir libros permitió a la empresa evitar pagar a los autores por su trabajo.
Según documentos judiciales, copiar libros de Anthropic se ha convertido en una forma de arte. Utiliza una «máquina cortadora hidráulica» para «cortar limpiamente» millones de libros de librerías de segunda mano y escanear las páginas «en escáneres de alta velocidad, alta calidad y grado industrial». Luego planifique que la empresa de reciclaje recoja la cantidad tratada, ya que no quiere desperdiciar nada.
Si esto le parece éticamente dudoso, no está solo. Anthropic parecía consciente de cómo podrían verse sus prácticas destructivas, un símbolo fácil de cuántas personas reconocen que la tecnología de la industria está arruinando el arte.
«No queremos anunciar que estamos trabajando en esto», dice un documento interno de planificación para 2024. wapo.
Antes de pasar a los libros físicos, la empresa inicialmente confió en los libros digitales. En 2021, Ben Mann, uno de los cofundadores de Anthropic, se comprometió a descargar millones de libros de LibGen. Al año siguiente, Mann elogió un nuevo sitio web, Pirate Library Mirror, que, según afirmó abiertamente, violaba «intencionalmente» las leyes de derechos de autor en la mayoría de los países. Al enviar el enlace al sitio web a otros empleados, Mann dijo cuando abrieron el sitio: «¡¡¡Es hora!!!» por wapo. (Anthropic ha negado haber utilizado libros pirateados para entrenar sus modelos comerciales. Pero la destrucción de los libros que utilizó Anthropic se consideró legal, pero el uso de libros pirateados no, lo que llevó a un acuerdo de 1.500 millones de dólares).
Anthropic no es la única empresa que pone los libros al revés. Según otra afirmación del autor, los documentos revelaban cómo Meta de Mark Zuckerberg había robado millones de libros de bibliotecas oscuras como LibGen, lo que algunos empleados entendieron como un poco sospechoso.
En 2023, un ingeniero de Meta escribió con un emoji risueño: «Hacer torrents desde una computadora portátil corporativa no está bien».
Otro miembro del personal centrado en las relaciones públicas advirtió sobre los riesgos que se derivan de saltarse el ejercicio.
«Si hay cobertura mediática sobre el presunto uso de bases de datos robadas, como LibGen, como sabemos, esto podría socavar nuestra posición negociadora con los reguladores sobre estos asuntos», escribieron en una comunicación interna.
Más sobre IA: Un antropólogo de primer nivel no sabe si la IA es consciente o no

