Oxford permite a OpenAI utilizar textos de la Biblioteca Bodleiana para entrenar su IA

Imagen de Terri Paju en Pixabay
La Universidad de Oxford ha permitido a OpenAI, empresa responsable de ChatGPT, utilizar textos históricos de la Biblioteca Bodleiana para entrenar sus modelos de IA.
La colaboración comenzó en marzo de 2025 y fue presentada inicialmente como un proyecto destinado a digitalizar fondos históricos y facilitar su acceso a estudiantes e investigadores. Sin embargo, documentos internos de la universidad obtenidos mediante una solicitud de acceso a la información muestran que parte del material digitalizado ha sido incorporado al conjunto de datos utilizado para entrenar los modelos de OpenAI.
El acuerdo ha generado preocupación entre algunos miembros de la comunidad universitaria, especialmente por el posible impacto reputacional de colaborar con una empresa tecnológica tan controvertida y por las implicaciones medioambientales de una tecnología que requiere un elevado consumo energético.
Entre el material enviado a OpenAI figuran unas 125.000 imágenes digitalizadas de tesis históricas, además de una colección de alrededor de 10.000 baladas impresas del siglo XVI, que contienen letras de canciones y anotaciones musicales.
También se ha planteado digitalizar documentos del Estado irlandés del siglo XVIII, cartas privadas de la escritora Marie Edgeworth y cuadernos de Dorothy Hodgkin relacionados con sus investigaciones sobre la penicilina.
La colaboración se enmarca en una tendencia más amplia de las empresas de IA, que buscan nuevas fuentes de información para entrenar sus modelos.
La abundancia de contenidos generados por IA en internet está reduciendo el valor de la web como fuente de datos, por lo que las compañías han comenzado a prestar mayor atención a colecciones físicas de libros y documentos históricos.
OpenAI mantiene acuerdos similares con instituciones estadounidenses como la Biblioteca Pública de Boston, el MIT y la Universidad de Michigan.
Oxford asegura que el proyecto tiene una escala limitada y que únicamente se utilizan materiales cuyos derechos de autor han expirado. La universidad también señala que conserva los derechos sobre las copias digitalizadas y que pretende ponerlas a disposición del público en internet próximamente.
Según su versión, la digitalización constituye el objetivo principal del acuerdo y la contribución de estos materiales al entrenamiento de modelos de IA era conocida por los participantes.
El acuerdo también plantea la posibilidad de ampliar considerablemente la digitalización de los fondos de la Bodleiana, que cuenta con unos 23 millones de piezas.
Al mismo tiempo, el caso refleja el creciente interés de las empresas de IA por el patrimonio documental y plantea un debate sobre las condiciones bajo las que bibliotecas y universidades deben colaborar con estas compañías para preservar y difundir el conocimiento histórico.




