Biblioteca Nacional de Noruega: Preservando el Patrimonio Cultural para el Futuro Digital
Productos, soluciones and servicios para los negocios
La Biblioteca Nacional de Noruega tiene el mandato legal de recopilar y conservar todas las publicaciones producidas en el país. Aquí se preservan desde libros raros del siglo XVI y periódicos manuscritos del siglo XVIII hasta emisiones de radio y programas de televisión del siglo XX, así como publicaciones digitales y obras audiovisuales posteriores al año 2000. Esta colección constituye una parte importante del patrimonio cultural de Noruega y un legado compartido con el mundo. Representa una fuente de conocimiento inestimable para generaciones de investigadores, encarnando la misión de la biblioteca de preservar el pasado para el futuro.

La Biblioteca Nacional de Noruega lleva más de dos décadas desarrollando un programa de digitalización a gran escala, lo que constituye una de las iniciativas de digitalización más longevas de Europa. No obstante, se trata de un proceso complejo que va mucho más allá de la simple digitalización y el archivo de documentos.
Cada elemento recorre un sofisticado flujo de trabajo que comienza con la captura de los materiales físicos. Esto incluye escanear páginas de libros, fotografiar objetos y grabar audio y vídeo. A continuación, el contenido se somete a un exhaustivo proceso de posprocesamiento que abarca la corrección de imágenes, la normalización de formatos y el control de calidad. En la siguiente etapa, se emplea el reconocimiento óptico de caracteres (OCR) para extraer texto de millones de páginas, incluyendo tipografías históricas, antiguos dialectos noruegos e incluso manuscritos que datan del siglo XIX. Finalmente, se llevan a cabo tareas de etiquetado de metadatos, detección de idiomas y análisis estructural.
Una sola edición de periódico de 25 páginas puede generar alrededor de 150 archivos independientes, incluyendo escaneos maestros, copias derivadas, resultados de OCR y metadatos. Todos estos archivos se agrupan en un único objeto de archivo. La magnitud resulta verdaderamente abrumadora al multiplicar esto por millones de objetos y por un periodo de más de 20 años.
La Biblioteca Nacional de Noruega ha reunido el corpus en lengua noruega más extenso, antiguo y completo del mundo. Este abarca más allá de lo que pueden indexar motores de búsqueda como Google.
Desde el lanzamiento del programa, se han recopilado cerca de 20 petabytes (PB) de objetos digitales únicos. Para garantizar que no se pierda ningún dato, la colección se conserva bajo una política de protección de datos «3+2+1»: tres copias distribuidas en dos tecnologías de almacenamiento (cintas y discos), con una copia almacenada en una ubicación externa. En conjunto, ocupan aproximadamente 60 PB de almacenamiento.
En los últimos años, a medida que la inteligencia artificial (IA) se extiende por todo el mundo, el gobierno noruego ha identificado un desafío crítico. El noruego cuenta con apenas cinco millones de hablantes, pero comprende dos normas escritas oficiales y decenas de dialectos. Este idioma estaba notablemente desatendido por los principales modelos de IA, los cuales se entrenan predominantemente en inglés. Sin desarrollar sus propios modelos de lenguaje de gran tamaño (LLM), Noruega tendría que depender de sistemas de IA creados en otros lugares; sistemas que tal vez nunca lleguen a comprender plenamente el idioma, la cultura y el contexto social de Noruega. Un país que no pueda interactuar con la IA en su propio idioma y en igualdad de condiciones se encontrará inevitablemente en desventaja en la era de la IA.
El Ministerio de Cultura e Igualdad de Noruega respondió encargando a la biblioteca el desarrollo de modelos de lenguaje de gran tamaño (LLM) propios del país, respaldados por una asignación anual de 70 millones de coronas noruegas. La biblioteca también se beneficia de un acuerdo jurídico, consolidado a lo largo de décadas con periódicos y editoriales noruegos, que le permite entrenar modelos utilizando contenidos protegidos por derechos de autor. Se trata de una ventaja institucional inalcanzable para las empresas privadas.
Desbloquear nuevas aplicaciones tecnológicas a partir de datos históricos plantea un desafío aparentemente contradictorio para la infraestructura de datos. La Biblioteca Nacional de Noruega debe atender simultáneamente dos necesidades de almacenamiento fundamentalmente distintas.
La primera es el archivo a largo plazo, donde la durabilidad y la eficiencia de costes son primordiales. Se almacenan cerca de 60 PB de datos masivos en cintas y unidades de disco duro (HDD). El rendimiento no es la prioridad principal; por el contrario, los datos deben permanecer accesibles y legibles tras el paso de mil años.
La segunda necesidad es la opuesta. El entrenamiento de modelos de IA depende en gran medida de una preparación adecuada de los datos. Una vez que comienza el preprocesamiento, es preciso recuperar volúmenes masivos de datos históricos con la mayor rapidez posible, ya que cualquier cuello de botella por latencia se traduce en un desperdicio de recursos informáticos. No obstante, migrar petabytes de datos desde el sistema de archivo a largo plazo hacia un nuevo entorno de almacenamiento supone un desafío considerable.
Aquí es donde entra en juego el sistema de almacenamiento All-Flash OceanStor Dorado de Huawei. Implementado en el entorno de IA local de la Biblioteca Nacional de Noruega, este sistema ofrece una capacidad total superior a los 2 PB, destinada a extraer datos del archivo y a realizar tareas de limpieza, deduplicación, formateo y validación de datos. Gracias a su latencia ultrabaja y su alto rendimiento, el almacenamiento All-Flash OceanStor Dorado de Huawei permite poner en línea valiosos datos históricos y culturales. Una vez procesados por clústeres de CPU, los conjuntos de datos preparados se transfieren de manera eficiente a Sigma2, la infraestructura digital nacional de Noruega, para el entrenamiento final del modelo.
La Biblioteca Nacional de Noruega ha reconocido desde hace mucho tiempo la importancia del almacenamiento de alto rendimiento. Desde su arquitectura inicial basada en SAS hasta la actual arquitectura NVMe totalmente flash, el rendimiento y la latencia han sido sistemáticamente las métricas determinantes para la infraestructura de la biblioteca. Sin soluciones de almacenamiento innovadoras y de alto rendimiento que sirvan de puente, la brecha entre el archivo y la computación resultaría difícil de superar.
La Biblioteca Nacional de Noruega ya ha logrado avances significativos en sus iniciativas de IA. Sus herramientas de reconocimiento de voz y generación de texto, desarrolladas sobre una arquitectura de código abierto, están siendo adoptadas actualmente en diversos sectores de Noruega.
De cara al futuro, las oportunidades van de la mano de nuevos desafíos. Por ejemplo, ¿cómo puede Noruega establecer un sistema de evaluación de calidad para modelos en noruego (idioma que cuenta con dos formas escritas y diversos dialectos)? ¿Cómo deberían diseñarse los marcos de gobernanza para las herramientas nacionales de IA a fin de garantizar que los modelos de lenguaje de gran tamaño (LLM) sirvan al interés público de manera justa, resiliente y confiable? Estas cuestiones se abordarán mediante una exploración continua y la aplicación práctica.
El camino de la Biblioteca Nacional de Noruega hacia la inteligencia digital plantea una pregunta que invita a la reflexión: ¿cuál es la infraestructura más valiosa en la era de la IA?
La respuesta no es la potencia de cálculo. Son los datos recopilados, organizados y preservados cuidadosamente mucho antes de que existiera la IA, gracias a un firme compromiso con la preservación del patrimonio cultural. Estos registros, celosamente protegidos, constituyen la base sobre la que tecnologías innovadoras pueden reflejar la lengua, la cultura y la historia de una nación.