Esta serie cruza dos mundos: el de la catalogación —bibliotecas, archivos, museos— y el de la inteligencia artificial. Cada uno trae su vocabulario, y no todos lo conocen. Esta es una referencia breve de los términos que más aparecen. Si vienes de un acervo, la sección de IA te será útil; si vienes de la IA, la de catalogación.
Inteligencia artificial
Modelo de lenguaje (LLM)
El tipo de inteligencia artificial detrás de herramientas como ChatGPT: un programa entrenado con enormes cantidades de texto que, a partir de lo que lee, identifica, resume y completa información. “LLM” son sus siglas en inglés (large language model). En este blog es lo que lee el documento y propone el registro.
RAG — generación aumentada por recuperación
Se buscan fragmentos cercanos a una consulta y se le entregan a un modelo de lenguaje para que redacte una respuesta. Sirve para preguntar en lenguaje natural sobre un conjunto de documentos. No sustituye un catálogo: no da un índice alfabético de autores ni de materias, y la cantidad de texto que el modelo aprovecha de verdad tiene un techo (la ventana de contexto efectiva).
Modelo de frontera
Los modelos de lenguaje más capaces y recientes, operados por grandes proveedores y accesibles por internet (en la nube). Rinden mejor en los casos difíciles, pero procesar con ellos implica enviarles el material. Se contraponen a un modelo local, que corre en la infraestructura de la institución.
Anonimización y tokens
Reemplazar los datos personales de un texto por marcadores neutros —los tokens— antes de enviarlo a un servicio externo, y restaurarlos al volver. Reduce la exposición de datos personales, aunque no garantiza que no quede ninguno.
OCR — reconocimiento óptico de caracteres
Convertir la imagen de un documento escaneado en texto que una máquina puede leer. Es el paso previo cuando el material es un escaneo sin texto seleccionable.
ASR — transcripción automática
Convertir voz en texto. En audio y video es lo que produce la transcripción de la que se extrae el registro. “ASR” son sus siglas en inglés (automatic speech recognition).
Infraestructura y soberanía
On-premise
Que el procesamiento corre en los servidores de la institución, no en un servicio de terceros. El material no sale.
Air-gapped
Una red aislada, sin conexión a internet. El grado máximo de soberanía: el sistema funciona sin comunicarse con el exterior.
Soberanía de datos y residencia de datos
El principio de que cierta información no puede salir de la institución —o del país— que la custodia, por ley, por política o por el tipo de contenido. Se desarrolla en Catalogar con IA sin que el material salga de la institución.
Estándares de catalogación
MARC21 / UNIMARC
El formato estándar para registros bibliográficos en bibliotecas. Estructura la descripción en campos y subcampos codificados.
Dublin Core
Un conjunto simple de campos para describir cualquier recurso de forma interoperable. Menos detallado que MARC, más fácil de intercambiar.
ISAD-G
La norma internacional de descripción archivística. Describe el material en una jerarquía —fondo, sección, serie, unidad— donde importan la procedencia y el contexto, no solo la pieza aislada.
Bubble-up — agregación ascendente
Al describir un archivo en ISAD-G, subir a los niveles superiores de la jerarquía —serie, fondo— los datos que comparte la mayoría de los documentos que cuelgan de ellos, en vez de repetirlos en cada uno. Aplica el principio de no repetitividad de la norma. Es una heurística de mayoría, con un umbral configurable, y su resultado se revisa.
CDWA
El estándar para describir obras de arte y objetos culturales, con el vocabulario del Getty. Distingue la obra de su reproducción.
Extensiones corporativas
Campos que Collect añade al registro (sobre Dublin Core o ISAD-G) cuando el material es un documento de gestión: personas con su rol, organizaciones, montos, fechas críticas, garantías, cláusulas, obligaciones y relaciones entre entidades. En Janium se indexan como puntos de acceso especializados. Lo que el documento no declara no se rellena.
Punto de acceso
Encabezamiento por el que se encuentra un registro en el catálogo: un nombre, una materia, un título, una fecha. Collect los extrae del material (los aflora). En Janium alimentan los índices especializados —búsqueda por palabra clave— y el fichero de autoridades —búsqueda alfabética—. No son un resumen para el modelo: son las entradas del índice.
Artículo 50.2
Obligación del Reglamento (UE) 2024/1689, vigente desde el 2 de agosto de 2026: quien comercializa un sistema de IA que genera o manipula texto debe marcar esas salidas en formato legible por máquina, de modo que se detecten como generadas o manipuladas, en la medida en que sea técnicamente viable. Collect marca las salidas de catalogación que entran en ese supuesto.
Control de autoridades
El mecanismo que asegura que una misma persona, entidad o materia se registre siempre de la misma forma, contrastándola contra listas de referencia —VIAF, ISNI, los vocabularios del Getty, o el catálogo de la propia institución—. Evita que un mismo autor entre al índice con tres grafías distintas.
Sistemas
Janium
Sistema web de gestión de información para bibliotecas, archivos y repositorios digitales. Recibe registros en formatos estándar (MARC21, Dublin Core, ISAD-G y otros), sostiene el catálogo público, la circulación y el control de autoridades, y puede indexar el texto completo de los objetos digitales. Se opera en los servidores de la institución o como servicio en la nube (JaniumNet). Collect produce los registros; Janium es el catálogo que los busca y los presta. La ficha de producto está en janium.com/janium.
¿Falta un término que te gustaría ver aquí? Escríbenos a info@janium.com.