← Blog

Glosario: los términos de IA y catalogación de este blog

  • JaniumCollect
  • IA
  • referencia

Esta serie cruza dos mundos: el de la catalogación —bibliotecas, archivos, museos— y el de la inteligencia artificial. Cada uno trae su vocabulario, y no todos lo conocen. Esta es una referencia breve de los términos que más aparecen. Si vienes de un acervo, la sección de IA te será útil; si vienes de la IA, la de catalogación.

Inteligencia artificial

Modelo de lenguaje (LLM)

El tipo de inteligencia artificial detrás de herramientas como ChatGPT: un programa entrenado con enormes cantidades de texto que, a partir de lo que lee, identifica, resume y completa información. “LLM” son sus siglas en inglés (large language model). En este blog es lo que lee el documento y propone el registro.

RAG — generación aumentada por recuperación

Se buscan fragmentos cercanos a una consulta y se le entregan a un modelo de lenguaje para que redacte una respuesta. Sirve para preguntar en lenguaje natural sobre un conjunto de documentos. No sustituye un catálogo: no da un índice alfabético de autores ni de materias, y la cantidad de texto que el modelo aprovecha de verdad tiene un techo (la ventana de contexto efectiva).

Modelo de frontera

Los modelos de lenguaje más capaces y recientes, operados por grandes proveedores y accesibles por internet (en la nube). Rinden mejor en los casos difíciles, pero procesar con ellos implica enviarles el material. Se contraponen a un modelo local, que corre en la infraestructura de la institución.

Anonimización y tokens

Reemplazar los datos personales de un texto por marcadores neutros —los tokens— antes de enviarlo a un servicio externo, y restaurarlos al volver. Reduce la exposición de datos personales, aunque no garantiza que no quede ninguno.

OCR — reconocimiento óptico de caracteres

Convertir la imagen de un documento escaneado en texto que una máquina puede leer. Es el paso previo cuando el material es un escaneo sin texto seleccionable.

ASR — transcripción automática

Convertir voz en texto. En audio y video es lo que produce la transcripción de la que se extrae el registro. “ASR” son sus siglas en inglés (automatic speech recognition).

Infraestructura y soberanía

On-premise

Que el procesamiento corre en los servidores de la institución, no en un servicio de terceros. El material no sale.

Air-gapped

Una red aislada, sin conexión a internet. El grado máximo de soberanía: el sistema funciona sin comunicarse con el exterior.

Soberanía de datos y residencia de datos

El principio de que cierta información no puede salir de la institución —o del país— que la custodia, por ley, por política o por el tipo de contenido. Se desarrolla en Catalogar con IA sin que el material salga de la institución.

Estándares de catalogación

MARC21 / UNIMARC

El formato estándar para registros bibliográficos en bibliotecas. Estructura la descripción en campos y subcampos codificados.

Dublin Core

Un conjunto simple de campos para describir cualquier recurso de forma interoperable. Menos detallado que MARC, más fácil de intercambiar.

ISAD-G

La norma internacional de descripción archivística. Describe el material en una jerarquía —fondo, sección, serie, unidad— donde importan la procedencia y el contexto, no solo la pieza aislada.

Bubble-up — agregación ascendente

Al describir un archivo en ISAD-G, subir a los niveles superiores de la jerarquía —serie, fondo— los datos que comparte la mayoría de los documentos que cuelgan de ellos, en vez de repetirlos en cada uno. Aplica el principio de no repetitividad de la norma. Es una heurística de mayoría, con un umbral configurable, y su resultado se revisa.

CDWA

El estándar para describir obras de arte y objetos culturales, con el vocabulario del Getty. Distingue la obra de su reproducción.

Extensiones corporativas

Campos que Collect añade al registro (sobre Dublin Core o ISAD-G) cuando el material es un documento de gestión: personas con su rol, organizaciones, montos, fechas críticas, garantías, cláusulas, obligaciones y relaciones entre entidades. En Janium se indexan como puntos de acceso especializados. Lo que el documento no declara no se rellena.

Punto de acceso

Encabezamiento por el que se encuentra un registro en el catálogo: un nombre, una materia, un título, una fecha. Collect los extrae del material (los aflora). En Janium alimentan los índices especializados —búsqueda por palabra clave— y el fichero de autoridades —búsqueda alfabética—. No son un resumen para el modelo: son las entradas del índice.

Artículo 50.2

Obligación del Reglamento (UE) 2024/1689, vigente desde el 2 de agosto de 2026: quien comercializa un sistema de IA que genera o manipula texto debe marcar esas salidas en formato legible por máquina, de modo que se detecten como generadas o manipuladas, en la medida en que sea técnicamente viable. Collect marca las salidas de catalogación que entran en ese supuesto.

Control de autoridades

El mecanismo que asegura que una misma persona, entidad o materia se registre siempre de la misma forma, contrastándola contra listas de referencia —VIAF, ISNI, los vocabularios del Getty, o el catálogo de la propia institución—. Evita que un mismo autor entre al índice con tres grafías distintas.

Sistemas

Janium

Sistema web de gestión de información para bibliotecas, archivos y repositorios digitales. Recibe registros en formatos estándar (MARC21, Dublin Core, ISAD-G y otros), sostiene el catálogo público, la circulación y el control de autoridades, y puede indexar el texto completo de los objetos digitales. Se opera en los servidores de la institución o como servicio en la nube (JaniumNet). Collect produce los registros; Janium es el catálogo que los busca y los presta. La ficha de producto está en janium.com/janium.


¿Falta un término que te gustaría ver aquí? Escríbenos a info@janium.com.