scieee AI-readable full text Open interactive document viewer

Indexation automatique de documents avec Annif

Guignard, Thomas

Abstract

L’indexation et l’ajout de mots-clés reste un outil crucial pour améliorer la découvrabilité de contenu, que ce soit dans un catalogue de bibliothèque ou tout autre base de données. Ce travail souvent manuel peut être long, répétitif et sujet aux erreurs. Il existe cependant des outils permettant d’automatiser en partie ce processus. Dans cette présentation présentée à la conférence LibreABC 2025, nous explorons Annif, un logiciel open source qui exploite plusieurs modèles de langage et l’apprentissage machine pour proposer une solution d’indexation automatique performante et adaptée à son contexte. Via son interface web intuitive, par ligne de commande ou API REST, Annif permet d’entraîner un modèle sur des vocabulaires multilingues et des corpus personnalisés, puis de proposer des termes d’indexation de manière automatique ou contrôlée. À travers des cas d’usage concrets, nous voyons comment Annif peut être utilisé comme aide à l’indexation tout comme l’enrichissement automatique de données bibliographiques ou bases de données documentaires.

Full text

Indexation automatique de documents avec Conférence LibreABC 9 septembre 2025 Thomas Guignard Contexte technique (et historique) 2000 2013 2017 2018 2019 2020 2021 2022 bag-of-words word2vec Attention is All You Need Parabel/Omikuji BERT transformers extreme multilabel classification (XMLC) GPT GPT-2 GPT-3 ChatGPT Digital Assistent (ZB Zürich) DA-3 (Allemagne) 2016 (prototype) v.0.45 (Omikuji) v.1.0 2023 v.1.1 ( ) 2024 Fonctionnement Corpus Corpus indexé Vocab Tokenisation Vectorisation Apprentissage Apprentissage Prédiction Modèle Validation Vocab Tokenisation Vectorisation À indexer candidat 1 –score 0.92 candidat 2 –score 0.85 candidat 3 –score 0.45 Prédiction En pratique : Apprentissage [stw-tfidf-en] name=STW TFIDF project language=en backend=tfidf vocab=stw analyzer=snowball(english) [stw-mllm-en] name=STW MLLM project language=en backend=mllm vocab=stw analyzer=snowball(english) [stw-ensemble-en] name=STW ensemble project language=en backend=ensemble vocab=stw sources=stw-tfidf-en,stw-mllm-en:2 1. Configuration 2. Chargement du vocabulaire annif load-vocab stw datasets/stw-skos.ttl 3. Apprentissage annif train stw-tfidf-en datasets/stw-econbiz.tsv.gz 4. Validation annif eval stw-tfidf-en datasets/stw-econbiz-test Prédiction : Web Prédiction : API Prédiction : CLI Démonstration !