Utilisation de grands modèles de langage localement en recherche
Abstract
Atelier - Utilisation de grands modèles de langage localement en recherche Introduction L'intégration des grands modèles de langage (LLM) sur site offre des avantages significatifs pour la recherche scientifique. Elle permet de garantir la confidentialité des données sensibles, d'assurer la propriété intellectuelle et de personnaliser les analyses en fonction des besoins spécifiques des projets. En déployant ces outils localement ou sur des infrastructures de calcul scientifique (comme les grappes HPC), les chercheur·es assurent la reproductibilité des résultats, indépendamment des plateformes externes ou des décisions commerciales. La palette de modèles disponibles (Llama, Qwen, Gemma, etc.) permet aux chercheur·es d'adapter leur choix aux spécificités de leur domaine. Bien que le matériel informatique (comme les GPU) et une formation initiale soient nécessaires, l'existence de logiciels libres ou au code source ouvert rend cette approche accessible. Cette présentation vise à illustrer comment intégrer l'intelligence artificielle dans le traitement des données tout en valorisant l'autonomie, la transparence et la conformité aux normes éthiques de recherche. Objectif de l'atelier Cet atelier vise à familiariser les chercheur·es avec des outils d'IA générative capables de fonctionner hors ligne, tels que Ollama et la bibliothèque Transformers pour Python. Les exemples concrets abordés incluront : La génération de données synthétiques à l'aide de l'interface locale Open Web UI, L'exécution d'un modèle sur une grappe HPC via le système de modules CVMFS utilisé par les infrastructures canadiennes. Les codes sources et guides d'installation seront mis à disposition lors de la présentation, facilitant ainsi l'expérimentation et la mise en œuvre pratique. Le formateur : François Pelletier François Pelletier est entrepreneur du numérique et professionnel de recherche au Groupe de recherche en physique médicale de l’Université Laval. Il détient une maîtrise en actuariat (2014) et a suivi le microprogramme en systèmes logiciels intelligents (2019). Ses intérêts portent sur les enjeux de protection des données personnelles, les impacts sociaux des technologies numériques, ainsi que l’exploitation de la puissance de calcul locale dans le cadre de l’inférence d’apprentissage automatique, notamment pour les modèles de langage.