Intelligence Artificielle : un outil au service de l'investigation
Abstract
Des informations précieuses se cachent dans des fichiers (Web, PDF, tableaux, formats OpenData...). Leur nombre et leur volume, mais aussi leur diversité de formats rendent l’analyse fastidieuse. ConnectionStudio est un outil permettant d’intégrer de tels fichiers hétérogènes et de les explorer : analyse des entités (personnes, organisations, e-mails...) qui s’y trouvent ; vue schématique des données ; recherche de connexions entre les entités... Un cas d’usage lié aux participations financières des personnalités publiques françaises sera présenté et un second sur les conflits d’intérêt dans le domaine bio-médical.
Full text
Intelligence Artificielle un outil au service de l’investigation Nelly Barret, Madhulika Mohanty Inria Saclay & Institut Polytechnique de Paris
Qui sommes nous ? Nous faisons partie de l’équipe de recherche CEDAR (Rich Data Analytics at Cloud scale) à Inria Saclay. Nelly Barret Doctorante Inria & IPP Simon Ebel Ingénieur recherche Inria Théo Galizzi Ingénieur recherche Inria Ioana Manolescu Chercheure et chef d’équipe Inria & IPP Madhulika Mohanty Post-doctorante Inria
L’équipe CEDAR Données complexes Données hétérogènes Traitements mixtes (DB/ML) Big Data Algorithmes efficaces (temps, complexité) Données à grande échelle Équipe CEDAR
Organisation de l’atelier Scénario ConnectionStudio Problématique & Approche ConclusionContexte
Contexte -Les “faits” proviennent de différentes sources de données, souvent larges et complexes -Les sources sont de formats très variés : -Chaque source vient d’un producteur → pas d’uniformisation ni de schéma -Les données ne sont pas produites en pensant à l'utilisateur final Structurées Semi-structurées Non-structurées - Bases de données - Tables (Excel, CSV) - JSON (Web) - XML (Web) - HTML (Web) - Texte - PDF - RDF (Open Data) - Neo4j (Graphe)
Comment faciliter l’investigation de sources très hétérogènes ? Problématique & approche Les nettoyer ? Les visualiser ? Les requêter ? Les intégrer ?
Comment faciliter l’investigation de sources très hétérogènes ? Problématique & approche ConnectionStudio !
ConnectionStudio ConnectionStudio est un outil qui : - Intègre des données hétérogènes de manière unifiée - Identifie les entités : lieux, personnes, entreprises, … - Permet de visualiser et interagir avec les données
Comment faciliter l’investigation de sources très hétérogènes ? Problématique & approche
Chargement des sources de données - Les données sont modélisées selon le paradigme “graphe”: - Un noeud = une petite portion d’information -Liens pour connecter les noeuds pour reconstituer la sémantique logique du fichier -L’extraction d’entités nommées est appliquée sur chaque noeud valeur -2 modèles linguistiques : Stanford et FLAIR -2 langues : français ou anglais - Les noeuds qui contiennent des informations identiques sont fusionnés → connexions entre les sources
Chargement des sources de données
Introduction aux données : CAC40 Graphe de données correspondant au CSV du CAC40
Visualisation 1 : statistiques Comment avoir une bonne idée des entités détectées ? -Distribution d’entités par types -Nuage des 100 entités les plus fréquentes (tag cloud) -Distribution des types d’entités par fichier -Liste des 100 entités les plus partagées parmi le plus de sources -Tous les graphiques/tableaux sont exportables
Visualisation 1 : statistiques
Visualisation 2 : structure d’un fichier Comment avoir une bonne idée de la structure d’un fichier ? - Une source de données peut être vue comme : - Un ou plusieurs ensembles d’objets similaires - Un ensemble de relations qui les connectent - Résultat : une description orientée utilisateur
Visualisation 2 : structure d’un fichier
Visualisation 2 : structure d’un fichier
SELECT magasin, pays, COUNT(vente) FROM magasins m JOIN ventes v ON m.id=v.magasin WHERE date=‘12/07/2023’ GROUP BY magasin, pays HAVING COUNT(vente) > 1000€ Requête 3 : Requêtes utilisateur -Explorer la base de données sans compétences en SQL -SQL : langage utilisé pour interagir avec une base de données - Syntaxe spécifique à apprendre → bloquant pour les utilisateurs Exemple de requête SQL Comment requêter les données de manière personnalisée ? - Liste de fragments de données (SELECT de SQL) -Interconnectables entre eux de manière personnalisée ( JOIN de SQL) Fragment 1 Fragment 2 Fragment 3
Requête 3 : Requêtes utilisateur
Nettoyage 1 : politiques d’extraction Comment nettoyer et uniformiser les données ? Nettoyage des données semi-automatique : -Nettoyage lors de l’ingestion -Nettoyage par l’utilisateur après chargement Politique d’extraction : association d’un chemin et d’un type d’entité pour aider l’extraction d’entités
Nettoyage 1 : politiques d’extraction
Nettoyage 2 : modification des valeurs Comment nettoyer et uniformiser les données ? Nettoyage des données semi-automatique : -Nettoyage lors de l’ingestion -Nettoyage par l’utilisateur après chargement - Possibilité de nettoyer les valeurs à la main - Modifie les valeurs dans la base de données
Nettoyage 2 : modification des valeurs
Scénario : CAC40 & HATVP -CAC40 : liste des 40 entreprises françaises “les plus influentes” -HATVP : Haute Autorité pour la Transparence de la Vie Publique CAC40 → fichier CSV de 40 lignes HATVP → fichier XML de 1,5 millions de lignes
Scénario : CAC40 & HATVP
Conclusion ConnectionStudio : - intègre des données très hétérogènes de manière unifiée, -en extrait des entités nommées (personnes, lieux, …), -permet d’inspecter, requêter et connecter ses données de différentes façons Site web : https://project.inria.fr/connectionstudio/fr/ Contact : [email protected]