Actualités & Tendances IA

Indexer des plans techniques dans un RAG industriel : les 4 étapes

Cartouche et nomenclature extraits comme des données, découpage par zones, rattachement à la révision, jeu de test. Les quatre étapes qui empêchent un RAG industriel de citer un plan périmé.

Tristan Dumas
Tristan Dumas

Consultant senior IA & automatisation, JUWA

27 août 2026 · maj le 29 août 20266 min de lecture
Indexer des plans techniques dans un RAG industriel : les 4 étapes

Résumer avec

Indexer des plans techniques dans un RAG industriel demande quatre opérations que l'indexation de documents bureautiques ne demande pas : extraire le cartouche et les nomenclatures comme des données, découper la page en zones qui gardent leur sens, rattacher chaque segment à sa révision, et filtrer les versions périmées à la recherche. Sans ces quatre étapes, l'assistant répond avec assurance à partir d'un plan obsolète, ce qui est pire qu'aucune réponse. Chaque étape est détaillée ici, avec ce qu'elle a donné chez une PME industrielle où le temps de recherche du SAV a baissé de 55 %.

Pourquoi un plan n'est pas un document comme les autres

Un RAG classique découpe un texte en passages, calcule un vecteur par passage et retrouve les passages proches d'une question pour les donner au modèle, selon l'architecture décrite par Lewis et al. (2020). Un plan technique casse ce schéma. Le texte y est rare et dispersé : un cartouche avec le numéro de plan, l'indice de révision, la date et le dessinateur ; des cotes attachées à des traits ; une nomenclature en tableau ; des renvois vers d'autres plans. Lu comme un texte linéaire, le plan devient une suite de nombres sans contexte.

Le benchmark OmniDocBench confirme que les tableaux complexes et les mises en page non linéaires restent les cas où les outils d'analyse de PDF se trompent le plus. Ce sont exactement les deux composantes d'un plan. La préparation doit donc être pensée pour ce format, pas héritée d'un projet sur des notices.

Vignette de la vidéo IBM Technology expliquant le RAGWhat is Retrieval-Augmented Generation (RAG)?IBM TechnologyLa lecture charge le lecteur YouTube, qui peut déposer des traceurs.

Résumé de la vidéo (7 min, en anglais) : IBM Technology explique le mécanisme du RAG, pourquoi il réduit les réponses inventées et pourquoi la qualité dépend d'abord de ce qui est indexé.

Étape 1 : extraire le cartouche et la nomenclature comme des données

Le cartouche est la carte d'identité du plan. Numéro, indice, date, projet, ensemble, auteur : ces champs doivent être extraits en données structurées et non noyés dans le texte, car ce sont eux qui serviront de filtres. Un modèle multimodal, comme l'API Document AI de Mistral, lit un cartouche à position variable là où un OCR à gabarit fixe échoue dès que le format de la feuille change.

La nomenclature (repère, désignation, quantité, matière, référence fournisseur) se traite comme un tableau : chaque ligne devient un enregistrement lié au numéro de plan. C'est ce qui permet ensuite de répondre à « quelle référence pour le repère 12 de l'ensemble X », une question qu'aucun découpage textuel ne sait servir. Le guide sur l'préparation d'une base documentaire pour un RAG couvre le socle commun ; cette étape en est la spécialisation pour les plans.

Magasinier consultant une fiche technique devant des palettes dans un entrepôt industriel

Étape 2 : découper par zones, pas par nombre de caractères

Le découpage à taille fixe (500 caractères, puis les 500 suivants) coupe une nomenclature au milieu d'une ligne et sépare une cote de la pièce qu'elle décrit. Pour un plan, le segment naturel est la zone : cartouche, nomenclature, chaque vue, chaque note de fabrication. Chaque zone devient un segment, préfixé par le numéro et l'indice du plan et par le type de zone (« Note de fabrication, plan 4521-B »), afin que le modèle sache d'où vient ce qu'il lit.

La structure parent-enfant complète ce découpage : on retrouve un segment fin (la note), et on fournit au modèle le contexte du parent (la vue, ou une synthèse du plan entier). C'est ce qui évite qu'une tolérance soit citée sans la pièce et le procédé auxquels elle s'applique.

Étape 3 : rattacher chaque segment à sa révision

C'est l'étape qui distingue un RAG industriel sûr d'un RAG dangereux. Deux indices d'un même plan coexistent presque toujours dans l'archive : l'ancien, encore référencé par des commandes en cours, et le nouveau. Si les deux sont indexés sans distinction, l'assistant cite l'un ou l'autre selon la formulation de la question. Chaque segment porte donc l'indice et la date de révision en métadonnée, et le statut du plan (en vigueur, remplacé, annulé) est synchronisé depuis la GED ou le PLM à chaque mise à jour.

Le contrôle se fait à la recherche : par défaut, seuls les segments en vigueur sont retournés ; l'historique reste accessible sur demande explicite (« que disait l'indice A »), avec la mention du statut dans la réponse. Une réponse qui cite une cote doit toujours indiquer le plan et l'indice d'où elle vient.

Étape 4 : mesurer avant d'ouvrir aux opérateurs

Un jeu de test de cinquante à cent questions réelles, avec la réponse attendue et le plan source, est écrit avec le bureau d'études et la maintenance avant l'ouverture. Il sert à mesurer la précision de la récupération (le bon segment est-il dans les résultats), la justesse des réponses et le taux de citations vers un plan périmé, qui doit être nul. Les métriques d'évaluation d'un RAG décrivent comment construire ce jeu et quoi mesurer ; sans lui, on ne sait pas si le découpage par zones a servi à quelque chose.

ÉtapeCe qu'on produitErreur évitéePart de l'effort
Extraction du cartouche et de la nomenclatureChamps structurés par plan, une ligne par repèreNuméro de plan et références perdus dans le texte30 %
Découpage par zonesUn segment par zone, préfixé et rattaché à son parentCote séparée de sa pièce, nomenclature coupée25 %
Rattachement à la révisionIndice, date et statut en métadonnées, filtre par défautRéponse à partir d'un plan remplacé25 %
Jeu de test et mesure50 à 100 questions avec plan sourceOuverture sans preuve de fiabilité20 %

Ce que ça a donné chez une PME industrielle

Une PME industrielle centenaire disposait de 2 000 documents techniques : notices, schémas, historiques de réparation, accumulés sur plusieurs décennies et plusieurs formats. JUWA les a préparés selon les quatre étapes ci-dessus et indexés dans un assistant documentaire hébergé en France. Le temps de recherche du SAV a baissé de 55 %. La part la plus longue du projet n'a pas été le modèle mais le tri : retirer les versions périmées et reconstituer, pour les documents les plus anciens, un cartouche qui n'existait que sur papier.

Le même besoin ressort dans un autre contexte industriel, l'audit IA d'un opérateur de consignes automatisées : 6 000 machines à maintenir, une documentation dispersée, et une feuille de route où l'accès des techniciens à la bonne version de la procédure figure parmi les premiers chantiers chiffrés. La Direction générale des Entreprises range d'ailleurs la recherche intelligente sur documentation technique parmi les cas d'usage IA les plus rentables pour une PME dans son guide France Num.

Les trois raccourcis qui coûtent cher

Indexer l'archive entière sans trier, parce que « le modèle fera le tri » : il ne le fait pas, il mélange. Découper avec le même outil que pour les contrats et les notices, sans traitement du cartouche : le numéro de plan disparaît, et avec lui toute possibilité de citer la source. Ouvrir l'assistant sans jeu de test, sur la foi d'une démonstration réussie sur trois questions : les opérateurs découvrent les réponses fausses en atelier, et ne reviennent plus.

La méthode JUWA sur un fonds de plans

Le cadrage part d'un échantillon de cinquante plans représentatifs, les plus anciens et les plus abîmés compris, et de la liste des questions que se posent réellement le SAV, la maintenance et le bureau d'études. JUWA mesure sur cet échantillon la qualité d'extraction du cartouche et de la nomenclature, fixe le découpage par zones, branche la synchronisation des statuts depuis la GED ou le PLM, puis construit le jeu de test avec les équipes. L'assistant n'est ouvert qu'une fois le taux de citation de plans périmés à zéro sur ce jeu. C'est la méthode appliquée à chaque projet IA en industrie accompagné par JUWA, de la documentation technique à la maintenance.

FAQ

Questions fréquentes

L'essentiel de cet article, repris en questions-réponses.

Parce que le texte y est rare et dispersé : cartouche, cotes attachées à des traits, nomenclature en tableau, renvois. Lu comme un texte linéaire, le plan devient une suite de nombres sans contexte. Il faut extraire le cartouche et la nomenclature comme des données et découper par zones.

En portant l'indice, la date et le statut de chaque plan en métadonnées, synchronisés depuis la GED ou le PLM, et en ne retournant par défaut que les segments en vigueur. Toute réponse qui cite une cote indique le plan et l'indice d'origine.

Cinquante à cent questions réelles avec la réponse attendue et le plan source, écrites avec le bureau d'études et la maintenance. Le taux de citation de plans périmés doit être nul avant l'ouverture aux opérateurs.

Chez une PME industrielle, 2 000 documents techniques indexés dans un assistant hébergé en France ont réduit de 55 % le temps de recherche du SAV. La part la plus longue du projet a été le tri des versions périmées, pas le modèle.

Partager

Heineken
BlaBlaCar
DataBird
HelloSafe

Un projet IA en tête ? Parlons-en