Petit cours — Les technologies RAG appliquées à nos 11 projets
Support technique destiné à l'équipe et aux clients. Explique les briques du Retrieval-Augmented Generation (RAG) et leur usage dans chacun des 11 projets pilotes.
1. Pourquoi le RAG en maintenance industrielle ?
Les grands modèles de langage (LLM) savent rédiger, mais ils hallucinent quand on les interroge sur des faits précis, et ils ne connaissent ni vos procédures internes, ni vos schémas, ni votre historique GMAO. En maintenance GMP, une réponse approximative sur un couple de serrage, une purge ou une température de stérilisation est inacceptable.
Le RAG résout ce problème : au lieu de laisser le modèle répondre de mémoire, on lui fournit, à chaque question, les documents pertinents récupérés dans un corpus maîtrisé, et on l'oblige à répondre en citant la source.
Trois propriétés rendent le RAG indispensable pour nos cas d'usage :
- Ancrage factuel : la réponse est fondée sur vos documents, pas sur la mémoire du modèle.
- Citation & traçabilité : chaque affirmation est rattachée à un paragraphe d'origine — exigence GMP et 21 CFR Part 11.
- Souveraineté : le corpus et le modèle restent sur votre infrastructure, sans fuite vers des API publiques.
2. Anatomie d'un pipeline RAG
Un pipeline RAG se compose de deux phases : l'indexation (hors ligne) et la requête (en ligne).
Indexation (hors ligne) :
documents → parsing → chunking → embeddings → vector store (+ index BM25)
Requête (en ligne) :
question → (réécriture) → retrieval hybride → reranking → contexte
→ LLM + citation → réponse vérifiée
2.1 Ingestion & parsing
Les documents industriels sont hétérogènes : PDF scannés, tableaux techniques, P&ID, manuels constructeurs, SOP. On extrait le texte par OCR haute précision et on préserve la structure (titres, sections, tableaux).
- Piège : un OCR médiocre sur un paramètre critique (ex. « 121 °C » lu « 12,1 °C ») est dangereux. Le parsing doit être validé par un expert métier.
2.2 Chunking (découpage)
On découpe le document en segments sémantiques pour l'indexation. Stratégies :
- Fixe (ex. 500 caractères) : simple, mais coupe les phrases.
- Par section / sous-chapitre : préféré pour les SOP et manuels (découpage hiérarchique).
- Avec chevauchement : évite de perdre le contexte aux frontières.
Bon chunking = réponses précises. Un chunk trop grand dilue la pertinence ; trop petit casse le contexte.
2.3 Embeddings (vectorisation)
Chaque chunk est converti en un vecteur numérique qui capture son sens. Deux textes proches ont des vecteurs proches (similarité cosinus).
- Modèles : multilingual-e5, bge-m3 (bons en français/technique).
- Usage transversal : les mêmes embeddings servent au RAG (PRJ-04), à la déduplication sémantique des pièces MRO (PRJ-01) et à la classification hiérarchique des actifs (PRJ-11).
2.4 Vector store (index)
Les vecteurs sont stockés dans une base spécialisée qui permet la recherche par similarité rapide (HNSW).
- Choix : Qdrant, pgvector (embarqué ou dédié).
- Critère : faible latence, filtres de métadonnées (version du document, site, équipement) indispensables en environnement validé.
2.5 Retrieval hybride (dense + BM25)
La recherche lexicale (BM25) trouve les termes exacts (codes, références) ; la recherche dense (vectorielle) trouve les synonymes et reformulations. L'hybride combine les deux et améliore nettement le rappel.
- Pourquoi : « comment régler le capteur de fin de course » doit retrouver « détection position fin de course » même sans mot commun exact.
2.6 Reranking (re-classement)
Après la récupération d'un top-k de candidats, un cross-encoder re-classe les résultats par pertinence fine. C'est ce qui fait passer le bon paragraphe en tête et réduit les hallucinations.
- Modèles : bge-reranker, cross-encoder léger.
2.7 Génération & citation
Le LLM reçoit la question + les chunks retenus, et doit répondre uniquement à partir de ce contexte, en citant le paragraphe d'origine.
- Prompt de cadrage strict : interdiction d'extrapoler ; « si l'information n'est pas dans le contexte, dis-le ».
- Citation obligatoire : chaque réponse cite la source (document, section, version).
2.8 Garde-fous anti-hallucination
- Règles métier bloquantes : seuils critiques (températures, pressions, couples) vérifiés avant restitution.
- Validation humaine : aucune décision autonome — l'assistant propose, l'expert valide.
- Vérification de citation : contrôle que chaque affirmation renvoie à un passage existant.
3. Niveaux de maturité RAG
- RAG naïf : retrieval + génération simple. Suffisant pour un prototype.
- RAG avancé : réécriture de requête, retrieval hybride + reranking, chunking hiérarchique, filtres de métadonnées. C'est notre niveau de base en production.
- RAG agentique : le modèle peut appeler des outils (rechercher, requêter la GMAO, extraire une table) en plusieurs étapes. Réservé aux cas complexes (diagnostic, CAPA).
RAG vs fine-tuning : le fine-tuning apprend un style, pas des faits. Pour une base documentaire qui évolue (SOP versionnées), le RAG est le bon choix — la mise à jour du corpus met à jour les réponses sans ré-entraînement.
4. Évaluer un RAG
- Récupération : recall@k, MRR, nDCG — le bon passage est-il retrouvé ?
- Génération : fidélité (la réponse colle-t-elle au contexte ?), pertinence, taux de citation.
- Anti-hallucination : sur un jeu de questions pièges, zéro réponse inventée.
Un corpus de questions pièges signées par l'expert métier est notre baromètre de validation (cf. PRJ-04).
5. Déploiement souverain & matériel
Le RAG industriel se déploie en local ou cloud privé qualifié :
| Palier | Configuration | Usage |
|---|---|---|
| Tier 0 — PoV | 1 GPU 16 Go · 32 Go RAM · 500 Go NVMe | 1 site, < 100 SOP |
| Tier 1 — Prod | 1 GPU 24 Go · 64 Go RAM · 1 To NVMe | 1 site, + transcription vocale |
| Tier 2 — Multi-sites | 1–2 GPU 48 Go · 128 Go RAM · 2 To NVMe | LLM 13B–70B, haute dispo |
Embeddings et reranker tournent sur CPU ; le LLM (7B–13B quantifié) et Whisper (voix) consomment la VRAM GPU.
6. Cartographie RAG ↔ 11 projets
Tous les projets ne sont pas du RAG génératif : certains utilisent le même socle vectoriel/NLP sans génération.
| Projet | Brique(s) RAG/NLP utilisée(s) | Nature |
|---|---|---|
| 01 — MRO | Embeddings + similarité cosinus (L2) | Socle vectoriel (pas de génération) |
| 02 — Causes racines | NER + classification multi-labels | NLP supervisé |
| 03 — Intervalles préventif | (aucune — fiabilité Weibull) | Statistique |
| 04 — Assistant SOP/GMP | RAG complet : parsing, chunking, hybride, reranking, citation, garde-fous | RAG génératif |
| 05 — HVAC prédictif | (aucune — séries temporelles) | Détection d'anomalies |
| 06 — Arrêts STO | (aucune — graphes + Monte-Carlo) | Optimisation |
| 07 — CAPA / déviations | RAG contextuel + LLM (chronologie, arbre des causes) | RAG + génération assistée |
| 08 — Obsolescence CAPEX | (aucune — modèle multicritère) | Scoring |
| 09 — Dispatching OT | (aucune — solveur sous contraintes) | Optimisation |
| 10 — Énergie | (aucune — séries temporelles) | Détection d'anomalies |
| 11 — Master Data | Embeddings + classification hiérarchique | NLP supervisé |
Lecture : le RAG génératif est au cœur de PRJ-04 et PRJ-07 (et de l'offre « Assistant d'atelier ») ; les embeddings sont un socle réutilisable par PRJ-01, PRJ-02, PRJ-04 et PRJ-11.
7. Bonnes pratiques & pièges
- Valider l'OCR sur les paramètres critiques avant toute indexation.
- Versionner le corpus : en GMP, répondre à partir d'une SOP périmée est une non-conformité.
- Filtrer par métadonnées (site, équipement, version) plutôt que de tout mélanger.
- Toujours citer et toujours soumettre à validation humaine les réponses critiques.
- Ne pas surdimensionner le LLM : un 7B–13B quantifié, bien ancré par RAG, suffit souvent.
8. Mini-glossaire RAG
- BM25 : fonction de scoring de recherche lexicale.
- Chunking : découpage d'un document en segments sémantiques.
- Embedding : représentation vectorielle du texte.
- Hybride : combinaison recherche lexicale + vectorielle.
- LLM : grand modèle de langage.
- NER : reconnaissance d'entités nommées.
- RAG : génération augmentée par récupération.
- Reranking : re-classement des résultats par pertinence.
- Vector store : base de données de vecteurs.
- Whisper : modèle de transcription audio on-premise.