Petit cours — Les technologies RAG appliquées à nos 11 projets

Support technique destiné à l'équipe et aux clients. Explique les briques du Retrieval-Augmented Generation (RAG) et leur usage dans chacun des 11 projets pilotes.

1. Pourquoi le RAG en maintenance industrielle ?

Les grands modèles de langage (LLM) savent rédiger, mais ils hallucinent quand on les interroge sur des faits précis, et ils ne connaissent ni vos procédures internes, ni vos schémas, ni votre historique GMAO. En maintenance GMP, une réponse approximative sur un couple de serrage, une purge ou une température de stérilisation est inacceptable.

Le RAG résout ce problème : au lieu de laisser le modèle répondre de mémoire, on lui fournit, à chaque question, les documents pertinents récupérés dans un corpus maîtrisé, et on l'oblige à répondre en citant la source.

Trois propriétés rendent le RAG indispensable pour nos cas d'usage :

  1. Ancrage factuel : la réponse est fondée sur vos documents, pas sur la mémoire du modèle.
  2. Citation & traçabilité : chaque affirmation est rattachée à un paragraphe d'origine — exigence GMP et 21 CFR Part 11.
  3. Souveraineté : le corpus et le modèle restent sur votre infrastructure, sans fuite vers des API publiques.

2. Anatomie d'un pipeline RAG

Un pipeline RAG se compose de deux phases : l'indexation (hors ligne) et la requête (en ligne).

Indexation (hors ligne) :
  documents → parsing → chunking → embeddings → vector store (+ index BM25)

Requête (en ligne) :
  question → (réécriture) → retrieval hybride → reranking → contexte
          → LLM + citation → réponse vérifiée

2.1 Ingestion & parsing

Les documents industriels sont hétérogènes : PDF scannés, tableaux techniques, P&ID, manuels constructeurs, SOP. On extrait le texte par OCR haute précision et on préserve la structure (titres, sections, tableaux).

2.2 Chunking (découpage)

On découpe le document en segments sémantiques pour l'indexation. Stratégies :

Bon chunking = réponses précises. Un chunk trop grand dilue la pertinence ; trop petit casse le contexte.

2.3 Embeddings (vectorisation)

Chaque chunk est converti en un vecteur numérique qui capture son sens. Deux textes proches ont des vecteurs proches (similarité cosinus).

2.4 Vector store (index)

Les vecteurs sont stockés dans une base spécialisée qui permet la recherche par similarité rapide (HNSW).

2.5 Retrieval hybride (dense + BM25)

La recherche lexicale (BM25) trouve les termes exacts (codes, références) ; la recherche dense (vectorielle) trouve les synonymes et reformulations. L'hybride combine les deux et améliore nettement le rappel.

2.6 Reranking (re-classement)

Après la récupération d'un top-k de candidats, un cross-encoder re-classe les résultats par pertinence fine. C'est ce qui fait passer le bon paragraphe en tête et réduit les hallucinations.

2.7 Génération & citation

Le LLM reçoit la question + les chunks retenus, et doit répondre uniquement à partir de ce contexte, en citant le paragraphe d'origine.

2.8 Garde-fous anti-hallucination

3. Niveaux de maturité RAG

  1. RAG naïf : retrieval + génération simple. Suffisant pour un prototype.
  2. RAG avancé : réécriture de requête, retrieval hybride + reranking, chunking hiérarchique, filtres de métadonnées. C'est notre niveau de base en production.
  3. RAG agentique : le modèle peut appeler des outils (rechercher, requêter la GMAO, extraire une table) en plusieurs étapes. Réservé aux cas complexes (diagnostic, CAPA).

RAG vs fine-tuning : le fine-tuning apprend un style, pas des faits. Pour une base documentaire qui évolue (SOP versionnées), le RAG est le bon choix — la mise à jour du corpus met à jour les réponses sans ré-entraînement.

4. Évaluer un RAG

Un corpus de questions pièges signées par l'expert métier est notre baromètre de validation (cf. PRJ-04).

5. Déploiement souverain & matériel

Le RAG industriel se déploie en local ou cloud privé qualifié :

Palier Configuration Usage
Tier 0 — PoV 1 GPU 16 Go · 32 Go RAM · 500 Go NVMe 1 site, < 100 SOP
Tier 1 — Prod 1 GPU 24 Go · 64 Go RAM · 1 To NVMe 1 site, + transcription vocale
Tier 2 — Multi-sites 1–2 GPU 48 Go · 128 Go RAM · 2 To NVMe LLM 13B–70B, haute dispo

Embeddings et reranker tournent sur CPU ; le LLM (7B–13B quantifié) et Whisper (voix) consomment la VRAM GPU.

6. Cartographie RAG ↔ 11 projets

Tous les projets ne sont pas du RAG génératif : certains utilisent le même socle vectoriel/NLP sans génération.

Projet Brique(s) RAG/NLP utilisée(s) Nature
01 — MRO Embeddings + similarité cosinus (L2) Socle vectoriel (pas de génération)
02 — Causes racines NER + classification multi-labels NLP supervisé
03 — Intervalles préventif (aucune — fiabilité Weibull) Statistique
04 — Assistant SOP/GMP RAG complet : parsing, chunking, hybride, reranking, citation, garde-fous RAG génératif
05 — HVAC prédictif (aucune — séries temporelles) Détection d'anomalies
06 — Arrêts STO (aucune — graphes + Monte-Carlo) Optimisation
07 — CAPA / déviations RAG contextuel + LLM (chronologie, arbre des causes) RAG + génération assistée
08 — Obsolescence CAPEX (aucune — modèle multicritère) Scoring
09 — Dispatching OT (aucune — solveur sous contraintes) Optimisation
10 — Énergie (aucune — séries temporelles) Détection d'anomalies
11 — Master Data Embeddings + classification hiérarchique NLP supervisé

Lecture : le RAG génératif est au cœur de PRJ-04 et PRJ-07 (et de l'offre « Assistant d'atelier ») ; les embeddings sont un socle réutilisable par PRJ-01, PRJ-02, PRJ-04 et PRJ-11.

7. Bonnes pratiques & pièges

8. Mini-glossaire RAG