École Hexagone Executive

Tester les systèmes d'IA générative

Tester un système d'IA générative, là où les méthodes classiques ne suffisent plus.

Un système fondé sur un modèle de langage ne se teste pas comme une application classique : il n'est pas déterministe. Cette formation apporte les techniques d'évaluation adaptées : détection des hallucinations, tests d'injection de prompt, jeux d'évaluation réutilisables et mise en place de garde-fous.

Durée
2 jours (14 heures)
Modalités
Présentiel, Distanciel synchrone, Hybride
Prochaine session
20 nov. 2026 → 23 nov. 2026
Prix
1 600 € HT

Objectifs pédagogiques

  • Définir la qualité attendue d'une réponse
  • Construire un jeu d'évaluation représentatif
  • Détecter les hallucinations et tester la robustesse
  • Mettre en place des garde-fous et les surveiller

Public visé

Testeurs et ingénieurs qualité confrontés à des projets IA, développeurs de solutions à base de LLM, responsables qualité et conformité

Prérequis

Fondamentaux du test logiciel ; avoir déjà utilisé une IA générative en contexte professionnel

En bref

Niveau
Intermédiaire
Durée
2 jours (14 heures)
Prix
1 600 € HT
Modalités pédagogiques
Présentiel, Distanciel synchrone, Hybride
Formats
Inter-entreprises, Intra-entreprise
Langue
Français
Lieux
Versailles, La Défense (Tour Canopy), Clermont-Ferrand
Effectif
De 2 à 12 participants

Programme détaillé

Un assistant documentaire mis à disposition sert de cas fil rouge. Les participants construisent progressivement son dispositif d’évaluation à partir de documents, de requêtes et de scripts fournis.

Module 1 – Les particularités du test des systèmes d’IA générative

  • Variabilité des réponses et limites des comparaisons fondées sur un résultat unique.
  • Périmètre du système testé : modèle, instructions, documents, outils et interface applicative.
  • Différences entre anomalie logicielle, réponse incorrecte et comportement inadapté au contexte.
  • Conditions d’une campagne comparable : configuration, versions et répétition des essais.

Analyse guidée : Comparer plusieurs réponses à une même demande et distinguer les variations acceptables des défauts à signaler.

Module 2 – Les critères de qualité et les résultats attendus

  • Pertinence de la réponse, exactitude factuelle et fidélité aux documents de référence.
  • Respect des consignes, du format demandé, du ton et du périmètre d’utilisation.
  • Réponses attendues face à une demande ambiguë, à une information manquante ou à une question hors périmètre.
  • Grilles d’appréciation, niveaux de gravité et seuils d’acceptation liés aux usages métier.

Module 3 – Le jeu d’évaluation et sa maintenance

  • Requêtes représentatives des usages : cas courants, cas limites et situations à risque.
  • Réponses de référence, sources justificatives et critères associés à chaque cas.
  • Séparation des exemples utilisés pour ajuster le système et des cas réservés à son évaluation.
  • Versionnement du jeu d’évaluation et enrichissement à partir des incidents rencontrés.

Atelier : Constituer un premier jeu d’évaluation et expliciter les critères permettant de juger les réponses de l’assistant.

Module 4 – Les hallucinations et les méthodes d’évaluation

  • Affirmations non étayées, références inventées et citations qui ne soutiennent pas la réponse.
  • Contrôles automatiques des formats et vérification des affirmations à partir des sources.
  • Évaluation humaine et recours à un modèle évaluateur : apports, biais et désaccords.
  • Comparaison des appréciations automatiques avec un échantillon relu par des évaluateurs humains.

Travaux pratiques : Évaluer un ensemble de réponses, repérer les erreurs factuelles et confronter les résultats d’un contrôle automatique à une revue humaine.

Module 5 – La robustesse face aux entrées à risque

  • Injections de prompt directes et instructions malveillantes présentes dans des documents.
  • Contournement des consignes, demandes hors périmètre et tentatives de divulgation d’informations.
  • Effets des entrées ambiguës, contradictoires ou inhabituelles sur le comportement du système.
  • Scénarios de test documentés, preuves observables et qualification des incidents.

Mise en situation : Exécuter des scénarios adverses dans l’environnement fourni, avec des données fictives, et consigner les comportements observés.

Module 6 – L’évaluation d’un dispositif RAG

  • Qualité de la recherche documentaire : présence des sources utiles et pertinence des passages sélectionnés.
  • Qualité de la réponse : fidélité au contexte, couverture de la question et exactitude des citations.
  • Diagnostic des erreurs liées au corpus, à la recherche ou à la génération.
  • Comportement attendu lorsque les sources sont absentes, périmées ou contradictoires.

Module 7 – Les garde-fous et leurs limites

  • Contrôles des entrées et des sorties, restrictions d’accès et validation des formats.
  • Refus, demande de précision et recours à une validation humaine.
  • Faux positifs et faux négatifs : demandes légitimes bloquées et réponses inadaptées autorisées.
  • Défense en profondeur et limites des protections fondées uniquement sur les instructions du modèle.

Expérimentation : Comparer le comportement de l’assistant avant et après l’ajout de garde-fous, y compris sur des demandes légitimes.

Module 8 – Les campagnes de régression et le suivi de la qualité

  • Exécution reproductible des évaluations après un changement de modèle, d’instructions ou de corpus.
  • Rapports comparatifs, seuils d’alerte et analyse des régressions.
  • Suivi conjoint de la qualité, de la latence et du coût des réponses.
  • Traçabilité des configurations, traitement des incidents et décisions de mise en service.

Restitution : Présenter le bilan d’évaluation du cas fil rouge et argumenter les corrections prioritaires ainsi que les conditions de mise en service.

Méthodes pédagogiques

Alternance d'apports et de pratique sur poste ; un cas fil rouge traverse la formation ; les participants travaillent sur une application réelle mise à disposition ; supports et scripts produits remis en fin de session

Modalités d'évaluation

Test de positionnement en amont ; exercices évalués à chaque étape du cas fil rouge ; restitution finale des livrables produits ; attestation de fin de formation

Formateur

Formateur expert

Cette formation est animée par l'un de nos formateurs experts du domaine. Nos formateurs sont des praticiens en activité, au sein d'ACENSI, ESN de 2 500 consultants, ou de notre réseau d'experts partenaires : ils interviennent au quotidien sur les sujets qu'ils enseignent, et transmettent des méthodes éprouvées sur des projets réels plutôt que des connaissances théoriques. Chaque intervenant est sélectionné pour son expertise technique, son expérience opérationnelle et ses qualités pédagogiques.

Financement

Cette formation peut être financée par :

  • OPCO de votre branche professionnelle, pour les salariés
  • Plan de développement des compétences de votre entreprise
  • France Travail (AIF), pour les demandeurs d'emploi
  • Transitions Pro, dans le cadre d'un projet de reconversion professionnelle

Nous vous accompagnons dans le montage de votre dossier de financement.

Accessibilité

Toutes nos formations sont accessibles aux personnes en situation de handicap. Avant votre inscription, notre référent handicap étudie avec vous vos besoins et les adaptations possibles : aménagement du rythme et des modalités, adaptation des supports, accessibilité des locaux, et recours si nécessaire à des partenaires spécialisés. Nos trois sites sont accessibles aux personnes à mobilité réduite.

Inscription

S'inscrire à la session du 20 nov. 2026 → 23 nov. 2026

Laissez vos coordonnées : un conseiller vous recontacte pour confirmer votre inscription et son financement.