Tester les systèmes d'IA générative
Tester un système d'IA générative, là où les méthodes classiques ne suffisent plus.
Un système fondé sur un modèle de langage ne se teste pas comme une application classique : il n'est pas déterministe. Cette formation apporte les techniques d'évaluation adaptées : détection des hallucinations, tests d'injection de prompt, jeux d'évaluation réutilisables et mise en place de garde-fous.
- Durée
- 2 jours (14 heures)
- Modalités
- Présentiel, Distanciel synchrone, Hybride
- Prochaine session
- 20 nov. 2026 → 23 nov. 2026
- Prix
- 1 600 € HT
Objectifs pédagogiques
- Définir la qualité attendue d'une réponse
- Construire un jeu d'évaluation représentatif
- Détecter les hallucinations et tester la robustesse
- Mettre en place des garde-fous et les surveiller
Public visé
Testeurs et ingénieurs qualité confrontés à des projets IA, développeurs de solutions à base de LLM, responsables qualité et conformité
Prérequis
Fondamentaux du test logiciel ; avoir déjà utilisé une IA générative en contexte professionnel
En bref
- Niveau
- Intermédiaire
- Durée
- 2 jours (14 heures)
- Prix
- 1 600 € HT
- Modalités pédagogiques
- Présentiel, Distanciel synchrone, Hybride
- Formats
- Inter-entreprises, Intra-entreprise
- Langue
- Français
- Lieux
- Versailles, La Défense (Tour Canopy), Clermont-Ferrand
- Effectif
- De 2 à 12 participants
Programme détaillé
Un assistant documentaire mis à disposition sert de cas fil rouge. Les participants construisent progressivement son dispositif d’évaluation à partir de documents, de requêtes et de scripts fournis.
Module 1 – Les particularités du test des systèmes d’IA générative
- Variabilité des réponses et limites des comparaisons fondées sur un résultat unique.
- Périmètre du système testé : modèle, instructions, documents, outils et interface applicative.
- Différences entre anomalie logicielle, réponse incorrecte et comportement inadapté au contexte.
- Conditions d’une campagne comparable : configuration, versions et répétition des essais.
Analyse guidée : Comparer plusieurs réponses à une même demande et distinguer les variations acceptables des défauts à signaler.
Module 2 – Les critères de qualité et les résultats attendus
- Pertinence de la réponse, exactitude factuelle et fidélité aux documents de référence.
- Respect des consignes, du format demandé, du ton et du périmètre d’utilisation.
- Réponses attendues face à une demande ambiguë, à une information manquante ou à une question hors périmètre.
- Grilles d’appréciation, niveaux de gravité et seuils d’acceptation liés aux usages métier.
Module 3 – Le jeu d’évaluation et sa maintenance
- Requêtes représentatives des usages : cas courants, cas limites et situations à risque.
- Réponses de référence, sources justificatives et critères associés à chaque cas.
- Séparation des exemples utilisés pour ajuster le système et des cas réservés à son évaluation.
- Versionnement du jeu d’évaluation et enrichissement à partir des incidents rencontrés.
Atelier : Constituer un premier jeu d’évaluation et expliciter les critères permettant de juger les réponses de l’assistant.
Module 4 – Les hallucinations et les méthodes d’évaluation
- Affirmations non étayées, références inventées et citations qui ne soutiennent pas la réponse.
- Contrôles automatiques des formats et vérification des affirmations à partir des sources.
- Évaluation humaine et recours à un modèle évaluateur : apports, biais et désaccords.
- Comparaison des appréciations automatiques avec un échantillon relu par des évaluateurs humains.
Travaux pratiques : Évaluer un ensemble de réponses, repérer les erreurs factuelles et confronter les résultats d’un contrôle automatique à une revue humaine.
Module 5 – La robustesse face aux entrées à risque
- Injections de prompt directes et instructions malveillantes présentes dans des documents.
- Contournement des consignes, demandes hors périmètre et tentatives de divulgation d’informations.
- Effets des entrées ambiguës, contradictoires ou inhabituelles sur le comportement du système.
- Scénarios de test documentés, preuves observables et qualification des incidents.
Mise en situation : Exécuter des scénarios adverses dans l’environnement fourni, avec des données fictives, et consigner les comportements observés.
Module 6 – L’évaluation d’un dispositif RAG
- Qualité de la recherche documentaire : présence des sources utiles et pertinence des passages sélectionnés.
- Qualité de la réponse : fidélité au contexte, couverture de la question et exactitude des citations.
- Diagnostic des erreurs liées au corpus, à la recherche ou à la génération.
- Comportement attendu lorsque les sources sont absentes, périmées ou contradictoires.
Module 7 – Les garde-fous et leurs limites
- Contrôles des entrées et des sorties, restrictions d’accès et validation des formats.
- Refus, demande de précision et recours à une validation humaine.
- Faux positifs et faux négatifs : demandes légitimes bloquées et réponses inadaptées autorisées.
- Défense en profondeur et limites des protections fondées uniquement sur les instructions du modèle.
Expérimentation : Comparer le comportement de l’assistant avant et après l’ajout de garde-fous, y compris sur des demandes légitimes.
Module 8 – Les campagnes de régression et le suivi de la qualité
- Exécution reproductible des évaluations après un changement de modèle, d’instructions ou de corpus.
- Rapports comparatifs, seuils d’alerte et analyse des régressions.
- Suivi conjoint de la qualité, de la latence et du coût des réponses.
- Traçabilité des configurations, traitement des incidents et décisions de mise en service.
Restitution : Présenter le bilan d’évaluation du cas fil rouge et argumenter les corrections prioritaires ainsi que les conditions de mise en service.
Méthodes pédagogiques
Alternance d'apports et de pratique sur poste ; un cas fil rouge traverse la formation ; les participants travaillent sur une application réelle mise à disposition ; supports et scripts produits remis en fin de session
Modalités d'évaluation
Test de positionnement en amont ; exercices évalués à chaque étape du cas fil rouge ; restitution finale des livrables produits ; attestation de fin de formation
Formateur
Formateur expert
Cette formation est animée par l'un de nos formateurs experts du domaine. Nos formateurs sont des praticiens en activité, au sein d'ACENSI, ESN de 2 500 consultants, ou de notre réseau d'experts partenaires : ils interviennent au quotidien sur les sujets qu'ils enseignent, et transmettent des méthodes éprouvées sur des projets réels plutôt que des connaissances théoriques. Chaque intervenant est sélectionné pour son expertise technique, son expérience opérationnelle et ses qualités pédagogiques.
Financement
Cette formation peut être financée par :
- OPCO de votre branche professionnelle, pour les salariés
- Plan de développement des compétences de votre entreprise
- France Travail (AIF), pour les demandeurs d'emploi
- Transitions Pro, dans le cadre d'un projet de reconversion professionnelle
Nous vous accompagnons dans le montage de votre dossier de financement.
Accessibilité
Toutes nos formations sont accessibles aux personnes en situation de handicap. Avant votre inscription, notre référent handicap étudie avec vous vos besoins et les adaptations possibles : aménagement du rythme et des modalités, adaptation des supports, accessibilité des locaux, et recours si nécessaire à des partenaires spécialisés. Nos trois sites sont accessibles aux personnes à mobilité réduite.
Inscription
S'inscrire à la session du 20 nov. 2026 → 23 nov. 2026
Laissez vos coordonnées : un conseiller vous recontacte pour confirmer votre inscription et son financement.
