Mesurer l'Expérience IA avec le Framework TRUE
Mesurer l'Expérience IA avec le Framework TRUE
Le NPS vous dit si quelqu'un recommanderait votre produit. Il n'a pas été conçu en pensant à l'IA conversationnelle, et ne capture pas ce qui compte réellement dans une expérience IA : l'agent a-t-il compris la demande, a-t-il résolu le problème, est-ce que ça valait l'effort. C'est cet écart que TRUE est construit pour combler.
Cet article couvre ce que mesure TRUE, comment il est capturé, et comment l'utiliser.
Ce que signifie TRUE
TRUE note une expérience IA sur quatre dimensions :
- Trust (confiance) : l'utilisateur fait-il confiance à ce que l'agent lui dit ?
- Resolution (résolution) : l'agent a-t-il réellement résolu ce pour quoi l'utilisateur est venu ?
- Usefulness (utilité) : l'interaction était-elle réellement utile, au-delà du simple "il a répondu quelque chose" ?
- Effort : quel effort l'utilisateur a-t-il dû fournir pour y arriver ?
Pensez à TRUE comme l'équivalent stratégique du NPS, mais construit spécifiquement pour l'IA. Là où le NPS interroge la relation avec votre produit dans son ensemble, TRUE interroge la qualité d'une interaction IA spécifique, sur les dimensions qui prédisent réellement si quelqu'un continuera à l'utiliser.
Comment TRUE est mesuré
TRUE n'est pas juste une question de survey. Il est construit en combinant trois sources de signal :
- Analyse de conversation : ce qui s'est réellement passé dans l'échange entre l'utilisateur et votre agent (c'est la même donnée sous-jacente qui alimente Agent Analysis).
- Micro-surveys contextuels : des questions courtes et ciblées posées juste après une interaction IA, pendant qu'elle est encore fraîche, la même logique "à chaud" qui s'applique au CSAT et au CES.
- Données comportementales : ce que l'utilisateur a fait ensuite. Est-il revenu ? A-t-il converti ? A-t-il abandonné le flux ?
Comme ces micro-surveys peuvent être liés à des métadonnées comme la version du modèle et la version du prompt, vous pouvez scorer TRUE par version et comparer directement, par exemple vérifier si le Prompt v2.0 score plus haut sur la Resolution que le Prompt v1.5, avant de le déployer à tout le monde.
Pourquoi c'est plus actionnable qu'un score de satisfaction unique
Un chiffre de satisfaction global unique vous dit que quelque chose ne va pas. TRUE vous dit quelle dimension ne va pas, et cette distinction change ce que vous faites ensuite :
- Un Trust faible mais une Resolution élevée pointe souvent vers un problème de transparence : l'agent résout la tâche, mais ne s'explique pas d'une façon que les utilisateurs croient.
- Un Trust élevé mais une Resolution faible pointe souvent vers un problème de scope : l'agent est crédible, mais pas réellement capable de terminer ce dont l'utilisateur a besoin.
- Un score d'Effort faible (signifiant un effort élevé requis) associé à une Resolution élevée peut pointer vers un problème UX dans la façon dont l'agent arrive à la réponse, pas un problème de capacité.
C'est un correctif fondamentalement différent à chaque fois, et un score mélangé unique masquerait les trois.
Où l'utiliser
Comme TRUE se rattache aux métadonnées de modèle et de prompt, il est le plus utile dans quelques situations récurrentes :
- Comparer des versions de modèle avant une migration (par exemple, évaluer un modèle plus récent face à votre modèle actuel sur la Resolution et le Trust avant de basculer).
- Tester en A/B des changements de prompt et confirmer qu'une amélioration est réelle, pas juste anecdotique.
- Suivre le score TRUE d'un agent dans le temps comme métrique de santé, de la même façon que vous suivriez le NPS trimestre après trimestre.
Vous pouvez aussi associer les réponses TRUE au Session Replay et aux Heatmaps pour voir exactement ce que l'utilisateur faisait dans les moments autour de sa réponse, ajoutant du contexte comportemental au score lui-même.
Checklist rapide
- Est-ce que je compare TRUE par version de modèle ou de prompt, plutôt que de regarder juste un chiffre mélangé ?
- Ai-je identifié quelle dimension spécifique (Trust, Resolution, Usefulness, Effort) est à l'origine d'un score bas, plutôt que de la traiter comme un problème unique et indifférencié ?
- Est-ce suivi dans le temps, de la même façon que je suivrais le NPS, plutôt que comme une vérification ponctuelle ?
- Ai-je croisé un score bas avec le Session Replay ou les Heatmaps pour du contexte comportemental ?
Mis à jour le : 14/08/2026
Merci !
