Aller au contenu
Calibrage qualité

Calibrer les notes IA avec vos propres évaluateurs

Le calibrage qualité consiste à vérifier que tous ceux qui notent les conversations, humains comme logiciel, appliquent la grille de la même façon. Avant de vous fier aux notes IA, faites noter les mêmes conversations par vos évaluateurs et mesurez l'accord, au global et critère par critère. Merivex intègre cette étape.

Étape par étape

Comment calibrer une notation par IA

  1. Constituer un lot de calibrage

    Choisissez des conversations qui couvrent vos principaux motifs de contact, avec de bons, de moyens et de mauvais exemples. Un lot composé uniquement de cas faciles surestime l'accord.

  2. Le faire noter par vos évaluateurs

    Vos évaluateurs notent chaque conversation selon la grille en vigueur, au global et par critère, sans voir les notes IA au préalable.

  3. Importer les notes des évaluateurs

    Dans Merivex, importez un CSV avec une colonne de transcription, une note globale de 0 à 100 et une colonne ref_<critère> pour chaque critère noté, par exemple ref_empathy. Jusqu'à 500 lignes par lot.

  4. Lire l'accord global

    Le rapport indique l'écart moyen entre notes IA et notes des évaluateurs, si l'IA note plutôt plus haut ou plus bas, la part des conversations à moins de 5 et de 10 points, et dans quelle mesure les deux séries évoluent ensemble.

  5. Lire l'accord par critère

    Un bon accord global peut masquer un critère systématiquement décalé. La vue par critère donne l'écart moyen et son sens pour chacun, et le rapport liste les conversations où les notes divergent le plus.

  6. Corriger, puis relancer

    Quand un critère diverge, reformulez sa définition, ajustez la grille ou gardez ce critère en revue humaine. Relancez un lot après chaque changement et comparez.

Ce que mesure le rapport

Les indicateurs de calibrage dans Merivex

Écart moyen

L'écart absolu moyen entre notes IA et notes des évaluateurs, sur une échelle de 0 à 100.

Biais

L'écart moyen signé, qui montre si l'IA note plus haut ou plus bas que vos évaluateurs.

À moins de 5 et 10 points

La part des conversations où notes IA et notes humaines sont proches.

Corrélation

Si les notes IA et humaines montent et descendent ensemble sur le lot.

Par critère

Écart moyen et biais pour chaque critère noté par vos évaluateurs.

Plus forts désaccords

Les conversations où les notes divergent le plus, à revoir côte à côte.

Questions

Le calibrage qualité, en questions

Qu'est-ce que le calibrage qualité en centre de contact ?

C'est la pratique qui consiste à faire noter les mêmes conversations par plusieurs évaluateurs et à comparer les résultats, pour que chacun applique la grille de la même façon. Avec une notation par IA, l'IA est l'un des évaluateurs à calibrer.

Quelle est la précision de Merivex par rapport à des évaluateurs humains ?

Aucun chiffre de précision n'est publié, car aucun n'a été établi de façon indépendante, et l'accord dépend de votre grille et de vos conversations. Le calibrage le mesure sur vos propres données.

Combien de conversations faut-il pour calibrer ?

Assez pour couvrir vos principaux motifs de contact et différents niveaux de qualité. Quelques dizaines révèlent les gros écarts ; quelques centaines donnent une image plus stable par critère. Chaque lot peut contenir jusqu'à 500 conversations.

À quelle fréquence faut-il recalibrer ?

À chaque modification de la grille, et régulièrement, car les conversations et les procédures évoluent. Un nouveau lot peut être lancé à tout moment.

Pour aller plus loin

Mesurez l'accord sur vos propres conversations

Exportez des conversations déjà notées par vos évaluateurs, importez-les avec leurs notes et lisez l'accord critère par critère.