Démarche qualité

Comment nous mesurons la qualité d’annotation

La qualité est un chiffre sur lequel on peut agir, sinon c’est une opinion. Cette page explique exactement quels chiffres nous produisons, comment ils sont calculés, ce qu’ils peuvent et ne peuvent pas vous dire, et ce que contient le rapport QA livré avec chaque lot.

Tout chiffre présenté sur ce site à titre d’exemple est signalé comme tel. Nous ne publions pas de garanties d’exactitude, car une garantie donnée avant d’avoir vu vos données n’est pas un engagement : c’est un chiffre marketing.

La qualité se conçoit, elle ne s’inspecte pas

Une inspection finale peut rattraper des erreurs. Elle ne peut pas rattraper l’ambiguïté, et c’est l’ambiguïté qui dégrade réellement un jeu de données japonais. Si les consignes autorisent deux lectures d’un cas, les deux passent l’inspection, et l’incohérence arrive dans les données d’entraînement avec un certificat de bonne santé.

Le travail qui détermine la qualité se fait donc avant l’annotation : rédiger les consignes, les mettre en défaut sur de vrais cas limites pendant un pilote, mesurer si des annotateurs indépendants convergent, et corriger les consignes là où ils ne convergent pas. La relecture est la seconde ligne de défense, pas la première.

Ce qui suit est l’ensemble du système, y compris les parties inconfortables à publier — ce que chaque métrique ne capte pas, et les cas où un chiffre peut paraître sain alors que le jeu de données ne l’est pas.

En bref

Mesuré sur
Accord inter-annotateurs, exactitude mesurée sur jeu de référence, taux d’arbitrage et dérive des étiquettes.
Restitué par
Lot, avec un détail par étiquette et par critère plutôt qu’un chiffre global unique.
Profondeur de relecture
Définie par projet. Plus poussée là où un jugement est requis, plus légère là où la tâche est mécanique.
Désaccords
Arbitrés par écrit par un relecteur senior et réintégrés dans les consignes.
Ce que nous ne faisons pas
Publier des garanties d’exactitude, ou citer un chiffre mesuré sur un autre projet.

Le système

Six étapes, en continu

Cette boucle tourne pendant toute la durée d’un projet, et non une seule fois au démarrage.

  1. 01

    Spécifier

    Les consignes sont rédigées avec des exemples travaillés et des contre-exemples pour chaque décision qu’exige la tâche. Tout ce qui reste implicite ici deviendra une incohérence plus tard.

  2. 02

    Calibrer

    Les annotateurs étiquettent indépendamment le même jeu de calibrage. Les divergences signalent où les consignes sont ambiguës — ce sont les consignes qui sont corrigées, pas l’annotateur.

  3. 03

    Annoter

    Travail de production, avec la version des consignes consignée pour chaque item, afin qu’une question ultérieure sur un enregistrement puisse recevoir une réponse précise.

  4. 04

    Relire

    Un second annotateur relit à la profondeur que la tâche justifie. La relecture est un rôle distinct avec ses propres critères, et non une répétition accélérée de l’annotation.

  5. 05

    Arbitrer

    Les désaccords remontent à un relecteur senior, qui consigne la résolution et sa raison. Chaque résolution devient un exemple travaillé dans les consignes.

  6. 06

    Mesurer et réinjecter

    Accord, exactitude sur jeu de référence et dérive sont calculés par lot, comparés aux lots précédents et utilisés pour décider où la prochaine révision des consignes est nécessaire.

Métriques

Ce que chaque chiffre signifie réellement

Défini ici pour qu’un chiffre figurant dans un rapport QA soit interprétable sans avoir à nous demander à quoi il renvoie.

Accord inter-annotateurs
La fréquence à laquelle des annotateurs indépendants produisent la même étiquette sur le même item. Restitué en accord brut accompagné d’un coefficient corrigé du hasard, car l’accord brut sur une taxonomie déséquilibrée peut sembler excellent tout en ne portant presque aucune information.
κ de Cohen / α de Krippendorff
Coefficients d’accord corrigés du hasard. Le κ de Cohen pour deux annotateurs sur des étiquettes catégorielles ; l’α de Krippendorff lorsqu’il y a plus de deux annotateurs, des jugements manquants ou des échelles ordinales. Celui qui est employé est indiqué dans le rapport plutôt que laissé implicite.
Exactitude sur jeu de référence
Exactitude au regard d’un jeu de référence annoté et arbitré par des relecteurs seniors. Elle mesure la justesse et non la cohérence — deux annotateurs peuvent s’accorder parfaitement et se tromper tous les deux, ce que les statistiques d’accord seules ne révéleront jamais.
Taux d’arbitrage
La proportion d’items ayant nécessité l’intervention d’un relecteur senior. Un taux d’arbitrage qui monte est généralement le premier signal que les données ont changé ou que les consignes comportent une lacune, et il bouge avant l’exactitude.
Dérive des étiquettes
Évolution dans le temps de la distribution des étiquettes ou du comportement des annotateurs. Les projets longs dérivent pour des raisons ordinaires — les données sources changent, les annotateurs gagnent en assurance — et le suivi de la dérive est ce qui distingue cela d’une véritable dégradation.
Accord sur les frontières
Pour les tâches par empans, à quel point les annotateurs s’accordent sur le début et la fin d’un empan, restitué séparément de leur accord sur l’étiquette. Un jeu de données japonais par empans peut afficher un excellent accord d’étiquettes et des frontières inutilisables.

Vue d’ensemble de la qualité

Tableau de bord QA (exemple)

Accord

97.8%

2.1% vs 7 jours précédents

Exactitude sur jeu de référence

98.6%

1.4% vs 7 jours précédents

Éléments relus

24826

18.7% cette semaine

Désaccords ouverts

18

12 vs 7 jours précédents

Dérive des annotations (30 jours)

Dérive observée Seuil d’alerte
0%2.5%5% Day 1Day 8Day 15Day 22Day 30

Synthèse qualité

  • Respect des consignes
  • Calibrage des relecteurs
  • Surveillance des valeurs aberrantes
  • Détection de dérive

Interface illustrative. Les chiffres affichés sont des données d’exemple servant à expliquer la façon dont nous suivons la qualité ; il ne s’agit pas de résultats communiqués.

Relecture

Quelle part d’un lot est relue

La profondeur de relecture est un paramètre de projet, convenu avec vous et inscrit au contrat. Une relecture plus lourde ne vaut pas toujours mieux — une tâche mécanique relue à pleine profondeur dépense du budget là où aucun jugement n’est requis.

Configurations de relecture données à titre d’illustration. La profondeur réelle d’un projet est convenue lors du cadrage.
Profondeur de relectureUtilisée en général pourCe qui se passe
Relecture par échantillonTâches mécaniques à fort volume avec un accord stableUne part définie des items est relue ; les échecs déclenchent une passe élargie
Seconde passe intégraleÉtiquetage dépendant du jugement et la plupart des travaux japonais par empansChaque item est relu par un second annotateur
Double annotation à l’aveugleJeux d’évaluation, benchmarks et jeux de référenceDeux annotateurs travaillent indépendamment ; tous les désaccords sont arbitrés
Relecture experteDomaines réglementés et jugement professionnelUn spécialiste métier relit, avec un raisonnement écrit sur les items contestés

Taxonomie d’erreurs

Nommer les défaillances

Un défaut qui porte un nom peut être compté, suivi et corrigé. Un décompte générique d’« erreurs » ne vous dit pas quoi changer.

Lacune des consignes

Le cas n’est pas couvert par les consignes. Se corrige en révisant les consignes, non en corrigeant l’item — sans quoi le même cas se reproduira.

Mauvaise application des consignes

Le cas est couvert et l’annotateur a mal appliqué la règle. Se corrige par un retour et, en cas de récurrence, par un exemple travaillé plus clair.

Erreur de frontière

L’étiquette est bonne, l’empan ne l’est pas. Propre aux travaux japonais par empans, où règles de frontière et tokenisation interagissent.

Erreur de registre ou de nuance

Linguistiquement correct, socialement faux : mauvais niveau de politesse, ou refus trop mou pour se lire comme tel.

Erreur factuelle

Une affirmation vérifiable, une lecture de nom ou un chiffre est faux. Distinguée des erreurs de jugement parce que le remède est la vérification, non le calibrage.

Défaut de la source

L’item lui-même est inexploitable — audio inaudible, scan illisible, prompt ambigu. Signalé et renvoyé, jamais comblé par une supposition plausible.

Restitution

Ce qui accompagne chaque lot

Le rapport est conçu pour que vous puissiez auditer le lot sans nous avoir dans la pièce.

  • Chiffres d’accord par étiquette ou par critère, avec le coefficient employé indiqué explicitement.
  • Exactitude sur jeu de référence pour le lot, et tendance par rapport aux lots précédents.
  • Taux d’arbitrage, avec le journal d’arbitrage et le raisonnement consigné pour chaque résolution.
  • Décomptes d’erreurs ventilés selon la taxonomie ci-dessus, plutôt qu’un total de défauts unique.
  • La version des consignes selon laquelle le lot a été annoté, et un journal des modifications par rapport à la version précédente.
  • Les items signalés comme défauts de la source, listés plutôt que supprimés en silence.

FAQ

À propos de la mesure de la qualité

Questions sur ce que ces chiffres prouvent et ne prouvent pas.

Nous ne publions pas de garantie d’exactitude, et nous accueillerions avec prudence celle de n’importe quel prestataire. L’exactitude atteignable dépend de la tâche, de la taxonomie, de la qualité des données sources et de la part d’ambiguïté réelle que comporte le domaine — rien de tout cela n’est connu avant un pilote. Ce sur quoi nous nous engageons, c’est la méthode de mesure : quelles métriques, calculées comment, restituées à quelle fréquence, et ce qui se passe quand un lot n’est pas au niveau. Après un pilote sur vos données, nous pouvons parler d’objectifs réalistes, car il y a alors quelque chose de réel dont parler.

Ce sont des données d’exemple. Elles existent pour montrer ce que l’interface restitue et à quoi ressemblent les métriques en mouvement, et elles sont accompagnées d’un badge et d’un avertissement visibles exactement pour cette raison. Ce ne sont pas des résultats issus d’un projet client, et nous ne les présenterons pas comme tels.

Pas à lui seul. L’accord mesure la cohérence, pas la justesse — des annotateurs qui partagent le même malentendu s’accordent parfaitement. Il est aussi gonflé par les taxonomies déséquilibrées, raison pour laquelle nous restituons un coefficient corrigé du hasard à côté de l’accord brut, et raison pour laquelle des jeux de référence arbitrés par des relecteurs seniors existent comme contrôle indépendant de la justesse.

Il n’est pas livré. Selon la défaillance, la réponse est une réannotation ciblée, une révision des consignes suivie de la reprise des items concernés, ou une remontée vers vous lorsque la cause est en amont — une taxonomie ambiguë ou des données sources qui ne peuvent pas soutenir la tâche. Nous préférons livrer en retard avec une explication que dans les temps avec un chiffre qui ne survivra pas au contact de votre modèle.

Oui, et c’est une demande raisonnable. Vous pouvez relire les consignes et leur historique de versions, prélever un échantillon pour une notation indépendante et comparer vos constats à nos chiffres. Lorsqu’un client mène sa propre QA en parallèle, nous traitons une divergence entre les deux comme un constat à investiguer plutôt que comme un litige à plaider.

Qualité

Demandez-nous les chiffres sur vos propres données.

Un pilote produit de vrais chiffres d’accord, une vraie ventilation des erreurs et un avis honnête sur les parties de votre taxonomie qui tiendront en volume.

NDA avant tout partage de données. Le cadrage du pilote est gratuit.