Lacune des consignes
Le cas n’est pas couvert par les consignes. Se corrige en révisant les consignes, non en corrigeant l’item — sans quoi le même cas se reproduira.
Démarche qualité
La qualité est un chiffre sur lequel on peut agir, sinon c’est une opinion. Cette page explique exactement quels chiffres nous produisons, comment ils sont calculés, ce qu’ils peuvent et ne peuvent pas vous dire, et ce que contient le rapport QA livré avec chaque lot.
Tout chiffre présenté sur ce site à titre d’exemple est signalé comme tel. Nous ne publions pas de garanties d’exactitude, car une garantie donnée avant d’avoir vu vos données n’est pas un engagement : c’est un chiffre marketing.
Une inspection finale peut rattraper des erreurs. Elle ne peut pas rattraper l’ambiguïté, et c’est l’ambiguïté qui dégrade réellement un jeu de données japonais. Si les consignes autorisent deux lectures d’un cas, les deux passent l’inspection, et l’incohérence arrive dans les données d’entraînement avec un certificat de bonne santé.
Le travail qui détermine la qualité se fait donc avant l’annotation : rédiger les consignes, les mettre en défaut sur de vrais cas limites pendant un pilote, mesurer si des annotateurs indépendants convergent, et corriger les consignes là où ils ne convergent pas. La relecture est la seconde ligne de défense, pas la première.
Ce qui suit est l’ensemble du système, y compris les parties inconfortables à publier — ce que chaque métrique ne capte pas, et les cas où un chiffre peut paraître sain alors que le jeu de données ne l’est pas.
En bref
Le système
Cette boucle tourne pendant toute la durée d’un projet, et non une seule fois au démarrage.
Les consignes sont rédigées avec des exemples travaillés et des contre-exemples pour chaque décision qu’exige la tâche. Tout ce qui reste implicite ici deviendra une incohérence plus tard.
Les annotateurs étiquettent indépendamment le même jeu de calibrage. Les divergences signalent où les consignes sont ambiguës — ce sont les consignes qui sont corrigées, pas l’annotateur.
Travail de production, avec la version des consignes consignée pour chaque item, afin qu’une question ultérieure sur un enregistrement puisse recevoir une réponse précise.
Un second annotateur relit à la profondeur que la tâche justifie. La relecture est un rôle distinct avec ses propres critères, et non une répétition accélérée de l’annotation.
Les désaccords remontent à un relecteur senior, qui consigne la résolution et sa raison. Chaque résolution devient un exemple travaillé dans les consignes.
Accord, exactitude sur jeu de référence et dérive sont calculés par lot, comparés aux lots précédents et utilisés pour décider où la prochaine révision des consignes est nécessaire.
Métriques
Défini ici pour qu’un chiffre figurant dans un rapport QA soit interprétable sans avoir à nous demander à quoi il renvoie.
Accord
97.8%
2.1% vs 7 jours précédents
Exactitude sur jeu de référence
98.6%
1.4% vs 7 jours précédents
Éléments relus
24826
18.7% cette semaine
Désaccords ouverts
18
12 vs 7 jours précédents
Interface illustrative. Les chiffres affichés sont des données d’exemple servant à expliquer la façon dont nous suivons la qualité ; il ne s’agit pas de résultats communiqués.
Relecture
La profondeur de relecture est un paramètre de projet, convenu avec vous et inscrit au contrat. Une relecture plus lourde ne vaut pas toujours mieux — une tâche mécanique relue à pleine profondeur dépense du budget là où aucun jugement n’est requis.
| Profondeur de relecture | Utilisée en général pour | Ce qui se passe |
|---|---|---|
| Relecture par échantillon | Tâches mécaniques à fort volume avec un accord stable | Une part définie des items est relue ; les échecs déclenchent une passe élargie |
| Seconde passe intégrale | Étiquetage dépendant du jugement et la plupart des travaux japonais par empans | Chaque item est relu par un second annotateur |
| Double annotation à l’aveugle | Jeux d’évaluation, benchmarks et jeux de référence | Deux annotateurs travaillent indépendamment ; tous les désaccords sont arbitrés |
| Relecture experte | Domaines réglementés et jugement professionnel | Un spécialiste métier relit, avec un raisonnement écrit sur les items contestés |
Taxonomie d’erreurs
Un défaut qui porte un nom peut être compté, suivi et corrigé. Un décompte générique d’« erreurs » ne vous dit pas quoi changer.
Le cas n’est pas couvert par les consignes. Se corrige en révisant les consignes, non en corrigeant l’item — sans quoi le même cas se reproduira.
Le cas est couvert et l’annotateur a mal appliqué la règle. Se corrige par un retour et, en cas de récurrence, par un exemple travaillé plus clair.
L’étiquette est bonne, l’empan ne l’est pas. Propre aux travaux japonais par empans, où règles de frontière et tokenisation interagissent.
Linguistiquement correct, socialement faux : mauvais niveau de politesse, ou refus trop mou pour se lire comme tel.
Une affirmation vérifiable, une lecture de nom ou un chiffre est faux. Distinguée des erreurs de jugement parce que le remède est la vérification, non le calibrage.
L’item lui-même est inexploitable — audio inaudible, scan illisible, prompt ambigu. Signalé et renvoyé, jamais comblé par une supposition plausible.
Restitution
Le rapport est conçu pour que vous puissiez auditer le lot sans nous avoir dans la pièce.
FAQ
Questions sur ce que ces chiffres prouvent et ne prouvent pas.
Nous ne publions pas de garantie d’exactitude, et nous accueillerions avec prudence celle de n’importe quel prestataire. L’exactitude atteignable dépend de la tâche, de la taxonomie, de la qualité des données sources et de la part d’ambiguïté réelle que comporte le domaine — rien de tout cela n’est connu avant un pilote. Ce sur quoi nous nous engageons, c’est la méthode de mesure : quelles métriques, calculées comment, restituées à quelle fréquence, et ce qui se passe quand un lot n’est pas au niveau. Après un pilote sur vos données, nous pouvons parler d’objectifs réalistes, car il y a alors quelque chose de réel dont parler.
Ce sont des données d’exemple. Elles existent pour montrer ce que l’interface restitue et à quoi ressemblent les métriques en mouvement, et elles sont accompagnées d’un badge et d’un avertissement visibles exactement pour cette raison. Ce ne sont pas des résultats issus d’un projet client, et nous ne les présenterons pas comme tels.
Pas à lui seul. L’accord mesure la cohérence, pas la justesse — des annotateurs qui partagent le même malentendu s’accordent parfaitement. Il est aussi gonflé par les taxonomies déséquilibrées, raison pour laquelle nous restituons un coefficient corrigé du hasard à côté de l’accord brut, et raison pour laquelle des jeux de référence arbitrés par des relecteurs seniors existent comme contrôle indépendant de la justesse.
Il n’est pas livré. Selon la défaillance, la réponse est une réannotation ciblée, une révision des consignes suivie de la reprise des items concernés, ou une remontée vers vous lorsque la cause est en amont — une taxonomie ambiguë ou des données sources qui ne peuvent pas soutenir la tâche. Nous préférons livrer en retard avec une explication que dans les temps avec un chiffre qui ne survivra pas au contact de votre modèle.
Oui, et c’est une demande raisonnable. Vous pouvez relire les consignes et leur historique de versions, prélever un échantillon pour une notation indépendante et comparer vos constats à nos chiffres. Lorsqu’un client mène sa propre QA en parallèle, nous traitons une divergence entre les deux comme un constat à investiguer plutôt que comme un litige à plaider.
Qualité
Un pilote produit de vrais chiffres d’accord, une vraie ventilation des erreurs et un avis honnête sur les parties de votre taxonomie qui tiendront en volume.
NDA avant tout partage de données. Le cadrage du pilote est gratuit.