Évaluation et retour humain

Évaluation de LLM japonais et retour humain

Un jugement humain structuré sur ce que votre modèle produit réellement en japonais — noté selon une grille écrite par des locuteurs natifs, avec un accord mesuré et des désaccords tranchés par écrit.

Une évaluation ne vaut que sa grille. Si deux locuteurs japonais compétents notent différemment la même réponse sans pouvoir dire pourquoi, le chiffre qui en sort est du bruit affublé d’une décimale.

Pourquoi une évaluation en japonais exige des évaluateurs japonais

Les métriques automatiques et les dispositifs de LLM-juge sont utiles pour suivre une tendance, et peu fiables sur les défaillances qui comptent le plus en japonais. Un modèle juge entraîné principalement sur de l’anglais approuvera volontiers une réponse dont le niveau de politesse est inadapté à la situation, dont le refus est trop mou pour se lire comme un refus, ou dont les formes honorifiques contredisent la relation établie trois tours plus tôt. Ce sont précisément les erreurs qu’un utilisateur japonais remarque aussitôt et qu’une métrique ne remarque pas du tout.

Nous évaluons donc comme le ferait un relecteur attentif, mais en rendant la relecture reproductible : des grilles ancrées avec des exemples travaillés à chaque niveau de note, un calibrage avant le début de la notation, une double notation à l’aveugle sur un échantillon, et un arbitrage écrit lorsque les notateurs divergent. Le résultat est un ensemble de chiffres défendables, accompagnés du raisonnement qui les a produits.

Nous traitons également l’indépendance comme une contrainte de conception. Les évaluateurs d’un projet ne sont pas les personnes qui en ont rédigé les données d’entraînement, car qui note selon ses propres consignes a tendance à les noter généreusement.

En bref

Types d’évaluation
Préférence par paires, notation par grille, factualité et ancrage, sûreté et red teaming, construction de benchmarks.
Notée par
Des locuteurs natifs basés au Japon ; des spécialistes métier lorsque le sujet l’exige.
Restituée avec
L’accord inter-évaluateurs, le taux d’arbitrage, le détail par critère et l’intégralité des notes de notation.
Indépendance
Les évaluateurs ne sont pas les annotateurs qui ont rédigé vos données d’entraînement.
Reproductibilité
Les grilles sont versionnées, de sorte qu’une campagne ultérieure reste comparable à la précédente.

Types d’évaluation

Ce que nous évaluons

À questions différentes, instruments différents. La plupart des programmes en appliquent deux ou trois au même modèle.

Préférence par paires

Deux réponses au même prompt, comparées selon des critères écrits. La façon la plus robuste de comparer deux versions d’un modèle, car un jugement relatif est bien plus stable qu’une note absolue.

  • Comparaison A/B de modèles
  • Égalités consignées explicitement
  • Préférence par critère
  • Ordre contrôlé contre le biais de position

Notation par grille

Des notes absolues sur des critères nommés — exactitude, utilité, registre, mise en forme, sûreté — chacun assorti de descriptions ancrées de ce que signifie une note donnée.

  • Échelles ordinales ancrées
  • Notes par critère, et non une note globale
  • Justification obligatoire sur les notes basses
  • Grille versionnée pour chaque campagne

Factualité et ancrage

Une affirmation est-elle vraie, et est-elle réellement étayée par le passage fourni au modèle ? Ce sont deux défaillances distinctes, notées séparément.

  • Vérification au niveau de l’affirmation
  • Contrôle des empans de citation
  • Détection des affirmations non étayées
  • Vérification sur sources japonaises

Sûreté et red teaming

Des prompts adverses rédigés en japonais par des locuteurs japonais, y compris les tournures indirectes et euphémiques qu’aucun jeu de prompts traduit ne contient.

  • Jeux d’attaques par catégorie
  • Sondage du refus excessif
  • Risques sociaux et juridiques propres au Japon
  • Constats étiquetés par gravité

Construction de benchmarks

Un jeu d’évaluation réservé, construit pour votre domaine, avec des items conçus pour discriminer plutôt que pour être réussis par tout le monde.

  • Réservoirs d’items équilibrés en difficulté
  • Sourcing attentif à la contamination
  • Réponses de référence avec variantes acceptables
  • Harnais de notation réutilisable

Spécificités japonaises

Ce qu’une évaluation non japonaise laisse passer

Chacun de ces points est invisible pour un modèle juge entraîné sur l’anglais et évident pour un lecteur japonais.

Justesse du registre

Une réponse peut être grammaticale, exacte et néanmoins fausse, parce qu’elle s’adresse à un client dans le registre que l’on emploierait avec un collègue. En japonais, la politesse est un axe de correction, pas un axe stylistique.

Notre approche Le registre est un critère de grille nommé, doté de ses propres ancrages, noté séparément de l’exactitude, afin qu’une réponse bien informée mais au registre inadapté ne puisse pas se cacher derrière son contenu.

Force du refus

Les refus japonais sont indirects par défaut. Un modèle qui répond à une demande interdite par 難しいかもしれません a techniquement esquivé, et beaucoup de dispositifs d’évaluation compteront cela comme un refus réussi.

Notre approche Les refus sont notés selon qu’un locuteur japonais les lirait comme des refus, sur une échelle assortie d’exemples travaillés, et le refus excessif est noté comme une défaillance à part entière plutôt que comme une réussite.

Cohérence honorifique entre les tours

La relation établie au début d’une conversation contraint tous les tours suivants. Les modèles la réinitialisent fréquemment en cours de dialogue, ce qu’un utilisateur japonais lit comme un assistant qui oublie à qui il parle.

Notre approche Les items multi-tours sont notés comme des conversations, avec un critère de cohérence qui regarde l’ensemble des tours plutôt que chaque réponse isolément.

Noms propres et lectures

Les noms propres japonais admettent plusieurs lectures valides, et un modèle qui produit la mauvaise lecture d’un nom de personne ou de lieu commet une erreur factuelle qu’aucun correcteur orthographique ne voit.

Notre approche Les erreurs d’entité et de lecture forment une sous-catégorie de factualité distincte, vérifiée sur des sources japonaises et non sur la mémoire de l’évaluateur.

Processus

Comment se déroule une évaluation

La grille est le livrable qui survit à la campagne. C’est elle qui rend l’évaluation suivante comparable à celle-ci.

  1. 01

    Définir ce que « bon » veut dire

    Nous transformons vos préoccupations de qualité en critères nommés, puis rédigeons des descriptions ancrées pour chaque niveau de note, avec de vrais exemples issus des sorties de votre modèle.

  2. 02

    Constituer le jeu d’items

    Les prompts sont échantillonnés ou rédigés pour couvrir les comportements qui vous importent, y compris les cas rares et adverses qu’un échantillonnage aléatoire ne ferait jamais apparaître.

  3. 03

    Calibrer les notateurs

    Chaque évaluateur note le même lot de calibrage. Les divergences sont discutées, les ancrages de la grille sont affinés, et la notation ne commence qu’une fois l’accord stabilisé.

  4. 04

    Noter, doubler, arbitrer

    Une part définie des items est notée à l’aveugle par deux évaluateurs. Les désaccords remontent à un relecteur senior qui consigne la raison de la résolution.

  5. 05

    Restituer avec le raisonnement

    Vous recevez les notes, les statistiques d’accord, le journal d’arbitrage et une synthèse écrite des schémas de défaillance récurrents — pas seulement une ligne de classement.

Livraison

Ce que vous recevez

Chaque note est traçable jusqu’à un item, un rôle d’évaluateur, une version de grille et, lorsqu’il y en a une, une justification.

Livrables d’évaluation par défaut. Le format du harnais de notation est aligné sur votre pile technique lorsque vous en avez une.
LivrableFormatContenu
Notes par itemJSONL ou CSVidentifiant d’item, notes par critère, justification, rôle de l’évaluateur, version de grille
Rapport d’accordPDF ou Markdownaccord inter-évaluateurs par critère, taux d’arbitrage, dérive au fil de la campagne
Analyse des défaillancesPDF ou Markdownschémas récurrents, exemples travaillés, modifications suggérées des consignes ou des données
Constats de red teamingJSONLprompt, réponse, catégorie, gravité, notes de reproduction
Jeu de benchmarkJSONL et harnaisitems, réponses de référence, variantes acceptables, script de notation

Qualité

Contrôles propres à ce travail

Une évaluation sans statistiques d’accord est une opinion. Voici les contrôles qui en font une mesure.

  • Une phase de calibrage avant la notation, répétée chaque fois que la grille change.
  • Double notation à l’aveugle sur un échantillon défini, l’accord étant restitué par critère plutôt que globalement.
  • Arbitrage écrit pour chaque désaccord, conservé dans un journal que vous recevez avec les résultats.
  • Ordre des réponses randomisé dans les comparaisons par paires, pour contrôler le biais de position.
  • Évaluateurs tenus à l’écart de l’équipe ayant produit les données d’entraînement du même projet.
  • Versionnement des grilles, pour qu’une nouvelle campagne des mois plus tard mesure bien la même chose qu’avant.

FAQ

À propos de l’évaluation de LLM

Ce que demandent les équipes avant de commander une première évaluation en japonais.

Les LLM juges sont peu coûteux, rapides et utiles pour suivre les régressions entre versions. Ils sont peu fiables exactement là où le japonais est difficile — justesse de la politesse, force du refus, cohérence honorifique et lecture des noms — parce que ces jugements reposent sur une connaissance pragmatique native. Un dispositif courant associe un jeu noté par des humains comme référence, un LLM juge pour les campagnes fréquentes, et une renotation humaine périodique pour vérifier que le juge ne s’est pas éloigné de la référence.

Cela dépend de l’ampleur de l’écart que vous devez détecter et du nombre de critères notés. Quelques centaines d’items bien choisis suffisent en général à départager deux modèles nettement différents ; distinguer des checkpoints quasi équivalents en demande considérablement plus. Nous dimensionnons le jeu en fonction de la décision que vous cherchez à prendre, et nous vous dirons quand un jeu est trop petit pour étayer la conclusion que vous en attendez.

Oui. Pour des sujets tels que le droit, la fiscalité, la comptabilité, le droit social ou l’immatriculation des sociétés, nous constituons l’équipe d’évaluation autour de l’expertise que la tâche exige. Nous n’entretenons pas de vivier permanent de professionnels agréés — la disponibilité est appréciée projet par projet au regard du périmètre, du volume et du calendrier, et nous confirmons ce qui est réalisable avant le démarrage des travaux.

Oui, mais pas avec les mêmes personnes. Les évaluateurs d’un projet sont séparés des annotateurs qui en ont rédigé les données d’entraînement, car noter au regard de consignes que l’on a contribué à écrire n’est pas une mesure indépendante. Si vous préférez que l’évaluation se situe entièrement en dehors du prestataire qui a produit les données, nous trouvons cette position raisonnable et le dirons.

Les résultats, plus l’analyse des défaillances qui les explique. Un rapport qui ne contient qu’une note n’est pas actionnable — ce qu’il vous faut, ce sont les schémas récurrents qui la sous-tendent, des exemples travaillés de chacun et une vue concrète de la correction à apporter : davantage de données, des consignes différentes ou une modification du produit. Nous préférons livrer clairement un constat dérangeant plutôt que de l’adoucir.

Évaluation LLM

Découvrez ce que votre modèle rate en japonais.

Envoyez un ensemble de sorties du modèle, ou les prompts sur lesquels vous voulez le tester. Nous revenons vers vous avec une proposition de grille, un échantillon noté selon celle-ci et ce qu’impliquerait une campagne complète.

NDA avant tout partage de données. Le cadrage du pilote est gratuit.