Services

Des données d’entraînement IA japonaises, sur toutes les modalités

Cinq prestations qui couvrent les besoins d’un système d’IA à chaque étape — des données d’instruction qui enseignent au modèle jusqu’à l’évaluation humaine qui vous dit si cela a fonctionné.

Les cinq reposent sur la même base : des annotateurs basés au Japon, des consignes versionnées plutôt que mémorisées, et une qualité mesurée avant d’être affirmée.

Une seule équipe, tout le cycle de vie des données

La plupart des problèmes d’annotation ne sont pas des problèmes d’étiquetage. Ce sont des problèmes de définition : deux personnes raisonnables lisent la même consigne, étiquettent différemment la même phrase japonaise, et personne ne s’en aperçoit avant que le modèle ne soit entraîné sur les deux. Découper notre travail en cinq prestations est une manière de rendre ces définitions explicites — chacune a ses propres questions de taxonomie, ses propres modes de défaillance et ses propres contrôles qualité.

Ces prestations ne sont pas des formules entre lesquelles il faudrait choisir. Un même projet en mobilise couramment trois : l’annotation NLP pour constituer un corpus étiqueté, les données d’entraînement LLM pour en tirer des paires d’instruction et de préférence, puis l’évaluation pour mesurer ce que le modèle obtenu fait réellement. Ce qui reste constant, c’est le jugement en langue japonaise qui sous-tend l’ensemble.

En bref

Modalités
Données japonaises en texte, parole, image, vidéo, document et multimodal.
Étapes du modèle
Filtrage de corpus, réglage supervisé, données de préférence et RLHF, évaluation et benchmarking.
Formats de livraison
JSONL, CSV, CoNLL-U, SRT, CTM, COCO — ou un schéma que vous définissez.
Outillage
Nous travaillons dans votre plateforme d’annotation, ou dans notre propre environnement sécurisé.
Point de départ
Un pilote cadré. La taxonomie et la qualité sont éprouvées avant la montée en volume.

Ce que nous faisons

Cinq prestations, plus la couche experte

Chacune a sa page, avec les décisions de taxonomie, les pièges propres au japonais et les livrables détaillés.

Données LLM

Jeux de données d’instruction, de préférence et RLHF rédigés en japonais, avec des décisions de registre prises explicitement.

  • Données d’instruction et SFT
  • Données de préférence et de classement
  • Dialogue multi-tours
  • Données de sûreté, de refus et de red teaming
Voir la prestation

Évaluation LLM

Évaluation humaine des sorties de modèles en japonais — grilles, préférence par paires, factualité et red teaming.

  • Préférence par paires
  • Notation par grille
  • Factualité et ancrage
  • Sûreté et red teaming
Voir la prestation

Parole & audio

Transcription ASR japonaise, diarisation et étiquetage d’intentions, avec une convention de normalisation écrite.

  • Transcription
  • Horodatage et alignement
  • Étiquetage des locuteurs
  • Étiquetage d’intentions et de slots
Voir la prestation

Image & vidéo

Boîtes englobantes, segmentation, OCR et mise en page de documents sur des images, vidéos et pièces japonaises.

  • Détection et segmentation
  • Points clés et attributs
  • Annotation vidéo
  • OCR et mise en page de documents
Voir la prestation

Texte & NLP

Entités, relations, intentions et sentiment sur du texte japonais, avec des frontières de tokenisation décidées plutôt que supposées.

  • Reconnaissance d’entités nommées
  • Extraction de relations et d’événements
  • Classification
  • Sentiment et émotion
Voir la prestation

Annotation experte

Annotation et évaluation par des spécialistes métier japonais, pour une IA déployée dans des domaines réglementés.

  • Avocats
  • Conseillers fiscaux
  • Comptables agréés
  • Spécialistes du droit social et de la protection sociale
Voir la prestation

Choisir

De quelle prestation ai-je besoin ?

Partez de ce que vous cherchez à changer dans le modèle. La prestation en découle, et non du type de fichier dont vous disposez.

Faire correspondre un objectif à une prestation. La plupart des programmes finissent par en combiner deux ou trois.
Si votre objectif est…La prestationPremier livrable type
Apprendre au modèle à répondre dans un japonais naturel et au bon registreDonnées d’entraînement LLMUn jeu pilote de paires instruction–réponse avec un guide de style figé
Savoir où le modèle se trompe avant de le mettre en productionÉvaluation LLMUn jeu d’évaluation noté, avec grille et accord inter-évaluateurs
Faire en sorte que le modèle entende correctement le japonais parléParole & audioDe l’audio transcrit avec une convention de normalisation écrite
Lire des documents, des formulaires ou du texte à l’écran en japonaisImage & vidéoAnnotation OCR et mise en page sur un échantillon représentatif de documents
Extraire des faits structurés d’un texte japonaisTexte & NLPUn schéma d’entités et de relations éprouvé sur de vrais cas limites
Faire juger des réponses par des spécialistes dans un domaine réglementéAnnotation experteUn jeu d’évaluation relu par des experts, avec des notes d’arbitrage écrites

Cycle de vie

Où chaque prestation intervient

Un même jeu de données sert rarement deux étapes. Des données conçues pour entraîner un modèle le testent mal, puisqu’il les a déjà vues.

  1. 01

    Préparation du corpus

    Filtrage, règles de déduplication, marqueurs de qualité et de sûreté sur du texte, de la parole ou des documents japonais bruts. Détermine ce qui mérite d’être annoté.

  2. 02

    Réglage supervisé

    Paires instruction–réponse, dialogues multi-tours et démonstrations de tâches rédigés dans le registre que le produit emploie réellement.

  3. 03

    Préférence et alignement

    Comparaisons classées ou par paires, comportements de sûreté et de refus, et les critères écrits qui font qu’une réponse vaut mieux qu’une autre.

  4. 04

    Évaluation

    Jeux réservés et notation par grille, réalisés par des personnes qui n’ont pas participé à la construction des données d’entraînement, pour que la mesure soit indépendante.

  5. 05

    Suivi en production

    Échantillonnage des sorties du modèle en production, notation selon la même grille, et réinjection des défaillances récurrentes dans le cycle de données suivant.

Livraison

Formats et livraison

Chaque lot est livré avec la version de taxonomie qui a servi à l’étiqueter et un journal des modifications par rapport au lot précédent, afin que les jeux de données restent comparables d’une version à l’autre.

Formats de livraison courants. Les schémas sur mesure sont définis au lancement et versionnés avec les données.
Type de donnéesLivraison typeÉgalement disponible
Texte et NLPJSONLCSV, CoNLL-U, standoff brat, Parquet
Instruction et préférence LLMJSONL (messages / chosen–rejected)CSV, structure de jeu de données Hugging Face
ParoleJSON horodatéSRT, VTT, CTM, TextGrid, transcription brute
Image et vidéoCOCO JSONYOLO, Pascal VOC, CVAT XML, JSONL par image
Document et OCRJSON avec géométrie de pagehOCR, ALTO, extraction de champs en CSV
Résultats d’évaluationNotes en JSONL et rapport QACSV, notebook de notation, journal d’arbitrage

FAQ

À propos des prestations

Les questions de périmètre et de processus qui se posent avant de définir un pilote.

Oui, et la plupart des programmes le font. Une séquence courante : une annotation NLP pour constituer un corpus étiqueté, des données d’entraînement LLM construites à partir de ce corpus, puis une évaluation menée par un autre groupe d’annotateurs. Les réunir dans une seule mission garantit que la taxonomie, le guide de style et les métriques QA restent cohérents au lieu d’être redéfinis par chaque prestataire.

Le japonais est notre raison d’être, et les travaux bilingues japonais–anglais en font partie. Pour des travaux en volume dans d’autres langues, nous préférons vous dire franchement que nous ne sommes pas le bon prestataire plutôt que de prendre le projet et de le sous-traiter.

La tarification est à l’unité de travail — à l’item, à l’heure d’audio, à l’image ou à l’évaluation — et dépend de la complexité de la tâche, du temps de relecture que chaque item exige et du niveau d’expertise requis. Nous chiffrons après avoir cadré un pilote sur vos données réelles, car un devis fondé sur une description de tâche est une supposition, et généralement une supposition fausse.

Nous les rédigeons, vous les relisez, et les deux ont lieu avant la production. Le pilote existe pour mettre en défaut la première version sur de vrais cas limites ; chaque désaccord tranché à cette occasion est réintégré dans le document. Les consignes sont ensuite versionnées, et chaque lot livré indique la version qui a servi à l’étiqueter.

Pour commencer

Dites-nous ce que le modèle doit apprendre.

Envoyez la tâche, un échantillon de données et les contraintes qui sont les vôtres. Nous revenons vers vous avec un plan de pilote cadré, les questions de taxonomie auxquelles il faudra répondre et un avis honnête sur ce qui sera difficile.

NDA avant tout partage de données. Le cadrage du pilote est gratuit.