Services
Des données d’entraînement IA japonaises, sur toutes les modalités
Cinq prestations qui couvrent les besoins d’un système d’IA à chaque étape — des données d’instruction qui enseignent au modèle jusqu’à l’évaluation humaine qui vous dit si cela a fonctionné.
Les cinq reposent sur la même base : des annotateurs basés au Japon, des consignes versionnées plutôt que mémorisées, et une qualité mesurée avant d’être affirmée.
Une seule équipe, tout le cycle de vie des données
La plupart des problèmes d’annotation ne sont pas des problèmes d’étiquetage. Ce sont des problèmes de définition : deux personnes raisonnables lisent la même consigne, étiquettent différemment la même phrase japonaise, et personne ne s’en aperçoit avant que le modèle ne soit entraîné sur les deux. Découper notre travail en cinq prestations est une manière de rendre ces définitions explicites — chacune a ses propres questions de taxonomie, ses propres modes de défaillance et ses propres contrôles qualité.
Ces prestations ne sont pas des formules entre lesquelles il faudrait choisir. Un même projet en mobilise couramment trois : l’annotation NLP pour constituer un corpus étiqueté, les données d’entraînement LLM pour en tirer des paires d’instruction et de préférence, puis l’évaluation pour mesurer ce que le modèle obtenu fait réellement. Ce qui reste constant, c’est le jugement en langue japonaise qui sous-tend l’ensemble.
En bref
- Modalités
- Données japonaises en texte, parole, image, vidéo, document et multimodal.
- Étapes du modèle
- Filtrage de corpus, réglage supervisé, données de préférence et RLHF, évaluation et benchmarking.
- Formats de livraison
- JSONL, CSV, CoNLL-U, SRT, CTM, COCO — ou un schéma que vous définissez.
- Outillage
- Nous travaillons dans votre plateforme d’annotation, ou dans notre propre environnement sécurisé.
- Point de départ
- Un pilote cadré. La taxonomie et la qualité sont éprouvées avant la montée en volume.
Ce que nous faisons
Cinq prestations, plus la couche experte
Chacune a sa page, avec les décisions de taxonomie, les pièges propres au japonais et les livrables détaillés.
Données LLM
Jeux de données d’instruction, de préférence et RLHF rédigés en japonais, avec des décisions de registre prises explicitement.
- Données d’instruction et SFT
- Données de préférence et de classement
- Dialogue multi-tours
- Données de sûreté, de refus et de red teaming
Évaluation LLM
Évaluation humaine des sorties de modèles en japonais — grilles, préférence par paires, factualité et red teaming.
- Préférence par paires
- Notation par grille
- Factualité et ancrage
- Sûreté et red teaming
Parole & audio
Transcription ASR japonaise, diarisation et étiquetage d’intentions, avec une convention de normalisation écrite.
- Transcription
- Horodatage et alignement
- Étiquetage des locuteurs
- Étiquetage d’intentions et de slots
Image & vidéo
Boîtes englobantes, segmentation, OCR et mise en page de documents sur des images, vidéos et pièces japonaises.
- Détection et segmentation
- Points clés et attributs
- Annotation vidéo
- OCR et mise en page de documents
Texte & NLP
Entités, relations, intentions et sentiment sur du texte japonais, avec des frontières de tokenisation décidées plutôt que supposées.
- Reconnaissance d’entités nommées
- Extraction de relations et d’événements
- Classification
- Sentiment et émotion
Annotation experte
Annotation et évaluation par des spécialistes métier japonais, pour une IA déployée dans des domaines réglementés.
- Avocats
- Conseillers fiscaux
- Comptables agréés
- Spécialistes du droit social et de la protection sociale
Choisir
De quelle prestation ai-je besoin ?
Partez de ce que vous cherchez à changer dans le modèle. La prestation en découle, et non du type de fichier dont vous disposez.
| Si votre objectif est… | La prestation | Premier livrable type |
|---|---|---|
| Apprendre au modèle à répondre dans un japonais naturel et au bon registre | Données d’entraînement LLM | Un jeu pilote de paires instruction–réponse avec un guide de style figé |
| Savoir où le modèle se trompe avant de le mettre en production | Évaluation LLM | Un jeu d’évaluation noté, avec grille et accord inter-évaluateurs |
| Faire en sorte que le modèle entende correctement le japonais parlé | Parole & audio | De l’audio transcrit avec une convention de normalisation écrite |
| Lire des documents, des formulaires ou du texte à l’écran en japonais | Image & vidéo | Annotation OCR et mise en page sur un échantillon représentatif de documents |
| Extraire des faits structurés d’un texte japonais | Texte & NLP | Un schéma d’entités et de relations éprouvé sur de vrais cas limites |
| Faire juger des réponses par des spécialistes dans un domaine réglementé | Annotation experte | Un jeu d’évaluation relu par des experts, avec des notes d’arbitrage écrites |
Cycle de vie
Où chaque prestation intervient
Un même jeu de données sert rarement deux étapes. Des données conçues pour entraîner un modèle le testent mal, puisqu’il les a déjà vues.
-
01
Préparation du corpus
Filtrage, règles de déduplication, marqueurs de qualité et de sûreté sur du texte, de la parole ou des documents japonais bruts. Détermine ce qui mérite d’être annoté.
-
02
Réglage supervisé
Paires instruction–réponse, dialogues multi-tours et démonstrations de tâches rédigés dans le registre que le produit emploie réellement.
-
03
Préférence et alignement
Comparaisons classées ou par paires, comportements de sûreté et de refus, et les critères écrits qui font qu’une réponse vaut mieux qu’une autre.
-
04
Évaluation
Jeux réservés et notation par grille, réalisés par des personnes qui n’ont pas participé à la construction des données d’entraînement, pour que la mesure soit indépendante.
-
05
Suivi en production
Échantillonnage des sorties du modèle en production, notation selon la même grille, et réinjection des défaillances récurrentes dans le cycle de données suivant.
Livraison
Formats et livraison
Chaque lot est livré avec la version de taxonomie qui a servi à l’étiqueter et un journal des modifications par rapport au lot précédent, afin que les jeux de données restent comparables d’une version à l’autre.
| Type de données | Livraison type | Également disponible |
|---|---|---|
| Texte et NLP | JSONL | CSV, CoNLL-U, standoff brat, Parquet |
| Instruction et préférence LLM | JSONL (messages / chosen–rejected) | CSV, structure de jeu de données Hugging Face |
| Parole | JSON horodaté | SRT, VTT, CTM, TextGrid, transcription brute |
| Image et vidéo | COCO JSON | YOLO, Pascal VOC, CVAT XML, JSONL par image |
| Document et OCR | JSON avec géométrie de page | hOCR, ALTO, extraction de champs en CSV |
| Résultats d’évaluation | Notes en JSONL et rapport QA | CSV, notebook de notation, journal d’arbitrage |
FAQ
À propos des prestations
Les questions de périmètre et de processus qui se posent avant de définir un pilote.
Oui, et la plupart des programmes le font. Une séquence courante : une annotation NLP pour constituer un corpus étiqueté, des données d’entraînement LLM construites à partir de ce corpus, puis une évaluation menée par un autre groupe d’annotateurs. Les réunir dans une seule mission garantit que la taxonomie, le guide de style et les métriques QA restent cohérents au lieu d’être redéfinis par chaque prestataire.
Le japonais est notre raison d’être, et les travaux bilingues japonais–anglais en font partie. Pour des travaux en volume dans d’autres langues, nous préférons vous dire franchement que nous ne sommes pas le bon prestataire plutôt que de prendre le projet et de le sous-traiter.
La tarification est à l’unité de travail — à l’item, à l’heure d’audio, à l’image ou à l’évaluation — et dépend de la complexité de la tâche, du temps de relecture que chaque item exige et du niveau d’expertise requis. Nous chiffrons après avoir cadré un pilote sur vos données réelles, car un devis fondé sur une description de tâche est une supposition, et généralement une supposition fausse.
Nous les rédigeons, vous les relisez, et les deux ont lieu avant la production. Le pilote existe pour mettre en défaut la première version sur de vrais cas limites ; chaque désaccord tranché à cette occasion est réintégré dans le document. Les consignes sont ensuite versionnées, et chaque lot livré indique la version qui a servi à l’étiqueter.
Pour commencer
Dites-nous ce que le modèle doit apprendre.
Envoyez la tâche, un échantillon de données et les contraintes qui sont les vôtres. Nous revenons vers vous avec un plan de pilote cadré, les questions de taxonomie auxquelles il faudra répondre et un avis honnête sur ce qui sera difficile.
NDA avant tout partage de données. Le cadrage du pilote est gratuit.