01
LLM・生成AI
- 指示チューニングデータ
- RLHF/選好データ
- 安全性・レッドチーミング
- 評価用データセット
日本拠点のAIデータオペレーション
LLM・NLP・音声・画像・マルチモーダルAIのための高品質な日本語学習データを、日本国内の専門家がアノテーションし、レビューします。
日本語テキスト
それはちょっと難しいです
メモ(任意)
メモを入力…
文脈
同僚からの提案を、角を立てずに断っている場面の会話。
話者の意図
相手に配慮しながら、提案を断ること。
タグ
+ タグを追加
インターフェースのイメージ図。顧客データではなく、サンプルタスクです。
日本語ネイティブ
言語・文化・ニュアンスを理解する、日本国内のアノテーター。
多層的な品質管理
専門家によるレビュー、複数名による合議確認、継続的な品質キャリブレーション。
エンタープライズ・セキュリティ
厳格なアクセス制御、暗号化、セキュアな作業環境。
柔軟なスケール対応
パイロットから本番規模のアノテーションまで対応します。
日本語の専門性
同じ一文でも、文脈・関係性・語調によって意味が変わります。当社のデータは、AIが日本を本当に理解するために必要なニュアンスを捉えます。
大丈夫です。
Daijōbu desu.
各項目にカーソルを合わせると、その意味が選ばれる文脈が表示されます。
対応領域
テキスト・音声・画像・マルチモーダルの日本語データを対象としたアノテーションとデータラベリング。JSONL、CSV、CoNLL-U、またはお客様独自のスキーマで納品します。
01
02
03
04
専門家によるアノテーション
専門領域のAIには、専門領域の知識が必要です。法務・税務から会計・労務・金融まで、プロジェクトが実際に必要とする専門性に合わせて、アノテーションと評価のチームを編成します。
規制のある分野で使われるAIには、流暢な日本語だけでは足りません。その分野の用語、規制、実務の流れ、そして判断基準を知っている人が必要です。当社は、日本固有の専門知識を要するAIプロジェクトに対して、専門家によるアノテーション、評価、検証、データセット作成を支援します。
弁護士
日本の法令、契約、規制、そして法的な論理構成。
税理士
日本の税制、税務手続き、税務実務の専門知識。
公認会計士
会計基準、財務諸表、監査、コーポレートファイナンス。
社会保険労務士
労働・社会保険分野の国家資格(通称「社労士」)
労働関連法令、社会保険、給与計算、人事コンプライアンス。
司法書士
商業登記、不動産登記、法的手続き。
用語も、文体の硬さも、エッジケースも、業界ごとに異なります。本番開始前に、お客様のチームと用語集を作り込みます。
当社は、有資格の専門家を常時登録した名簿を保有していません。アノテーションチームは、案件が必要とする専門性に合わせて都度編成し、対応可否は案件の範囲・分量・専門性・スケジュールに照らして判断します。ご要望の資格を確保できない場合は、プロジェクト開始前にその旨をお伝えします。
専門性のレベル
専門家によるレビューが常に最適とは限りません。タスクが本当に必要としている水準に専門性を合わせることで、判断力が要る場所に予算を集中できます。
レベル 01
日本語の言語能力は必要でも、専門的な職業知識までは求められないタスク向け。
レベル 02
特定の業界について、実務知識または学術的な知識が求められるタスク向け。
レベル 03
高度な専門知識、実務経験、または特定の資格が求められるタスク向け。
プロセス
各ステップの成果物を明確に定めた、反復可能なパイプライン。品質は最後に検査するのではなく、工程そのものに組み込みます。
目的・スキーマ・ガイドラインを共同で定義します。
日本国内のアノテーターが高品質なラベルを付与します。
専門レビュアーが検証し、エッジケースを解決します。
計測・分析し、継続的に基準を調整します。
ご指定の形式で、そのまま学習に使えるデータをお渡しします。
品質
すべての工程で品質を計測し、意味のある指標を共有します。
アノテーター間一致率、ゴールドセット正解率、そして文書化されたエラー分類体系。これらによって、品質は主観ではなく、手を打てる数値になります。判断が分かれた点は文書で解決し、そのままガイドラインに反映します。
品質フレームワークを見る一致率
97.8%
2.1% 直近7日比
ゴールドセット正解率
98.6%
1.4% 直近7日比
レビュー件数
24826
18.7% 今週
未解決の不一致
18
12 直近7日比
インターフェースのイメージです。表示している数値は、品質をどのようにモニタリングしているかを説明するためのサンプルデータであり、実績として報告するものではありません。
人とAIの協働
AIの速さと、人の判断。それがHuman-in-the-loopです。
人とAIの
協働ループ
セキュリティ
エンタープライズ水準のセキュリティと、完全な透明性。
機密情報を保護するため、NDAおよびDPAを締結します。
ロールベースのアクセス権限、最小権限の原則、MFAを徹底します。
隔離された環境で作業し、通信時・保管時ともに暗号化します。
保持期間の管理、安全な削除、監査可能なログ。
管理策は案件ごとに合意し、契約書に明記します。当社は実際に運用している内容のみをご説明しています。特定の認証や監査スキームが必要な場合はお問い合わせください。取得の有無をそのままお伝えします。
実績
日本語モデルの学習に向けて設計した、高品質な指示データと選好データ。安全性ガイドラインとバージョン管理されたタキソノミーを、本番開始前に確定させました。
日本語の文書・帳票・構造化抽出のユースケースを対象に、エンティティ、フィールド、関係のラベルまで一貫してアノテーションしました。
匿名化した事例であり、当社が提供する業務の種類を示すものです。顧客名および数値はNDAにより開示していません。
よくあるご質問
ここにない内容は、お問い合わせの際にお書き添えください。個別に回答します。
漢字・ひらがな・カタカナ・ローマ字にわたり、フォーマルな文体からくだけた文体まで対応します。敬語の使い分け、地域差、スラング、業界特有の専門用語も含みます。句読点、絵文字、全角文字の正規化ルールはキックオフ時に合意し、トークナイズが揺れないようにします。
リードタイムは、量、言語的な複雑さ、QAの深さによって変わります。まずパイロットで範囲を定め、実際のデータでスループットを計測したうえで、推測ではなく根拠のある納品計画をお約束します。
固定の最低数量はありません。小規模なパイロットから大量の本番プログラムまで対応します。実務上の下限は、タスクの複雑さとツール環境の準備状況によって決まります。
はい。お客様にご用意いただいたツールやプラットフォーム上で作業します。アカウントを発行せずに進めたい場合は、当社のセキュアなラベリング環境で対応することも可能です。
JSONL、CSV、CoNLL-U、およびキックオフ時に定義したカスタムスキーマに対応します。納品物には、ラベルタキソノミーのバージョンと、バッチごとの変更履歴を含めます。
修正も初回作業と同じQAパイプラインを通ります。変更履歴、QAレポート、対象を絞った再ラベリングにより、バッチ間でぶれることなく、バージョンをまたいでデータセットの一貫性を保ちます。
NDAおよびデータ処理契約の締結、最小権限に基づくロールベースのアクセス制御、隔離された作業環境、そしてご要件に沿った保持・削除ポリシーで対応します。
はい。指示チューニングデータ、選好・ランキングラベル、安全性・レッドチーミングのアノテーション、評価セット、日本語でのモデル出力に対するHuman-in-the-loopレビューに対応します。
はい。必要とするプロジェクトでは、求められる専門性に合わせてチームを編成します。法務、税務、会計、労働・社会保険、商業登記といった分野で、関連する資格や実務経験を持つ方が加わる場合もあります。ただし、当社は常設の登録名簿を保有しておらず、対応可否は案件ごとに範囲・分量・スケジュールに照らして判断します。着手前に、どこまで実現できるかを必ずお伝えします。
はい。専門知識を持つアノテーターが、生成された回答を事実の正確さ、推論の質、専門実務としての妥当性、お客様の基準への適合という観点から採点します。RLHF向けの選好ランキング、ベンチマークセット、RAG評価、レッドチーミングにも対応します。
キックオフでガイドラインを起草し、パイロット期間中に実際のエッジケースで検証したうえで、バージョン管理された文書として確定します。レビューで解決した判断の相違は、すべてその文書に書き戻します。
AIに日本の専門性が必要ですか?
一般的なアノテーションから専門家による評価まで、お客様のドメイン、データ、品質要件、規模に合わせて、アノテーションと評価のワークフローを設計します。
データについてお聞かせください。範囲を定めたパイロット計画をご提案します。