음성 · 대화

일본어 음성 · 오디오 데이터 어노테이션

일본어 오디오에 대한 전사, 타임스탬프, 화자 분리, 의도 및 슬롯 라벨링, 감정 및 방언 태깅 — 암묵적인 습관이 아니라 문서화된 규약에 따라 작업합니다.

같은 일본어 오디오를 규약 없이 두 사람이 전사하면 대략 세 줄에 한 번은 결과가 갈립니다. 무엇을 말했는지가 아니라, 그것을 어떻게 표기할지에서 갈립니다.

전사본은 녹음이 아니라 일련의 결정입니다

일본어에는 공백이 없고 문자가 네 가지이며, 단어의 소리와 관습적 표기 사이의 간격이 넓습니다. 그래서 오디오가 텍스트가 되는 순간 누군가는 수십 가지 선택을 하게 됩니다. 有難うございます를 한자로 쓸지 가나로 쓸지, 3人을 3人으로 쓸지 三人으로 쓸지, 문장 앞의 えーっと를 남길지 지울지, 말이 끊겼다 다시 시작한 부분을 그대로 옮길지 다듬을지.

이 선택 하나하나는 그 자체로 틀린 것이 아닙니다. 잘못된 것은 코퍼스 전체에서 일관되지 않게 선택하는 것입니다. 일관되지 않은 정답으로 학습한 ASR 모델은 같은 소리가 여러 문자열에 대응한다고 배우고, 그 차이를 오류율로 흡수합니다. 일본어 음성 데이터에서 품질을 가장 크게 좌우하는 지렛대는, 문서로 적히고 실제로 지켜지는 정규화 규약입니다.

그래서 모든 음성 프로젝트는 그 문서를 합의하는 것으로 시작합니다 — 이미 가지고 계신 규약이 있다면 저희 것을 들이미는 대신 그것을 채택합니다.

한눈에 보기

작업 유형
축어 전사와 정리 전사, 타임스탬프, 화자 분리, 의도 및 슬롯 라벨링, 감정 및 운율, 방언 태깅.
대상 오디오
콜센터 녹취, 회의, 인터뷰, 방송, 차량 및 기기 음성, 자연 발화 대화.
규약
표기 선택, 필러, 숫자, 웃음, 판독 불가 구간을 전사 시작 전에 모두 정의합니다.
기본 출력
단어 또는 구간 타이밍이 포함된 JSON. SRT, VTT, CTM, TextGrid도 지원합니다.
검수
모든 파일에 대한 2차 청취와, 표본에 대한 블라인드 재전사.

작업 유형

어노테이션 범위

전사가 대개 기반 레이어이며, 나머지는 같은 타임라인 위에 얹힙니다.

전사

축어 또는 정리 전사. 필러, 재시작, 반복, 발음 오류, 판독 불가 구간을 다루는 문서화된 규약을 따릅니다.

  • 비유창성을 포함한 축어 전사
  • 가독성을 위한 정리 전사
  • 판독 불가 및 겹침 표시
  • 비언어 이벤트 태그

타이밍과 정렬

구간, 발화, 단어 단위의 타임스탬프. 기존 전사본이 있는 경우에는 강제 정렬도 수행합니다.

  • 발화 경계
  • 단어 단위 타이밍
  • 강제 정렬 결과 QA
  • 묵음 및 겹침 구간

화자 라벨링

겹치는 발화와 채널 전환을 넘어 누가 말하고 있는지 — 실제 통화 녹취에서 가장 자주 무너지는 부분입니다.

  • 화자 분리와 화자 ID
  • 역할 라벨(상담원 / 고객)
  • 겹침 처리
  • 화자 속성 태깅

의도와 슬롯 라벨링

그 발화가 무엇을 하려는지와 어떤 값을 담고 있는지를, 음성 어시스턴트와 통화 분석을 위해 전사본 위에 얹습니다.

  • 의도 분류
  • 슬롯 및 개체 스팬
  • 대화 행위 라벨
  • 통화 결과와 처리 구분

준언어 라벨링

감정, 감성, 운율적 강조, 말하기 스타일, 지역 변이를 인상이 아니라 정의된 범주에 따라 판정합니다.

  • 감정과 감성
  • 말하기 스타일과 정중함 수준
  • 지역 변이와 억양
  • 오디오 품질 및 환경 태그

일본어 특유의 문제

일본어 규약이 반드시 내려야 하는 결정

유능한 두 전사자 사이의 이견은 대부분 이 네 가지에서 나옵니다.

같은 단어의 표기 선택

ありがとう, 有難う, アリガトウ는 같은 단어입니다. 전사자 각자에게 맡기면 코퍼스에 셋 다 들어가고, 모델은 이를 서로 다른 정답으로 취급합니다.

대응 방식 규약이 자주 쓰이는 단어의 필수 표기를 목록화하고 나머지에 적용할 기본 규칙을 정하며, 납품 전에 자동 검사가 변형을 표시합니다.

숫자와 조수사

일본어 조수사는 세는 명사에 따라 읽기가 달라지고 — 一本, 一杯, 一人 — 숫자는 3, 三, 参으로 쓸 수 있습니다. 일관되지 않게 표기하면 결과 모델의 숫자 정확도를 측정할 수 없게 됩니다.

대응 방식 숫자 표기 방침이 맥락별로 아라비아 숫자와 한자 숫자를 확정하고 조수사와 단위의 전사 방식을 정하며, 날짜와 금액, 시각, 전화번호에 대한 예시를 함께 둡니다.

필러와 비유창성

あの, えーっと, まあ, そのー는 자연 발화 일본어에 널리 퍼져 있습니다. 남기면 전사본이 지저분해지고, 지우면 비유창성을 다루는 모델에 축어 데이터를 쓸 수 없게 됩니다.

대응 방식 축어 버전과 정리 버전을 따로 정의하고, 각각에 대해 필러 목록과 표기를 고정합니다. 그래서 이 선택이 파일마다의 판단이 아니라 프로젝트 설정값이 됩니다.

정중어와 경어 형태

콜센터 일본어는 존경 표현과 겸양 표현으로 빽빽하고, 빠르게 작업하는 전사자가 흔히 잘못 듣는 쌍이 여럿 있습니다 — いたします와 いただきます, よろしいでしょうか와 よろしかったでしょうか.

대응 방식 검수자에게 해당 오디오 유형에 특유한 경어 패턴을 사전에 공유하고, 경어 오류를 일반 정확도에 묻지 않고 검수 단계의 독립된 범주로 둡니다.

프로세스

음성 프로젝트의 진행 방식

규약 문서는 누구도 파일 하나를 통째로 전사하기 전에 작성하며, 이후에는 버전이 남는 변경을 통해서만 고칩니다.

  1. 01

    샘플 청취와 범위 산정

    가장 깨끗한 오디오만이 아니라 가장 나쁜 오디오까지 포함한 대표 샘플을 듣고, 실제로 무엇이 어려울지 파악합니다.

  2. 02

    규약 작성

    표기, 숫자, 필러, 비언어 이벤트, 겹침, 판독 불가 구간, 화자 역할, 타이밍 단위를 승인하신 문서에 모두 확정합니다.

  3. 03

    파일럿으로 캘리브레이션

    여러 전사자가 같은 파일을 독립적으로 작업합니다. 결과가 갈리는 지점이 규약이 모호했던 지점이며, 그곳을 다듬습니다.

  4. 04

    전사와 검수

    모든 파일을 다른 사람이 2차로 청취하고, 표본은 블라인드로 재전사해 측정된 정확도 수치를 만듭니다.

  5. 05

    납품과 보고

    전사본과 타이밍, 라벨을 규약 버전 및 QA 리포트와 함께 납품하고, 추측으로 메우는 대신 사용 불가로 표시한 파일 목록도 함께 드립니다.

납품

입력과 출력 형식

오디오는 있는 그대로 받아 작업합니다. 코덱이나 샘플링 레이트가 달성 가능한 범위를 제한하는 경우에는, 프로젝트가 끝난 뒤가 아니라 시작 전에 말씀드립니다.

일본어 음성 작업의 일반적인 입력 및 출력 형식.
레이어기본 출력추가 지원
전사본구간 타이밍이 포함된 JSON일반 텍스트, SRT, VTT
단어 단위 타이밍JSONCTM, TextGrid
화자 라벨RTTM 또는 화자 턴 JSON채널별 전사본
의도와 슬롯JSONL, 발화 한 건당 한 줄CSV, CoNLL 스팬 형식
준언어 라벨시간 구간이 포함된 JSONLCSV, ELAN 어노테이션 파일

품질

이 작업에 특화된 관리 항목

일본어 오디오의 정확도는 주장이 아니라 측정의 대상이며, 쉬운 파일이 아니라 어려운 파일에서 측정합니다.

  • 표본을 두 번째 전사자가 블라인드로 재전사해, 배치별 실측 오류율을 산출합니다.
  • 납품 전에 표기 변형과 숫자 형식, 필러 표기를 자동으로 검사합니다.
  • 타이밍은 인접 구간이 아니라 오디오 자체에 대해 검증합니다.
  • 정말로 전사할 수 없는 파일은 그럴듯한 추측으로 메우지 않고 표시해 반환합니다.
  • 화자 라벨을 파일 전체에 걸쳐 점검해, 중간에 화자가 뒤바뀌는 경우를 잡아냅니다.
  • 어려운 오디오를 QA 표본에 의도적으로 포함해, 보고되는 수치가 코퍼스의 가장 좋은 부분이 아니라 코퍼스 전체를 반영하게 합니다.

FAQ

음성 · 오디오에 대하여

첫 일본어 오디오 배치를 보내기 전에 나오는 질문들.

가능하며, 깨끗한 오디오라면 대개 그편이 비용 대비 낫습니다. 다만 한 가지 주의할 점은, 기계 전사본을 교정하는 작업이 이미 화면에 있는 것을 받아들이는 쪽으로 사람을 편향시킨다는 것입니다. 그래서 학습 데이터의 경우에는 처음부터 전사하거나, 표본에 블라인드 검사를 돌려 교정 작업이 실제로 무엇을 잡아내고 있는지 측정합니다.

방언을 말한 그대로 전사할지 표준 일본어로 정규화할지를 사전에 합의합니다. 그 결정이 데이터셋 자체를 완전히 바꾸기 때문입니다. 방언이 범위에 포함되면 변이를 태깅하며, 어떤 변이를 안정적으로 담당할 수 있고 어떤 변이는 그렇지 않은지 솔직하게 말씀드립니다.

전화 대역폭의 통화 음성, 배경 소음, 겹치는 화자를 포함해 실제 녹음을 그대로 다룹니다. 형식보다 중요한 것은 대표성 있는 샘플을 먼저 보내 주시는 것입니다 — 깨끗한 오디오로 범위를 산정하고 잡음이 많은 오디오로 납품하는 것이 음성 프로젝트가 어긋나는 전형적인 경로입니다.

가능합니다. NDA와 데이터 처리 계약 아래, 역할 기반 접근이 적용된 격리된 환경에서, 계약으로 합의한 보관 및 삭제 조건에 따라 작업합니다. 녹취에 개인정보가 포함된 경우에는 마스킹 대상을 표시해 드릴 수도 있고, 보내시기 전에 마스킹한 오디오만 다룰 수도 있습니다. 전체적인 내용은 보안 페이지를 참고해 주세요.

제공합니다. 겹침은 자동 화자 분리가 가장 자주 실패하는 지점이며, 사람이 투입되어야 하는 주된 이유 중 하나입니다. 저희 규약은 겹치는 발화를 어떻게 분할하고 누구에게 귀속시킬지 정의하므로, 처리 방식이 파일마다 달라지지 않고 일관됩니다.

음성 · 오디오

가장 깨끗한 오디오 말고, 가장 어려운 오디오를 보내 주세요.

대표 샘플은 사양서보다 많은 것을 알려 줍니다. 저희는 규약 초안과 전사된 샘플, 그리고 예상되는 오류율에 대한 솔직한 견해를 정리해 회신드립니다.

데이터를 공유하시기 전에 NDA를 체결합니다. 파일럿 범위 산정은 무료입니다.