페어와이즈 선호
같은 프롬프트에 대한 두 답변을 문서화된 기준으로 비교합니다. 상대적 판단이 절대 점수보다 훨씬 안정적이므로, 모델 버전을 비교하는 가장 견고한 방법입니다.
- A/B 모델 비교
- 무승부를 명시적으로 기록
- 기준별 선호
- 위치 편향을 통제한 순서 배치
평가 · 휴먼 피드백
모델이 일본어로 실제로 만들어 내는 결과에 대한 구조화된 사람의 판단 — 원어민이 문서화된 루브릭에 따라 채점하고, 일치도를 측정하며, 이견은 서면으로 판정합니다.
평가의 수준은 루브릭의 수준을 넘지 못합니다. 유능한 일본어 화자 두 사람이 같은 답변에 다른 점수를 주면서 그 이유를 말하지 못한다면, 나오는 숫자는 소수점을 걸친 잡음일 뿐입니다.
자동 지표와 LLM-as-judge 구성은 추세를 추적하는 데는 유용하고, 일본어에서 가장 중요한 실패에 대해서는 신뢰할 수 없습니다. 주로 영어로 학습된 심판 모델은 상황에 맞지 않는 정중함 수준의 답변, 거절로 읽히지 않을 만큼 부드러운 거절, 세 턴 전에 성립한 관계와 어긋나는 경어를 아무렇지 않게 통과시킵니다. 이런 것들은 일본어 사용자가 즉시 알아차리고 지표는 전혀 알아차리지 못하는 오류입니다.
그래서 저희는 꼼꼼한 검수자가 할 법한 방식으로 평가하되, 그 검수를 재현 가능하게 만듭니다 — 각 점수 구간에 예시를 붙인 앵커형 루브릭, 채점 시작 전 캘리브레이션, 표본에 대한 블라인드 이중 채점, 채점자 간 이견에 대한 서면 판정입니다. 산출물은 방어할 수 있는 수치들과, 그 수치를 만들어 낸 근거입니다.
독립성도 설계상의 제약으로 다룹니다. 한 프로젝트의 평가자는 그 프로젝트의 학습 데이터를 작성한 사람이 아닙니다. 자기가 만든 가이드라인을 스스로 채점하면 후하게 매기는 경향이 있기 때문입니다.
한눈에 보기
평가 유형
질문이 다르면 도구도 달라야 합니다. 대부분의 프로그램은 같은 모델에 대해 이 중 두세 가지를 함께 돌립니다.
같은 프롬프트에 대한 두 답변을 문서화된 기준으로 비교합니다. 상대적 판단이 절대 점수보다 훨씬 안정적이므로, 모델 버전을 비교하는 가장 견고한 방법입니다.
정확성, 유용성, 문체, 서식, 안전성 등 명명된 기준에 대한 절대 점수. 각 기준마다 해당 점수가 무엇을 뜻하는지 앵커 설명을 둡니다.
주장이 사실인지, 그리고 모델에게 주어진 문서가 실제로 그것을 뒷받침하는지. 둘은 서로 다른 실패이므로 따로 채점합니다.
일본어 화자가 일본어로 작성한 적대적 프롬프트. 번역된 프롬프트 세트에는 결코 들어 있지 않은 완곡하고 우회적인 표현을 포함합니다.
고객사 도메인에 맞춘 홀드아웃 평가 세트. 모두가 맞히는 문항이 아니라 변별력을 갖도록 설계한 문항으로 구성합니다.
일본어 특유의 문제
아래는 모두 영어로 학습된 심판 모델에게는 보이지 않고 일본어 독자에게는 명백한 것들입니다.
답변이 문법적으로 맞고 내용도 정확한데 여전히 틀릴 수 있습니다. 동료에게 쓸 문체로 고객을 대하고 있기 때문입니다. 일본어에서 정중함은 문체의 축이 아니라 정확성의 축입니다.
대응 방식 문체를 자체 앵커를 가진 별도의 루브릭 기준으로 두고 정확성과 분리해 채점합니다. 그래야 내용은 충실하지만 문체가 어긋난 답변이 내용 뒤에 숨지 못합니다.
일본어의 거절은 기본적으로 완곡합니다. 금지된 요청에 難しいかもしれません으로 답한 모델은 형식적으로는 얼버무린 것인데, 많은 평가 구성이 이를 성공적인 거절로 채점합니다.
대응 방식 거절은 일본어 화자가 그것을 거절로 읽는지를 기준으로, 예시가 붙은 척도에서 채점합니다. 과잉 거절도 성공이 아니라 그 자체로 하나의 실패로 채점합니다.
대화 초반에 성립한 관계가 이후의 모든 턴을 제약합니다. 모델은 대화 중간에 이를 자주 리셋하는데, 일본어 사용자에게는 어시스턴트가 지금 누구와 이야기하는지 잊은 것처럼 읽힙니다.
대응 방식 멀티턴 항목은 대화 단위로 채점하며, 각 답변을 따로 보는 대신 턴 전반을 가로질러 보는 일관성 기준을 둡니다.
일본어 고유명사에는 유효한 읽기가 여러 개 있고, 인명이나 지명의 읽기를 잘못 낸 모델은 맞춤법 검사로는 보이지 않는 사실 오류를 범한 것입니다.
대응 방식 개체와 읽기 오류는 사실성의 독립된 하위 범주로 두고, 평가자의 기억이 아니라 일본어 출처에 대조해 검증합니다.
프로세스
루브릭은 그 실행보다 오래 남는 산출물입니다. 다음 평가를 이번 평가와 비교 가능하게 만드는 것이 바로 루브릭입니다.
품질에 대한 우려를 명명된 기준으로 바꾸고, 각 점수 구간에 대해 귀사 모델의 실제 출력에서 가져온 예시로 앵커 설명을 작성합니다.
중요하게 보시는 행동을 포괄하도록 프롬프트를 표집하거나 작성하며, 무작위 표집으로는 결코 드러나지 않을 희소하고 적대적인 사례도 포함합니다.
모든 평가자가 같은 캘리브레이션 배치를 채점합니다. 차이를 논의하고 루브릭 앵커를 다듬으며, 일치도가 안정된 뒤에야 채점을 시작합니다.
정해진 비율의 항목을 두 평가자가 블라인드로 채점합니다. 이견은 시니어 검수자에게 가고, 검수자는 결론의 이유를 기록합니다.
점수와 일치도 통계, 판정 로그, 그리고 반복되는 실패 패턴에 대한 서면 요약을 받으십니다 — 리더보드의 한 줄이 아닙니다.
납품
모든 점수는 항목과 평가자 역할, 루브릭 버전, 그리고 작성된 경우 그 근거까지 추적할 수 있습니다.
| 납품물 | 형식 | 내용 |
|---|---|---|
| 항목별 점수 | JSONL 또는 CSV | 항목 ID, 기준별 점수, 근거, 평가자 역할, 루브릭 버전 |
| 일치도 리포트 | PDF 또는 Markdown | 기준별 평가자 간 일치도, 판정 비율, 실행 기간의 드리프트 |
| 실패 분석 | PDF 또는 Markdown | 반복되는 패턴, 사례 예시, 가이드라인 또는 데이터 변경 제안 |
| 레드팀 발견 사항 | JSONL | 프롬프트, 응답, 범주, 심각도, 재현 메모 |
| 벤치마크 세트 | JSONL과 채점 하네스 | 문항, 기준 정답, 허용 변형, 채점 스크립트 |
품질
일치도 통계가 없는 평가는 의견입니다. 아래는 그것을 측정으로 바꾸는 검사들입니다.
FAQ
첫 일본어 평가를 의뢰하기 전에 나오는 질문들.
LLM 심판은 저렴하고 빠르며 릴리스 간 회귀 추적에 유용합니다. 다만 일본어가 어려운 바로 그 지점 — 정중함의 적절성, 거절의 강도, 경어의 일관성, 이름의 읽기 — 에서는 신뢰할 수 없습니다. 그런 판단은 원어민의 화용적 지식에 의존하기 때문입니다. 흔한 구성은 사람이 채점한 세트를 기준으로 삼고, 잦은 실행에는 LLM 심판을 쓰며, 주기적으로 사람이 다시 채점해 심판이 기준에서 멀어지지 않았는지 확인하는 방식입니다.
어느 정도 크기의 차이를 감지하려는지, 그리고 몇 개의 기준으로 채점하는지에 달려 있습니다. 잘 고른 수백 개 항목이면 확실히 다른 두 모델은 대개 구분됩니다. 거의 동등한 체크포인트를 구분하려면 훨씬 많이 필요합니다. 저희는 내리려는 의사결정에 맞춰 세트 크기를 정하고, 원하시는 결론을 뒷받침하기에 세트가 너무 작을 때는 그렇다고 말씀드립니다.
가능합니다. 법률, 세무, 회계, 노무, 법인 등기 관련 질의 같은 주제에 대해서는 그 작업이 요구하는 전문성에 맞춰 평가 팀을 구성합니다. 저희는 유자격 전문가를 상시 등록해 두는 인력 풀을 운영하지 않습니다. 투입 가능 여부는 프로젝트마다 그 범위와 물량, 일정에 비추어 판단하며, 어디까지 가능한지는 작업 착수 전에 확인해 드립니다.
합니다. 다만 같은 사람이 하지 않습니다. 한 프로젝트의 평가자는 그 프로젝트의 학습 데이터를 작성한 어노테이터와 분리합니다. 자신이 만드는 데 참여한 가이드라인으로 채점하는 것은 독립적인 측정이 아니기 때문입니다. 데이터를 만든 업체 바깥에서 평가가 이루어지는 편을 원하신다면, 저희는 그것이 합리적인 입장이라고 보며 그렇게 말씀드립니다.
결과와, 그것을 설명하는 실패 분석입니다. 점수만 담긴 리포트는 대응할 수 없습니다 — 필요한 것은 그 뒤에 있는 반복 패턴과 각각의 사례, 그리고 해결책이 데이터를 더 모으는 것인지, 가이드라인을 바꾸는 것인지, 제품을 바꾸는 것인지에 대한 구체적인 견해입니다. 저희는 불편한 결과를 부드럽게 만드는 대신 명확하게 전달하는 편을 택합니다.