常见问题

常见问题

这些是我们真的会被问到的问题,按它们值得的篇幅来回答,而不是一句话打发。做了分组,方便您不用通读就能找到自己那一条。

如果这里没有覆盖到,请随需求一并发来,我们会直接回答,而不是把您又指回这个页面。

01

如何开始

第一次合作大致是什么样子。

从一个范围明确的试点开始。您发来一份有代表性的数据样本,以及一段关于模型该做什么的说明;我们起草这项任务所需要的规范决策,标注一小批数据,并报告在其上实测到的一致性。试点的意义在于找出两位讲道理的标注员会在哪里出现分歧,因为那里正是您的规格不完整的地方。量产的规模与价格是从试点测出的结果推导出来的,而不是估出来的。

一份数据样本、任务描述、您需要的输出格式,以及任何约束条件——截止时间、保密要求、您希望我们在其中作业的工具。仅凭一段任务描述做出的报价只是猜测;与其给出一个第一批之后就会变的数字,我们宁可先花一个小时看真实数据。

从收到数据算起,通常是一到三周,取决于这项任务需要多少规格定义的工作。其中大部分时间花在起草规范与校准上,而不是标注。如果任务已有一份经过检验的现成规范,推进会快得多。

没有固定下限。我们既做小规模试点,也能扩展到大批量的量产项目。真正设下现实门槛的是前期投入——规范工作、工具配置与校准,基本上不随数据量变化,所以一个非常小的一次性任务会摊到不成比例的那部分成本。遇到这种情况我们会直说,而不是把它绕进报价里。

按工作量计价——按条、按音频小时、按张图、按次评测——单价由任务复杂度、复核深度与所需的专业层级决定。规范开发与校准单独计入范围,因为它们是在任何一条数据被标注之前就要做的实打实的工作。试点范围界定的沟通不收费。

02

服务与范围

我们做什么,以及哪些情况我们并不合适。

日语是我们从一开始就为之而建的。我们承接日英双语的工作——翻译审校、跨语言对齐、平行评测集——因为这些依托的是同一份对日语的判断力。至于其他语言的大批量工作,与其接下项目再转包出去,我们更愿意直接告诉您:我们不是合适的供应商。

可以。我们能在客户提供的平台与虚拟桌面中作业,包括政策要求数据绝不离开您的基础设施的情形;如果您不方便开通账号,我们也可以在自有的安全环境中完成。变的是工具;标注规范、复核环节与质检报告都不变。

凡属日语相关的工作,我们都会采集与创建数据——撰写指令数据、构建评测提示词、录制脚本化语音、寻找文档样本。我们不是一家通用型的数据采集机构,大规模的实地采集,交给专门做这件事的供应商会更合适。

可以,而我们做的第一件事,是读他们的标注规范,并对他们已交付数据的一份样本做盲评重标。这能让您在往上继续添加之前,先弄清自己手上到底有什么——包括现有标签内部是否自洽。不去度量一份数据集当前的状况就继续往下做,正是不一致被不断叠加的成因。

提供。对长周期的 AI 项目,专属团队的合作方式很常见:同一批标注员把规范一路带下去,他们积累的上下文本身就是一项实实在在的资产。这也是最容易出现规范漂移的合作方式,所以它会配套定期对照金标准集做重新校准。

03

日语语言

日语覆盖在实操中指的是什么。

涵盖汉字、平假名、片假名与罗马字书写的正式与非正式语体,包括敬语、地域差异、俚语、行业术语,以及日英混排的技术写作。书写选择、数字、标点、表情符号与全角字符的规范化规则,会在项目启动阶段商定,因为正是这些选择决定了整份语料是否内部自洽。

是的。这对那些取决于“一句话听起来如何”而非“它字面指什么”的判断至关重要——一句拒绝读起来是不是拒绝、某个礼貌层级放在这层关系里是否得体、某种措辞听着是不是翻译腔。至于规范写得很紧的机械性任务,这项要求就没那么关键,我们会据此安排人员,而不是为任务并不需要的专业能力收费。

可以,但要说清楚:方言覆盖是一个人员安排问题,我们会具体说明哪些变体我们能稳定覆盖。更重要的决定在上游:方言是照说的样子转写,还是规范化成标准日语。这个选择会彻底改变数据集的性质,必须有意识地做出。

靠一份成文的规范化约定,在标注时执行,并在交付前由自动检查强制校验。它覆盖高频词的书写选择、片假名中的长音写法、阿拉伯数字与汉字数字、全角与半角字符、拉丁文本周围的空格与标点。正字法变体是没有明确规格的日语数据集中最常见的缺陷,也是最容易预防的。

可以,而且我们更愿意采用您的,而不是把我们的强加过去——一个已经在按您的品牌文风写作的模型,就该继续这么写。我们会做的是在试点期间用真实的边界案例检验它,因为大多数风格规范里都有两三条规则,一旦碰上真实数据就会彼此冲突。

04

质量与交付

质量如何度量,以及您会拿到什么。

带机遇校正系数的标注者间一致性、金标准集准确率、裁定率,以及按具名分类体系拆分的错误计数,而不是一个笼统的缺陷总数。所有数值都按标签或按维度报告,而不做混合,因为混合出来的数值恰恰会掩盖那个正在出问题的类别。质量页面说明了每个数字是怎么算的,以及它抓不到什么。

JSONL、CSV、CoNLL-U、COCO、SRT、CTM、TextGrid、hOCR,以及在项目启动阶段定义的自定义 schema。区间类数据无论您采用哪种标签格式,底层一律附带字符偏移量,这样日后更换分词器只是一次重新导出,而不是重新标注。每一批交付都随附其规范版本号与相对上一批的变更记录。

修订与首轮标注走同一条复核与裁定路径——开一条“快速修正通道”,正是数据集在批次之间发生漂移的原因。如果起因是规范存在缺口,我们会修改规范并返工所有受影响的条目,而不只是您标出来的那些,因为同一个缺口在别处也已经造出了同样的错误。

产能取决于任务复杂度、复核深度,以及数据中含有多少真正的歧义,而它在不同任务之间的差异比多数估算所承认的要大得多。我们会在您的数据上、在试点期间测出真实产能,并据此给出交付计划。在还没有人标注过您的数据之前就报出的交付日期,是一个被当成承诺来讲的猜测。

我们会和您一起看具体的那些条目。通常情况是三者之一:规范有歧义,那就修改规范并返工;规范是清楚的但被用错了,那就纠正并把它回流到复核中;或者规范说的正是您现在不希望它说的话,那么这个改动就是一个范围决策。把一次分歧归入这三类之一,比争论那个具体标签更有产出。

05

安全、法务与商务

保密、合同,以及我们如何配合采购流程。

共享任何内容之前先签保密协议,涉及个人信息时另签数据处理协议,权限基于角色且仅限项目在岗人员,作业环境隔离,留存与删除条款写入合同而不是仅凭一份政策。安全页面逐项说明了这些管控措施,以及同样重要的一点——我们不声称什么。

凡是没有写进我们与您合同的认证,我们都不声称持有。就某个具体体系来问,您会得到一个直接的回答,包括回答是“没有”的时候。与其靠一个撑不过审计的说法通过采购,我们宁可因为如实相告而输掉它。

归您。在合作合同之下,交付物与由此产生的标注结果都属于您。我们不会为内部复用、模型训练或作品集材料而保留客户数据;本网站上展示的任何示例材料都是我们自己制作的,仅用于说明。

可以,这在企业合作中很常见。如果某个条款让我们承诺一件我们实际做不到的事——某个具体的准确率数字、一项我们并不持有的认证——我们会直说,并提出替代措辞,而不是签下来然后听天由命。这场对话会慢一些,但比另一种做法要短得多。

涉及转包时会予以披露,且转包方受与我们自有员工相同的保密义务约束。它绝不会被默认为理所当然。如果贵司政策完全禁止转包,请告诉我们,我们会在您做出承诺之前先确认能否在这个前提下安排人员。

06

专家标注

领域专家,以及我们所声称内容的边界。

对于有此需要的项目,我们会围绕所需的领域专长组建团队,成员可以包括在法律、税务、会计、劳务与社会保险、商业登记等领域持有相关资格或具备实务经验的人员。我们不维持固定的持证专业人士名册。能否安排到位,要结合项目的范围、数据量、专业方向与时间要求逐个评估;如果某项资格无法为您的项目落实,我们会在项目启动前告知。

看这项任务需要的是哪一类判断。术语与文档惯例可以通过一份好的术语表加一轮校准,传递给受过训练的标注员;对大多数工作而言这是更好的答案——更快、更一致、也更省。只有当判断本身属于专业判断时才需要专家:一种解释是否站得住脚、一个回答会不会让读者误解自己的义务。

可以。领域专家能就事实准确性、推理质量、专业适当性以及是否符合您设定的标准,对生成的回答打分,也能产出用于对齐工作的偏好排序,以及基准测试集、检索评测与红队测试相关的数据。每一次判断背后的理由都会被记录下来,而这通常正是专家评测值回其成本的地方。

不是。他们是在标注和评测数据。产出的是供您的 AI 系统使用的训练或评测数据,而不是向您或您的用户提供的法律、税务或会计意见;标注项目中产生的任何内容,都不应作为专业意见呈现给终端用户。我们把这一点说明白,是因为这个区分对双方都很重要。

还有问题?

直接问我们。

把它随需求一并发来,回答您的会是一个真正做过您所描述那类项目的人,给出的是具体答案——而不是一个指回本页的链接。

我们在一个工作日内回复。