检测与分割
依据量产前商定的标签体系,标注边界框、旋转框、多边形与像素级掩码。
- 2D 与旋转边界框
- 多边形与实例分割
- 语义分割
- 遮挡与截断标记
视觉与多模态
边界框、多边形、分割、关键点、视频跟踪、OCR 与文档版面——处理的数据里,图中的文字是日语,文档也遵循日本的商务惯例。
大多数视觉标注与语言无关。可一旦画面里出现文字,或者页面上是一份日式表单,它就会很快变得跟语言极其相关。
给一辆车画个框,在哪个国家都是同一件事。读懂一张日本收据上的文字则不然。日语文档竖排和横排一样常见,一行之内混用四套书写系统,使用全角拉丁字母与数字,在被注音的词上方带有振假名,还会把公司印章盖在西式表单预期签名的位置。
文档 AI 项目栽的往往是这些细节,而不是模型本身。把一竖列当成五行独立文本的版面标注,或者悄悄把全角数字转成半角的 OCR 转写,产出的训练数据教给模型的,就不是您本来想教的东西。
屏幕上与户外场景中的文字也是同理:店铺招牌、商品包装、菜单与车站指示牌上,密布着通用标注规范根本没有涉及的日文排版形式。
要点速览
任务类型
几何形状、类别与文本是分开的层次,也分开复核。
依据量产前商定的标签体系,标注边界框、旋转框、多边形与像素级掩码。
为姿态、商品状态、品相分级等细粒度工作标注关键点位置与逐对象属性。
跨帧跟踪对象并保持身份稳定,同时对动作与事件做时间维度的切分。
在日式商务文档上做文本区域检测、阅读顺序标注、转写与结构角色标注。
把一份文档变成结构化取值——哪段文字是合计金额、哪个日期是开具日期、哪些行项目属于同一组。
日语特有问题
日语图像与文档数据上反复出现的四个失效点。
日语既可以从上到下、从右到左排版,也可以从左到右,而同一页里两者常常混用。默认文本是横行的工具,会给出一个自信而错误的阅读顺序。
我们的处理方式 阅读顺序是显式标注出来的,而不是从几何位置推断的,并对混合方向的页面、注音文字与多栏版面各有规则。
印在汉字词上方或旁边的小号假名是读音注释,不是额外内容。把它们直接串进正文会污染文本;不加分辨地丢弃,又会丢掉您可能需要的信息。
我们的处理方式 注音以链接到其基文本的标注形式保留下来,因此后续可以保留、丢弃或当作读音标签使用,无需重新标注。
A123 与 A123 看上去几乎一样,却是不同的字符。这里的规范化若不加控制,就是日语 OCR 数据集中最常见的隐性缺陷之一。
我们的处理方式 转写约定明确写出哪些字符会被规范化、哪些原样保留,并由自动检查在交付前强制执行。
日本的发票、收据与申请表有自己的一套结构性词汇——御中、但し書き、公司印章、和历日期,以及并列摆放的含税与不含税合计。
我们的处理方式 字段 schema 基于您实际文档类型的真实样例构建,和历日期、印章区域与税额处理都被定义为一等字段,而不是自由文本。
流程
在任何人开始批量标注之前,标签体系与几何规则先在真实样本上敲定。
我们先标注一小批有代表性的数据,找出其中的歧义情形——什么算作一个对象、画面边缘该怎么处理、什么时候类别确实无法判断。
框的贴合程度、遮挡处理、最小对象尺寸、截断、成组对象,以及无法辨识文字的处理方式,全部以书面形式定死。
多位标注员各自独立标注同一批图像。几何一致性会被度量,一致性低的地方,说明规则有歧义。
几何形状与标签分成两遍复核,因为“框很贴但类别错了”和“类别对但框很松”是两种不同的缺陷。
标注结果按您的格式交付,随附标签体系版本号、各类别数量统计与该批次的质检报告。
交付
我们直接导出成您训练流水线的原生格式,而不是让您自己去写转换器。
| 任务 | 默认输出 | 也可提供 |
|---|---|---|
| 检测与分割 | COCO JSON | YOLO、Pascal VOC、CVAT XML、PNG 格式掩码 |
| 关键点与属性 | COCO keypoints JSON | CSV、自定义 JSON schema |
| 视频跟踪 | MOT 格式 | 逐帧 COCO、CVAT XML |
| OCR 与版面 | 带页面几何信息的 JSON | hOCR、ALTO、PAGE XML |
| 字段抽取 | JSONL,每行一份文档 | CSV、您自有的文档 AI schema |
质量
视觉类缺陷很善于藏身。下面这些检查,能在训练之前就把它们翻出来。
常见问题
关于日语视觉与文档 AI 工作的常见问题。
可以——手写的表单填写内容、地址、姓名与自由填写的备注。手写比印刷体慢,歧义率也确实更高,所以我们会把不确定的字符标出来,而不是靠猜;并且事先约定:无法辨认的字段是尽力转写,还是标记为无法辨识。对您的模型而言,这个决定比那个原始准确率数字更重要。
可以。我们能在客户提供的平台内作业——包括 CVAT、Label Studio、SageMaker Ground Truth、Labelbox 以及内部自研工具——如果您不方便开通账号,也可以在我们自有的安全环境中完成。用哪个平台并不会改变标注规范或复核流程。
可以,而且在大批量的检测类工作上,这往往是明智的做法。风险在于,修正这一遍会继承模型的盲区,所以我们会拿它与一份从零标注的样本做对比度量,告诉您它实际抓出了什么。对日语文档的 OCR,我们更为谨慎,因为模型在全角字符与竖排文本上的错误,在屏幕上很容易被看漏。
在保密协议与数据处理协议之下,在隔离环境中进行,访问权限仅限项目组成员。我们也可以把个人信息标注出来供脱敏,或者只处理您在发送前已脱敏的材料。留存与删除条款写入合同,而不是仅凭一份政策。
日本的文档常用年号纪年——写作 令和6年 而不是 2024——而且同一页上往往两种并存。我们把和历日期作为独立字段处理,保留原始字符串,并在您需要时附上规范化后的公历值,这样转换过程中不会丢失信息,也不会把某个转换错误固化进数据里。