视觉与多模态

日语图像、视频与文档标注

边界框、多边形、分割、关键点、视频跟踪、OCR 与文档版面——处理的数据里,图中的文字是日语,文档也遵循日本的商务惯例。

大多数视觉标注与语言无关。可一旦画面里出现文字,或者页面上是一份日式表单,它就会很快变得跟语言极其相关。

日语视觉数据的不同之处

给一辆车画个框,在哪个国家都是同一件事。读懂一张日本收据上的文字则不然。日语文档竖排和横排一样常见,一行之内混用四套书写系统,使用全角拉丁字母与数字,在被注音的词上方带有振假名,还会把公司印章盖在西式表单预期签名的位置。

文档 AI 项目栽的往往是这些细节,而不是模型本身。把一竖列当成五行独立文本的版面标注,或者悄悄把全角数字转成半角的 OCR 转写,产出的训练数据教给模型的,就不是您本来想教的东西。

屏幕上与户外场景中的文字也是同理:店铺招牌、商品包装、菜单与车站指示牌上,密布着通用标注规范根本没有涉及的日文排版形式。

要点速览

任务类型
检测、分割、关键点、分类、视频跟踪、OCR 转写、文档版面与字段抽取。
文档类工作
发票、收据、订购单、合同、申请表、手写填写内容与竖排文本材料。
日语处理
竖排文本、振假名、混合书写系统、全角字符与日式单据惯例。
常用输出
COCO JSON;也支持 YOLO、Pascal VOC、CVAT XML、hOCR 与 ALTO。
复核
几何形状与标签分开复核,因为二者的失效方式不同。

任务类型

我们标注什么

几何形状、类别与文本是分开的层次,也分开复核。

检测与分割

依据量产前商定的标签体系,标注边界框、旋转框、多边形与像素级掩码。

  • 2D 与旋转边界框
  • 多边形与实例分割
  • 语义分割
  • 遮挡与截断标记

关键点与属性

为姿态、商品状态、品相分级等细粒度工作标注关键点位置与逐对象属性。

  • 骨架与关键点
  • 逐对象属性集合
  • 细粒度分类
  • 每个点的可见性标记

视频标注

跨帧跟踪对象并保持身份稳定,同时对动作与事件做时间维度的切分。

  • 多目标跟踪 ID
  • 动作与事件区间
  • 插值帧区间复核
  • 遮挡后的重识别

OCR 与文档版面

在日式商务文档上做文本区域检测、阅读顺序标注、转写与结构角色标注。

  • 文本行与区域检测
  • 竖排与混排版面的阅读顺序
  • 带规范化规则的转写
  • 表格、页眉与印章区域

字段与关系抽取

把一份文档变成结构化取值——哪段文字是合计金额、哪个日期是开具日期、哪些行项目属于同一组。

  • 键值字段标注
  • 表格中的行项目归组
  • 跨页关系
  • 置信度与歧义标记

日语特有问题

通用视觉规范会漏掉什么

日语图像与文档数据上反复出现的四个失效点。

竖排文本与阅读顺序

日语既可以从上到下、从右到左排版,也可以从左到右,而同一页里两者常常混用。默认文本是横行的工具,会给出一个自信而错误的阅读顺序。

我们的处理方式 阅读顺序是显式标注出来的,而不是从几何位置推断的,并对混合方向的页面、注音文字与多栏版面各有规则。

振假名与注音文字

印在汉字词上方或旁边的小号假名是读音注释,不是额外内容。把它们直接串进正文会污染文本;不加分辨地丢弃,又会丢掉您可能需要的信息。

我们的处理方式 注音以链接到其基文本的标注形式保留下来,因此后续可以保留、丢弃或当作读音标签使用,无需重新标注。

全角与半角字符

A123 与 A123 看上去几乎一样,却是不同的字符。这里的规范化若不加控制,就是日语 OCR 数据集中最常见的隐性缺陷之一。

我们的处理方式 转写约定明确写出哪些字符会被规范化、哪些原样保留,并由自动检查在交付前强制执行。

日式单据惯例

日本的发票、收据与申请表有自己的一套结构性词汇——御中、但し書き、公司印章、和历日期,以及并列摆放的含税与不含税合计。

我们的处理方式 字段 schema 基于您实际文档类型的真实样例构建,和历日期、印章区域与税额处理都被定义为一等字段,而不是自由文本。

流程

一个视觉项目是怎么跑的

在任何人开始批量标注之前,标签体系与几何规则先在真实样本上敲定。

  1. 01

    取样并定义标签体系

    我们先标注一小批有代表性的数据,找出其中的歧义情形——什么算作一个对象、画面边缘该怎么处理、什么时候类别确实无法判断。

  2. 02

    撰写几何规则

    框的贴合程度、遮挡处理、最小对象尺寸、截断、成组对象,以及无法辨识文字的处理方式,全部以书面形式定死。

  3. 03

    校准

    多位标注员各自独立标注同一批图像。几何一致性会被度量,一致性低的地方,说明规则有歧义。

  4. 04

    标注与复核

    几何形状与标签分成两遍复核,因为“框很贴但类别错了”和“类别对但框很松”是两种不同的缺陷。

  5. 05

    交付与报告

    标注结果按您的格式交付,随附标签体系版本号、各类别数量统计与该批次的质检报告。

交付

输入与输出格式

我们直接导出成您训练流水线的原生格式,而不是让您自己去写转换器。

图像、视频与文档工作中常见的输出格式。
任务默认输出也可提供
检测与分割COCO JSONYOLO、Pascal VOC、CVAT XML、PNG 格式掩码
关键点与属性COCO keypoints JSONCSV、自定义 JSON schema
视频跟踪MOT 格式逐帧 COCO、CVAT XML
OCR 与版面带页面几何信息的 JSONhOCR、ALTO、PAGE XML
字段抽取JSONL,每行一份文档CSV、您自有的文档 AI schema

质量

针对这类工作的专门控制手段

视觉类缺陷很善于藏身。下面这些检查,能在训练之前就把它们翻出来。

  • 在重新标注的样本上度量几何一致性,与标签一致性分开报告。
  • 自动检查退化框、重叠的重复标注,以及越出图像边界的对象。
  • 阅读顺序与注音链接在每一页文档上都校验,而不是抽样校验。
  • 全角与半角的规范化依据成文约定自动强制执行。
  • 跟踪身份在整段片段范围内检查,以便发现遮挡之后的身份互换。
  • 每一批都复核各类别的数量,好在某个类别悄悄从数据里消失时及早发现。

常见问题

关于图像、视频与文档

关于日语视觉与文档 AI 工作的常见问题。

可以——手写的表单填写内容、地址、姓名与自由填写的备注。手写比印刷体慢,歧义率也确实更高,所以我们会把不确定的字符标出来,而不是靠猜;并且事先约定:无法辨认的字段是尽力转写,还是标记为无法辨识。对您的模型而言,这个决定比那个原始准确率数字更重要。

可以。我们能在客户提供的平台内作业——包括 CVAT、Label Studio、SageMaker Ground Truth、Labelbox 以及内部自研工具——如果您不方便开通账号,也可以在我们自有的安全环境中完成。用哪个平台并不会改变标注规范或复核流程。

可以,而且在大批量的检测类工作上,这往往是明智的做法。风险在于,修正这一遍会继承模型的盲区,所以我们会拿它与一份从零标注的样本做对比度量,告诉您它实际抓出了什么。对日语文档的 OCR,我们更为谨慎,因为模型在全角字符与竖排文本上的错误,在屏幕上很容易被看漏。

在保密协议与数据处理协议之下,在隔离环境中进行,访问权限仅限项目组成员。我们也可以把个人信息标注出来供脱敏,或者只处理您在发送前已脱敏的材料。留存与删除条款写入合同,而不是仅凭一份政策。

日本的文档常用年号纪年——写作 令和6年 而不是 2024——而且同一页上往往两种并存。我们把和历日期作为独立字段处理,保留原始字符串,并在您需要时附上规范化后的公历值,这样转换过程中不会丢失信息,也不会把某个转换错误固化进数据里。

图像与视频

发来一页、一帧,或者一个文件夹。

一份有代表性的真实文档或影像样本,就足以让我们起草一套标签体系、标注一批试点数据,并告诉您歧义会出现在哪里。

在您提供任何数据之前先签保密协议。试点方案评估免费。