多模态 · 路线图 路线图——尚未交付

一个可以给它看东西的老挝语模型。

真正重要的老挝语,大多不是打出来的。它被盖章、拍照、手写、打印后又扫描,带着地方口音或作为第二语言说出来,或者念给读不了它的人听。只处理文本的模型一样都够不着。以下是会发生的变化、为什么老挝语尤其需要,以及大致的时间。

什么是多模态模型

文本模型读取词元。多模态模型接受不止一种输入——图像、音频、视频、文档——并在与文本相同的上下文中对它们进行推理。常见做法是为每种模态接一个编码器到语言模型上并训练这个连接,让图像成为语言模型可以与提示词中的文字一同关注的东西。

实践中最重要的概念是视觉语言模型:带有图像编码器的语言模型,几乎所有“它能读我的截图吗”这类能力,实际上都是它。IBM 的定义是简短版——能够处理多种模态(如文本、图像和音频)并跨模态推理的模型——而 NVIDIA 的术语表是视觉那一半的简短版。

这个想法比当前这波浪潮更早。CLIP 在 2021 年证明,可以用自然语言作监督,把图像和文本训练进同一个空间;Flamingo 证明,冻结的语言模型只需少量示例就能学会关注图像;视觉指令微调则让结果变成可以对话的东西。今天投入使用的一切,都源自这三项工作。

阅读原始资料

为什么老挝语比英语更需要它

这不是同一个功能换一种语言。有四件事让老挝语文档视觉成为一个独立的技术难题,而这四点也都是通用模型在这方面表现不佳的原因。

1

老挝文 OCR 尚未解决

词与词之间没有空格,识别器无法靠空白找到边界。元音和声调符号分布在辅音的上方、下方和周围,扫描时只要丢了其中一个,这个词就会悄无声息地变成另一个词,而不是明显地出错——而且可供学习的老挝语文本,比任何一种主要语言都少得多。

2

文件是拍的,不是扫的

真实的输入是用手机拍下的一页盖章文件,放在桌上,歪着,办公室里只有一根日光灯。用干净扫描件做的基准测试对此毫无参考价值。

3

手写仍是主要界面

村务登记簿、诊所记录、送货单、学校成绩单、户籍簿。老挝文手写的连笔和缩写方式,是用印刷文本训练所覆盖不到的。

4

数字不只是数字

老挝数字 ໐–໙ 与阿拉伯数字并存;政府文件用公历纪年,寺院记录则用比公历早 543 年的佛历;基普金额动辄很大,千位分隔符读错一个,数字就差了一千倍。年份读错,文件里的每个日期都会错。


四种感官,三个模型

以独立模型而非一个大模型交付,这样路由器可以把照片交给会读的模型、把录音交给会听的模型——谁也不必为另一个的权重买单。

图像 · 视频帧

LaoLLM-Vision

照片、截图、图表、货架、场景、表格。用老挝语回答画面里有什么,并附上处理它的区域。

文档 · 手写

LaoLLM-Scribe

文档专家:把盖章、扫描、歪斜、多栏、部分手写的老挝语纸质文件,转成可以存进数据库的结构化字段。

音频输入 · 音频输出

LaoLLM-Voice

覆盖各地区变体的老挝语语音识别与合成,包括一种常见情况:母语不是老挝语的人提出问题,用浅白的老挝语作答。

以上全部,合而为一

跨模态

真正重要的那个:一张照片和一句口头提问放在同一个请求里,依据你自己的文档作答。分开的模型,正是为了让这种能力变得便宜。


十八件以前做不到的事

每一件都是今天老挝有人在做的工作——把眼前的东西重新打一遍。以下为示意,描述的是目标能力,而非已交付的功能。

政府与公共部门

拍一页户籍簿

把镜头对准 ປຶ້ມສຳມະໂນຄົວ,每个字段都以结构化数据返回——姓名、身份证号、村、县、省——没有一项需要办事员在下午四点重新录入。

从照片读懂《政府公报》公告

一页扫描的《政府公报》变成摘要,每项义务都能追溯到出处条款,生效日期是读出来的,而不是猜出来的。

把手写的村务会议记录变成文件

拍下委员会秘书亲手写的那一页,得到一份公文语体的老挝文打字稿,人名写法统一,决议逐条编号。

排队之前先检查表格

拍下填了一半的部委表格,就知道哪些栏没填、缺哪个章,以及哪份附件会让你被办事处打发回家。

医疗卫生

把药品标签讲给你听

一张药店标签的照片——标签往往不是用老挝语印的——变成用浅白老挝语讲解剂量和服用时间的语音,给读得慢、或完全看不懂那种语言的病人。

让出院小结真正有用

拍下医院的出院小结,就能用家里说的语言得到“这周该做什么”,复诊日期也会设成提醒。

农业

从照片诊断稻叶

给它看病斑,就能知道它像什么、常被误认成什么、该打给哪个县农业办公室——并明确拒绝开出它没有把握的化学药剂。

读懂肥料袋,算出用量

拍下袋子,大声说出地块有多少公顷,就能站在田里、在离线状态下以语音得到配比。

商业与金融

把一叠收据变成增值税表

拍下这一叠。得到一张列出供应商、税号、日期、增值税和合计的表格,并标出哪些收据不是有效的增值税发票、过不了审计。

把二维码付款回单与发票对账

一张银行应用或全国通用二维码转账回单的截图,与它所支付的发票相匹配,金额和参考号逐一核对,差异被点明,而不是被悄悄忽略。

盘点货架

拍下货架,得到一份老挝语商品清单,包括排面数和缺货位——这份工作如今是一个人拿着记录板,把一条通道走上两遍。

教育

用课本的一页备课

拍下这一页,得到一份对应国家课程目标的教案,并明确指出这一页没覆盖的两个目标。

批改手写的老挝语作业

拍下学生的作业,拼写、元音和声调符号错误都会被标出,并注明各自违反的规则——让批改成为教学,而不只是打分。

旅游与服务

翻译菜单,但不丢掉菜名

拍下菜单。客人看到的是自己的语言和过敏原信息;菜品保留老挝语名称,因为 ລາບ 不是“肉沙拉”,餐厅也不该被迫假装它是。

读一段碑文

拍下寺庙碑文或贝叶手稿,得到转写、浅白老挝语的释读,以及一份诚实的说明:哪些字已经磨损到无法辨认。

工业与物流

把送货单录入系统

在装卸平台拍下送货单,让结构化字段直接进入 WMS——包括有人用圆珠笔手改的数量。

根据画面写事件报告

一帧 CCTV 画面变成带描述和时间戳的老挝语事件记录,采用提交报告所要求的语体,由人来签字。

无障碍

描述这个房间

举起镜头,就能以步行的节奏用老挝语听到面前有什么——这项技术的这个版本,根本不是什么效率功能。


在 API 中是什么样子

同一个端点。在 content 数组里放一张图片,其余交给路由器——这也正是路由功能最先交付的原因。

POST /v1/messages
{
  "model": "auto",                     // the router picks
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
      { "type": "text",  "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
    ]
  }],
  "lao": { "register": "official", "dialect": "auto" }
}

// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
//   "region": "la-vte-1", "usage": { "kip": 42.60 } }

路线图

四个阶段。没有一个是日期:每个阶段在其评估集通过后才开放,评估由老挝语使用者打分,而不是看排行榜。

  1. 1
    阶段 1 · 文档视觉

    把印刷和扫描的老挝语文件转成结构化字段。老挝数字和两种历法在读取时就处理好,而不是事后修补。

    关卡
  2. 2
    阶段 2 · 照片与手写

    角度倾斜的手机照片、图章、公章,以及老挝文手写。这一阶段决定产品在办公室之外是否用得上。

    关卡
  3. 3
    阶段 3 · 语音,每一种变体

    语音输入与输出,按每一种地区变体、以及把老挝语当作第二语言的说话人分别评分——因为把它们混在一起的平均分,恰恰掩盖了最要紧的失败。

    关卡
  4. 4
    阶段 4 · 设备端跨模态

    一个压缩的视觉模型,在中端 Android 手机上离线运行,服务于没有信号的地方所发生的工作。

    关卡

预发布计划

选择你的加入方式。

三类名额已开放。选择其一即会配置下方表单——你也可以在那里更改。