拍一页户籍簿
把镜头对准 ປຶ້ມສຳມະໂນຄົວ,每个字段都以结构化数据返回——姓名、身份证号、村、县、省——没有一项需要办事员在下午四点重新录入。
多模态 · 路线图 路线图——尚未交付
真正重要的老挝语,大多不是打出来的。它被盖章、拍照、手写、打印后又扫描,带着地方口音或作为第二语言说出来,或者念给读不了它的人听。只处理文本的模型一样都够不着。以下是会发生的变化、为什么老挝语尤其需要,以及大致的时间。
什么是多模态模型
文本模型读取词元。多模态模型接受不止一种输入——图像、音频、视频、文档——并在与文本相同的上下文中对它们进行推理。常见做法是为每种模态接一个编码器到语言模型上并训练这个连接,让图像成为语言模型可以与提示词中的文字一同关注的东西。
实践中最重要的概念是视觉语言模型:带有图像编码器的语言模型,几乎所有“它能读我的截图吗”这类能力,实际上都是它。IBM 的定义是简短版——能够处理多种模态(如文本、图像和音频)并跨模态推理的模型——而 NVIDIA 的术语表是视觉那一半的简短版。
这个想法比当前这波浪潮更早。CLIP 在 2021 年证明,可以用自然语言作监督,把图像和文本训练进同一个空间;Flamingo 证明,冻结的语言模型只需少量示例就能学会关注图像;视觉指令微调则让结果变成可以对话的东西。今天投入使用的一切,都源自这三项工作。
阅读原始资料为什么老挝语比英语更需要它
这不是同一个功能换一种语言。有四件事让老挝语文档视觉成为一个独立的技术难题,而这四点也都是通用模型在这方面表现不佳的原因。
词与词之间没有空格,识别器无法靠空白找到边界。元音和声调符号分布在辅音的上方、下方和周围,扫描时只要丢了其中一个,这个词就会悄无声息地变成另一个词,而不是明显地出错——而且可供学习的老挝语文本,比任何一种主要语言都少得多。
真实的输入是用手机拍下的一页盖章文件,放在桌上,歪着,办公室里只有一根日光灯。用干净扫描件做的基准测试对此毫无参考价值。
村务登记簿、诊所记录、送货单、学校成绩单、户籍簿。老挝文手写的连笔和缩写方式,是用印刷文本训练所覆盖不到的。
老挝数字 ໐–໙ 与阿拉伯数字并存;政府文件用公历纪年,寺院记录则用比公历早 543 年的佛历;基普金额动辄很大,千位分隔符读错一个,数字就差了一千倍。年份读错,文件里的每个日期都会错。
四种感官,三个模型
以独立模型而非一个大模型交付,这样路由器可以把照片交给会读的模型、把录音交给会听的模型——谁也不必为另一个的权重买单。
照片、截图、图表、货架、场景、表格。用老挝语回答画面里有什么,并附上处理它的区域。
文档专家:把盖章、扫描、歪斜、多栏、部分手写的老挝语纸质文件,转成可以存进数据库的结构化字段。
覆盖各地区变体的老挝语语音识别与合成,包括一种常见情况:母语不是老挝语的人提出问题,用浅白的老挝语作答。
真正重要的那个:一张照片和一句口头提问放在同一个请求里,依据你自己的文档作答。分开的模型,正是为了让这种能力变得便宜。
十八件以前做不到的事
每一件都是今天老挝有人在做的工作——把眼前的东西重新打一遍。以下为示意,描述的是目标能力,而非已交付的功能。
把镜头对准 ປຶ້ມສຳມະໂນຄົວ,每个字段都以结构化数据返回——姓名、身份证号、村、县、省——没有一项需要办事员在下午四点重新录入。
一页扫描的《政府公报》变成摘要,每项义务都能追溯到出处条款,生效日期是读出来的,而不是猜出来的。
拍下委员会秘书亲手写的那一页,得到一份公文语体的老挝文打字稿,人名写法统一,决议逐条编号。
拍下填了一半的部委表格,就知道哪些栏没填、缺哪个章,以及哪份附件会让你被办事处打发回家。
一张药店标签的照片——标签往往不是用老挝语印的——变成用浅白老挝语讲解剂量和服用时间的语音,给读得慢、或完全看不懂那种语言的病人。
拍下医院的出院小结,就能用家里说的语言得到“这周该做什么”,复诊日期也会设成提醒。
给它看病斑,就能知道它像什么、常被误认成什么、该打给哪个县农业办公室——并明确拒绝开出它没有把握的化学药剂。
拍下袋子,大声说出地块有多少公顷,就能站在田里、在离线状态下以语音得到配比。
拍下这一叠。得到一张列出供应商、税号、日期、增值税和合计的表格,并标出哪些收据不是有效的增值税发票、过不了审计。
一张银行应用或全国通用二维码转账回单的截图,与它所支付的发票相匹配,金额和参考号逐一核对,差异被点明,而不是被悄悄忽略。
拍下货架,得到一份老挝语商品清单,包括排面数和缺货位——这份工作如今是一个人拿着记录板,把一条通道走上两遍。
拍下这一页,得到一份对应国家课程目标的教案,并明确指出这一页没覆盖的两个目标。
拍下学生的作业,拼写、元音和声调符号错误都会被标出,并注明各自违反的规则——让批改成为教学,而不只是打分。
拍下菜单。客人看到的是自己的语言和过敏原信息;菜品保留老挝语名称,因为 ລາບ 不是“肉沙拉”,餐厅也不该被迫假装它是。
拍下寺庙碑文或贝叶手稿,得到转写、浅白老挝语的释读,以及一份诚实的说明:哪些字已经磨损到无法辨认。
在装卸平台拍下送货单,让结构化字段直接进入 WMS——包括有人用圆珠笔手改的数量。
一帧 CCTV 画面变成带描述和时间戳的老挝语事件记录,采用提交报告所要求的语体,由人来签字。
举起镜头,就能以步行的节奏用老挝语听到面前有什么——这项技术的这个版本,根本不是什么效率功能。
在 API 中是什么样子
同一个端点。在 content 数组里放一张图片,其余交给路由器——这也正是路由功能最先交付的原因。
POST /v1/messages
{
"model": "auto", // the router picks
"messages": [{
"role": "user",
"content": [
{ "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
{ "type": "text", "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
]
}],
"lao": { "register": "official", "dialect": "auto" }
}
// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
// "region": "la-vte-1", "usage": { "kip": 42.60 } }路线图
四个阶段。没有一个是日期:每个阶段在其评估集通过后才开放,评估由老挝语使用者打分,而不是看排行榜。
把印刷和扫描的老挝语文件转成结构化字段。老挝数字和两种历法在读取时就处理好,而不是事后修补。
关卡角度倾斜的手机照片、图章、公章,以及老挝文手写。这一阶段决定产品在办公室之外是否用得上。
关卡语音输入与输出,按每一种地区变体、以及把老挝语当作第二语言的说话人分别评分——因为把它们混在一起的平均分,恰恰掩盖了最要紧的失败。
关卡一个压缩的视觉模型,在中端 Android 手机上离线运行,服务于没有信号的地方所发生的工作。
关卡参考资料
关于多模态模型的背景阅读,来自原始文档以及这一领域赖以建立的论文。外部链接,与 LaoGPT 无关联。
对多模态大语言模型及其用途最清楚的简短定义。
NVIDIAWhat are vision-language models? — NVIDIA glossary图像编码器如何接到语言模型上,让它看得见。
WikipediaVision-language model — Wikipedia一篇中立的综述,参考文献丰富,适合在看细节之前先了解这个领域的全貌。
AnthropicVision — Claude API documentation把图片发给模型的实用文档,以及这样做的实际限制。
GoogleImage understanding — Gemini API documentation从底层就是多模态的 API,支持文档和视频作为输入。
OpenAIImages and vision — OpenAI platform documentation另一个被广泛使用的图像 API,可用来比较请求的形式。
Hugging FaceImage-text-to-text — Hugging Face开放模型这一侧:任务定义,以及你可以自己运行的模型。
arXiv 2103.00020Learning Transferable Visual Models From Natural Language SupervisionCLIP,2021——把图像和文本训练进同一种表示。现代这一领域的起点论文。
arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learning2022——如何让冻结的语言模型学会关注图像。
arXiv 2304.08485Visual Instruction Tuning2023——LLaVA,以及让视觉语言模型能够对话的那一步。
预发布计划
三类名额已开放。选择其一即会配置下方表单——你也可以在那里更改。
预发布 · 报名开放
三个字段。告诉我们你是谁、往哪里联系,邀请准备好后我们会发邮件通知。
3G 网络下也能用 · ພາສາລາວ / English