マルチモーダル · ロードマップ ロードマップ — 未提供

ものを見せられる、ラオ語のモデル。

大事なラオ語の多くは、キーボードで打たれてはいません。押印され、撮影され、手で書かれ、印刷されてはまたスキャンされ、地方のなまりで、あるいは第二言語として話され、読めない人のために読み上げられています。テキスト専用のモデルは、そのどれにも届きません。ここでは、何が変わるのか、なぜラオ語にこそそれが必要なのか、そしておおよその時期を説明します。

マルチモーダルモデルとは

テキストモデルはトークンを読みます。マルチモーダルモデルは、画像、音声、動画、文書など複数の種類の入力を受け取り、テキストと同じ文脈の中でそれらについて推論します。一般的な構成では、モダリティごとのエンコーダーを言語モデルにつなぎ、その接続部分を学習させます。こうして画像は、プロンプトの言葉と並んで言語モデルが注意を向けられるものになります。

実務で重要なのは、視覚言語モデルという言葉です。画像エンコーダーを備えた言語モデルのことで、「スクリーンショットを読める?」という類いの機能は、ほぼすべて実際にはこれです。短い定義としては IBM のもの(テキスト、画像、音声など複数のモダリティを処理し、それらをまたいで推論できるモデル)があり、視覚の側については NVIDIA の用語集が簡潔です。

この発想は、いまの波よりも古いものです。CLIP は2021年に、自然言語を教師信号として、画像とテキストを共通の空間に学習できることを示しました。Flamingo は、凍結した言語モデルに少数の例で画像への注意を学ばせられることを示しました。視覚的な指示チューニングは、その成果を対話できるものに変えました。いま使われているものはすべて、この3つの流れをくんでいます。

一次資料を読む

なぜラオ語は英語以上にこれを必要とするのか

同じ機能を別の言語で提供するのとは違います。4 つの点がラオ語の文書認識を独自の技術課題にしており、その 4 つすべてが、汎用モデルがここで力を発揮できない理由でもあります。

1

ラオ語の OCR は解決していない

単語の間にスペースがないため、認識エンジンは空白を手がかりに境界を見つけられません。母音記号と声調記号は子音の上下や周囲に付くため、スキャンでそのどれかが欠けると、目に見えて崩れるのではなく、黙って別の単語に変わってしまいます。しかも、学習に使えるラオ語のテキストは、どの主要言語と比べてもはるかに少ないのです。

2

書類はスキャンされず、撮影される

実際の入力は、机の上の押印されたページをスマートフォンで斜めに撮った、蛍光灯が1本しかない事務所の写真です。きれいなスキャン画像でのベンチマークは、これについて何も教えてくれません。

3

手書きはいまも主要なインターフェース

村の台帳、診療所の記録、納品書、学校の成績表、家族登録簿。ラオ語の手書きは、印刷文字での学習では拾えない形で文字をつなげ、省略します。

4

数字は、ただの数字ではない

アラビア数字と並ぶラオ数字 ໐–໙、政府の書類では西暦、寺院の記録では 543 年進んだ仏暦、そして桁区切りを 1 つ読み違えるだけで数字が千倍ずれるほど大きなキープの金額。年を読み違えれば、文書中のすべての日付が間違います。


4つの感覚、3つのモデル

1つの大きなモデルではなく、別々のモデルとして提供します。そうすればルーターは、写真を読むモデルへ、録音を聞くモデルへと振り分けられ、どちらも相手の重みの分まで支払わずに済みます。

画像 · 動画フレーム

LaoLLM-Vision

写真、スクリーンショット、グラフ、陳列棚、風景、書類。画像に何が写っているかをラオ語で答え、処理したリージョンを添えます。

文書 · 手書き

LaoLLM-Scribe

文書の専門家。押印され、スキャンされ、傾き、段組みがあり、一部が手書きのラオ語の書類を、データベースに入れられる構造化された項目に変換します。

音声入力 · 音声出力

LaoLLM-Voice

地域ごとの変種に対応したラオ語の音声認識と音声合成。ラオ語を母語としない人が尋ねた質問に平易なラオ語で答えるという、よくある場面も含みます。

上記のすべてを、ひとつに

クロスモーダル

本当に重要なのはこれです。1枚の写真と口頭の質問を同じリクエストに入れ、自社の文書にもとづいて答えます。別々のモデルは、この能力を安くするために存在します。


これまでできなかった18のこと

どれも、いまラオスで誰かが目の前のものを打ち直して行っている仕事です。説明用の例であり、目指す能力を示すもので、提供済みの機能ではありません。

行政・公共部門

家族登録簿のページを撮る

ປຶ້ມສຳມະໂນຄົວ にカメラを向けると、氏名、ID 番号、村、郡、県まで、すべての項目が構造化データで返ってきます。午後 4 時に職員がどれか 1 つでも打ち直す必要はありません。

写真から官報の告示を読む

スキャンした官報のページが要約になり、各義務は根拠となる条文までたどれます。施行日は推測ではなく、読み取ったものです。

手書きの村の議事録を文書にする

委員会の書記が実際に書いたページを撮ると、公文書の文体で清書されたラオ語の議事録になります。人名の表記はそろい、決議には番号が振られます。

並ぶ前に書類を確認する

書きかけの省の申請書を撮ると、空欄の項目、足りない印、そして窓口で追い返される原因になる添付書類が分かります。

医療

薬のラベルを声で説明する

薬局のラベル(ラオ語以外の言語で印刷されていることも多い)の写真が、用量と服用のタイミングを平易なラオ語で説明する音声になります。読むのが遅い患者や、その言語をまったく読めない患者のために。

退院時の書類を役立つものにする

病院の退院サマリーを撮ると、家で話している言語で「今週やること」が分かり、再診日はリマインダーに登録されます。

農業

写真から稲の葉を診断する

病斑を見せると、何に似ているか、何とよく取り違えられるか、どの郡の農業事務所に電話すべきかが分かります。確信の持てない薬剤を処方することは、はっきりと断ります。

肥料の袋を読み、量を計算する

袋を撮り、畑の広さをヘクタールで声に出して言うと、混合比が音声で返ってきます。オフラインのまま、畑に立ったままで。

商業・金融

領収書の束を VAT の表にする

束を撮ってください。仕入先、納税者番号、日付、VAT、合計の表ができ、有効な VAT インボイスではなく監査に通らない領収書には印が付きます。

QR 決済の控えを請求書と照合する

銀行アプリや国内 QR の振込控えのスクリーンショットを、支払い対象の請求書と突き合わせます。金額と参照番号を確認し、食い違いは黙って見過ごさず、はっきり指摘します。

陳列棚を数える

棚を撮ると、フェイス数と欠品を含むラオ語の商品リストができます。いまはクリップボードを持った人が通路を 2 回歩いてこなしている仕事です。

教育

教科書のページから授業を組み立てる

ページを撮ると、国のカリキュラムの目標に対応した指導案ができ、そのページでは扱っていない2つの目標も明記されます。

手書きのラオ語の宿題を添削する

生徒のページを撮ると、つづり、母音記号、声調記号の誤りに、それぞれが破っている規則付きで印が付きます。点をつけるだけでなく、教えるための添削になります。

観光・サービス

料理を失わずにメニューを訳す

メニューを撮ってください。客は自分の言語とアレルゲン情報を受け取り、料理はラオ語の名前のままです。ລາບ は「肉のサラダ」ではなく、店がそう装う必要もないからです。

碑文を読む

寺の碑文や貝葉写本を撮ると、翻字、平易なラオ語での読み、そしてどの文字がすり減って判読できないかについての正直な注記が得られます。

産業・物流

納品書をシステムに取り込む

荷受け場で納品書を撮り、構造化された項目をそのまま WMS に入れます。誰かがボールペンで手書きした数量の訂正も含めて。

映像のコマから事故報告を書く

CCTV の静止画が、説明とタイムスタンプ付きのラオ語の事案記録になります。報告書の提出に必要な文体で書かれ、署名は人が行います。

アクセシビリティ

部屋の様子を伝える

カメラを向けると、目の前に何があるかを、歩く速さに合わせてラオ語で聞けます。この技術の、生産性のための機能ではまったくない使い方です。


API ではこうなる

同じエンドポイントです。content 配列に画像を1つ入れれば、あとはルーターが処理します。ルーティングを最初に提供したのは、まさにこのためです。

POST /v1/messages
{
  "model": "auto",                     // the router picks
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
      { "type": "text",  "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
    ]
  }],
  "lao": { "register": "official", "dialect": "auto" }
}

// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
//   "region": "la-vte-1", "usage": { "kip": 42.60 } }

ロードマップ

4 つの段階があり、どれも日付ではありません。各段階はその評価スイートに合格した時点で始まり、採点はランキングではなくラオ語話者が行います。

  1. 1
    段階1 · 文書認識

    印刷・スキャンされたラオ語の文書を構造化された項目に変換。ラオ数字と両方の暦は読み取りの時点で処理し、後から継ぎはぎしません。

    ゲート
  2. 2
    段階2 · 写真と手書き

    斜めから撮ったスマートフォンの写真、印章、公印、ラオ語の手書き。製品が事務所の外で役立つかどうかを決める段階です。

    ゲート
  3. 3
    段階 3 · 音声、すべての変種

    音声の入力と出力を、地域の変種ごと、そしてラオ語を第二言語として話す人について、別々に採点します。全体の平均は、まさに重要な失敗を覆い隠してしまうからです。

    ゲート
  4. 4
    段階4 · 端末内のクロスモーダル

    中価格帯の Android スマートフォンでオフラインのまま動く、圧縮した視覚モデル。電波の届かない場所で行われる仕事のために。

    ゲート

参考資料

マルチモーダルモデルに関する背景資料。一次資料のドキュメントと、この分野の土台となった論文から。外部リンクであり、LaoGPT とは提携関係にありません。

IBMWhat is a multimodal LLM? — IBM

マルチモーダルな大規模言語モデルとは何か、何に使うのかを示す、最も明快な短い定義。

NVIDIAWhat are vision-language models? — NVIDIA glossary

画像エンコーダーを言語モデルにつなぎ、視覚を与える仕組み。

WikipediaVision-language model — Wikipedia

幅広い参考文献を備えた中立的な概説。細部に入る前に分野の全体像をつかみたい方に。

AnthropicVision — Claude API documentation

モデルに画像を送るための実践的なドキュメントと、その実際の制約。

GoogleImage understanding — Gemini API documentation

文書や動画の入力を含め、根本からマルチモーダルな API。

OpenAIImages and vision — OpenAI platform documentation

もう1つの広く使われている画像 API。リクエストの形を比べるのに。

Hugging FaceImage-text-to-text — Hugging Face

オープンモデルの側。タスクの定義と、自分で動かせるモデル。

arXiv 2103.00020Learning Transferable Visual Models From Natural Language Supervision

CLIP、2021年。画像とテキストを共通の表現に学習させた、現代のこの分野の出発点となる論文。

arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learning

2022年。凍結した言語モデルに画像への注意を学ばせる方法。

arXiv 2304.08485Visual Instruction Tuning

2023年。LLaVA と、視覚言語モデルを対話型にした一歩。

先行版プログラム

参加方法を選んでください。

3つの枠が開いています。1つ選ぶと下のフォームが設定されます — そこで変更もできます。