スマートルーティング
基準を満たす、最も安いモデル。
ルーターは、AI プラットフォームと AI の請求書を分けるものです。LaoGPT はすべてのリクエストを分類し、ファミリー内の各モデルが実際にできることと照らし合わせて評価し、正しくこなせる最小のモデルに送ります。そのうえで回答を確認し、正しくなければ上位に回します。このページでは、その判断がどう下されるか、そして何を強制できるかを説明します。
トークンを生成する前の4つの判断
どのモデルか
書き直しには Lite、たいていは Base、文脈が収まらなければ Pro、画像があれば Vision、音声があれば Voice、人が推論の筋道を監査する必要があれば Reason。
どこで実行するか
端末で処理できるなら端末で、できなければ国内で。そしてワークスペースが、リクエストが出ていくことになるリージョンを固定していれば、どこでも実行しません。
いくらかかるか
ルーターは各モデルのキープ建て料金と、アカウントの残高を把握しています。安いリクエストを念のために高いモデルへ送ることはしません。
上位に回すか
最初の回答をリクエストと照らして確認します。確認に失敗すれば上位のモデルに回し、そのことをレスポンスに明記します。何が起き、いくらかかったかが分かります。
読み取るもの
8つのシグナルがあり、どれもリクエストの説明を求めません。8つすべてがレスポンスに表示されるので、ルーティングの判断は、ただ受け入れるものではなく、異を唱えられるものになります。
タスクの種類
書く、要約する、翻訳する、抽出する、分類する、推論する。自動で推定し、上書きできます。
文字と変種
ビエンチャン、北部、または南部のラオ語、タイ語や英語が混じったラオ語、ローマ字で入力したラオ語。
モダリティ
テキスト、画像、スキャンした PDF、音声。リクエストに画像があれば、テキスト専用のモデルはすべて候補から外れます。
コンテキスト長
文字数からの推定ではなく、ラオ語のトークナイザーで実測します。外国のプラットフォームは、まさにこの推定で誤ります。
機微性
ラオスの ID カード番号、家族登録簿の記載事項、患者の診療記録、納税者番号。ローカルで検出し、リクエストがどこかへ送られる前にルートを固定します。
接続状況
オフライン、データセーバー、通常。ルーターが下げるのはモデルであって、回答ではありません。
予算
キープ建てのプリペイド残高と、アカウントが設定した 1 リクエストあたりの上限。
応答時間の要件
音声の回答は1秒以内に最初のトークンが必要です。夜間のバッチ処理は違います。
ルーティング表
説明用です。実際の表はプラットフォームから配信され、モデルが追加されるたびに変わります。だからこそ、クライアントにモデル名を書き込まないのです。
拒否してよいルート
ほかのルーティング層はどれも、コストと応答時間を最適化します。この層には 3 つ目の軸があり、機関が実際に買うのはそこです。ワークスペースは、リクエストが la-vte-1 の外へ一切出ないと宣言でき、その場合ルーターは、黙って別の場所のモデルを探すのではなくエラーを返します。拒否は機能です。そしてそれは、ルーターと出会っても崩れない、唯一のデータ所在地のかたちでもあります。
409 route_forbidden · workspace pinned to la-vte-1エスカレーションの段階
エスカレーションは目に見え、最大のモデルの料金ではなく、実際にかかった分で請求されます。ルーターが間違えれば、間違えたことが分かります。
各段階に進むのは、前の回答がそれ自身の確認に通らなかったときだけです。
そして、いつでも上書きできます
モデル名を指定すれば、ルーターは身を引きます。ポリシーを指定すれば、代わりにそれに従います。ルーティングは既定値であって、檻ではありません。そしてその既定値は、ほとんど誰も変える必要がないように作られています。
POST /v1/messages
{
"model": "auto", // default: the router decides
"route": {
"region": "la-vte-1", // refuse rather than leave
"max_kip": 75, // per-request ceiling
"prefer": "cheapest_passing" // or "fastest" | "best"
}
}
// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
// "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
// "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }参考資料
マルチモーダルモデルに関する背景資料。一次資料のドキュメントと、この分野の土台となった論文から。外部リンクであり、LaoGPT とは提携関係にありません。
2024年。強いモデルと弱いモデルの間のルーティングと、それによる節約の大きさ。
arXiv 1701.06538Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer2017年。モデルの前ではなくモデルの内部でのルーティング。この発想の祖先です。
CloudflareAI Gateway — Cloudflare documentationモデルの前にルーティングとキャッシュの層を置くための実践的なドキュメント。
IBMWhat is a multimodal LLM? — IBMマルチモーダルな大規模言語モデルとは何か、何に使うのかを示す、最も明快な短い定義。
先行版プログラム
参加方法を選んでください。
3つの枠が開いています。1つ選ぶと下のフォームが設定されます — そこで変更もできます。
先行版 · 登録受付中
先行版に登録する。
項目は3つ。お名前とご連絡先だけ伺い、ご招待の準備ができ次第メールでお知らせします。
- 項目は3つ、調べ物は不要
- 同意は2つ。別々に選べ、初期状態はオフ
- 順番待ちの位置がすぐ分かります
3G でも動作 · ພາສາລາວ / English