스마트 라우팅
기준을 넘는 가장 저렴한 모델.
라우터는 AI 플랫폼과 AI 청구서를 가르는 차이입니다. LaoGPT는 모든 요청을 분류하고, 제품군의 각 모델이 실제로 할 수 있는 것에 비추어 점수를 매긴 뒤, 제대로 해낼 가장 작은 모델로 보냅니다. 그다음 답을 확인하고, 제대로 되지 않았으면 상위로 올립니다. 이 페이지는 그 결정이 어떻게 내려지는지, 그리고 무엇을 강제할 수 있는지 보여 줍니다.
토큰을 생성하기 전의 네 가지 결정
어느 모델인가
고쳐 쓰기에는 Lite, 대부분은 Base, 맥락이 들어가지 않으면 Pro, 이미지가 있으면 Vision, 음성이 있으면 Voice, 사람이 추론 흐름을 감사해야 하면 Reason.
어디서 실행하는가
기기가 감당할 수 있으면 기기에서, 아니면 국내에서. 그리고 작업 공간이 요청이 벗어나게 될 리전을 고정해 두었다면 어디에서도 실행하지 않습니다.
비용은 얼마인가
라우터는 모델별 킵 요금과 계정의 남은 잔액을 알고 있습니다. 싼 요청을 혹시 몰라서 비싼 모델로 보내지 않습니다.
상위로 올릴 것인가
첫 답을 요청과 대조해 확인합니다. 확인에 실패하면 상위 모델로 라우팅하고 응답에 그 사실을 밝힙니다. 무슨 일이 있었고 비용이 얼마였는지 알 수 있습니다.
무엇을 읽는가
신호는 여덟 가지이며, 어느 것도 요청을 설명하라고 요구하지 않습니다. 여덟 가지 모두 응답에 표시되므로, 라우팅 결정은 그냥 받아들이는 것이 아니라 따져 물을 수 있는 것이 됩니다.
작업 유형
쓰기, 요약, 번역, 추출, 분류, 추론. 자동으로 추정하며 덮어쓸 수 있습니다.
문자와 변종
비엔티안, 북부 또는 남부 라오어, 태국어나 영어가 섞인 라오어, 또는 로마자로 입력한 라오어.
모달리티
텍스트, 이미지, 스캔한 PDF, 음성. 요청에 이미지가 있으면 텍스트만 다루는 모델은 모두 제외됩니다.
컨텍스트 길이
글자 수로 추정하지 않고 라오어 토크나이저로 실측합니다. 외국 플랫폼은 바로 그 추정 때문에 틀립니다.
민감도
라오스 신분증 번호, 가족 등록부 기재 사항, 환자 기록, 납세자 번호. 로컬에서 감지하며, 요청이 어디로든 가기 전에 경로를 고정합니다.
연결 상태
오프라인, 데이터 절약, 정상. 라우터가 낮추는 것은 모델이지 답이 아닙니다.
예산
남은 킵 선불 잔액과, 계정에 설정한 요청당 상한.
지연 시간 요건
음성 답변은 1초 안에 첫 토큰이 나와야 합니다. 야간 일괄 처리는 그렇지 않습니다.
라우팅 표
설명용입니다. 실제 표는 플랫폼에서 내려오며 모델이 추가될 때마다 바뀝니다. 클라이언트에 모델 이름을 적어 두지 말아야 하는 이유가 바로 이것입니다.
거부해도 되는 경로
다른 라우팅 계층은 모두 비용과 지연 시간을 최적화합니다. 이 계층에는 세 번째 축이 있고, 기관이 실제로 사는 것이 바로 그것입니다. 작업 공간은 요청이 la-vte-1 밖으로 절대 나가지 않도록 선언할 수 있으며, 그러면 라우터는 조용히 다른 곳의 모델을 찾는 대신 오류를 돌려줍니다. 거부는 기능입니다. 그리고 이것은 라우터를 만나고도 살아남는 유일한 데이터 소재지의 형태이기도 합니다.
409 route_forbidden · workspace pinned to la-vte-1단계적 상향
상향은 눈에 보이며, 가장 큰 모델의 요금이 아니라 실제로 든 만큼 청구됩니다. 라우터가 틀렸다면, 틀렸다는 것을 볼 수 있습니다.
각 단계는 앞선 답이 자체 확인을 통과하지 못했을 때만 밟습니다.
그리고 언제든 덮어쓸 수 있습니다
모델 이름을 지정하면 라우터는 물러납니다. 정책을 지정하면 대신 그 정책을 따릅니다. 라우팅은 기본값일 뿐, 굴레가 아닙니다. 그리고 그 기본값은 거의 아무도 바꿀 필요가 없도록 만든 것입니다.
POST /v1/messages
{
"model": "auto", // default: the router decides
"route": {
"region": "la-vte-1", // refuse rather than leave
"max_kip": 75, // per-request ceiling
"prefer": "cheapest_passing" // or "fastest" | "best"
}
}
// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
// "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
// "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }참고 자료
1차 문서와 이 분야의 토대가 된 논문에서 가져온 멀티모달 모델 배경 자료입니다. 외부 링크이며 LaoGPT와 제휴 관계가 없습니다.
2024 — 강한 모델과 약한 모델 사이의 라우팅, 그리고 그로 인한 절감 규모.
arXiv 1701.06538Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer2017 — 모델 앞이 아니라 모델 안에서의 라우팅. 이 발상의 조상입니다.
CloudflareAI Gateway — Cloudflare documentation모델 앞에 라우팅과 캐시 계층을 두는 실무 문서.
IBMWhat is a multimodal LLM? — IBM멀티모달 대규모 언어 모델이 무엇이고 어디에 쓰는지에 대한 가장 명료한 짧은 정의.
프리릴리스 프로그램
참여 방식을 고르세요.
세 개의 그룹이 열려 있습니다. 하나를 고르면 아래 양식이 설정됩니다 — 거기서 바꿀 수도 있습니다.
프리릴리스 · 신청 접수 중
프리릴리스에 참여하세요.
항목은 세 개. 누구신지와 연락처만 알려주시면, 초대가 준비되는 대로 이메일로 알려드립니다.
- 항목 세 개, 따로 찾아볼 것 없음
- 동의 두 가지, 각각 별개이며 기본은 꺼짐
- 대기 순번을 바로 확인
3G에서도 작동 · ພາສາລາວ / English