Smart ruting
Den billigste modellen som klarer lista.
En ruter er forskjellen mellom en KI-plattform og en KI-regning. LaoGPT klassifiserer hver forespørsel, vurderer den opp mot hva hver modell i familien faktisk kan, og sender den til den minste som vil svare riktig — sjekker deretter svaret og eskalerer hvis den ikke gjorde det. Denne siden viser hvordan den beslutningen tas, og hva du har lov til å tvinge gjennom.
Fire beslutninger, før en token genereres
Hvilken modell
Lite for en omskriving, Base for det meste, Pro når konteksten ikke får plass, Vision når det finnes et bilde, Voice når det finnes lyd, Reason når et menneske må revidere kjeden.
Hvor den kjører
På enheten hvis enheten klarer det, i landet hvis den ikke gjør det, og ingen steder i det hele tatt hvis arbeidsrommet har låst en region som forespørselen ville forlate.
Hva det koster
Ruteren kjenner prisen på hver modell i kip og saldoen som er igjen på kontoen. En billig forespørsel sendes ikke til en dyr modell for sikkerhets skyld.
Om den skal eskalere
Det første svaret sjekkes mot forespørselen. En mislykket sjekk ruter oppover og sier det i svaret — du ser at det skjedde, og hva det kostet.
Hva den leser
Åtte signaler, og ingen av dem krever at du beskriver forespørselen din. Alle åtte vises i svaret, så en rutingbeslutning er noe du kan argumentere med, heller enn noe som skjer med deg.
Oppgavetype
Skrive, oppsummere, oversette, trekke ut, klassifisere, resonnere. Utledet og kan overstyres.
Skrift og variant
Vientiane-laotisk, nordlaotisk eller sørlaotisk, laotisk blandet med thai eller engelsk, eller laotisk skrevet med latinske bokstaver.
Modalitet
Tekst, bilde, skannet PDF, lyd. Et bilde i forespørselen utelukker enhver modell som bare håndterer tekst.
Kontekstlengde
Målt med den laotiske tokenizeren, ikke anslått ut fra antall tegn — det er slik utenlandske plattformer tar feil.
Sensitivitet
Et laotisk ID-kortnummer, en oppføring i familieboken, en pasientjournal, et skattenummer. Oppdages lokalt; det låser ruten før forespørselen sendes noe sted.
Tilkobling
Frakoblet, datasparemodus eller full. Ruteren senker modellen, ikke svaret.
Budsjett
Gjenværende forhåndsbetalt saldo i kip og taket per forespørsel som kontoen har satt.
Latenskrav
Et talesvar trenger første token innen ett sekund. En nattlig batch gjør ikke det.
Rutingtabellen
Illustrativ. Den aktive tabellen leveres fra plattformen og endres når modeller legges til — noe som er hele poenget med ikke å navngi en modell i klienten din.
En rute den får avvise
Alle andre rutinglag optimaliserer for kostnad og latens. Dette har en tredje akse, og det er den en institusjon faktisk kjøper: et arbeidsrom kan fastsette at forespørslene dets aldri forlater la-vte-1, og ruteren returnerer da en feil i stedet for i det stille å finne en modell et annet sted. En avvisning er en funksjon. Det er også den eneste formen for dataresidens som overlever møtet med en ruter.
409 route_forbidden · workspace pinned to la-vte-1Eskaleringsstigen
Eskalering er synlig og faktureres etter hva den kostet, ikke til den største modellens pris. Hvis ruteren tok feil, kan du se at den tok feil.
Hvert steg tas bare hvis det forrige svaret ikke består sin egen sjekk.
Og du kan alltid overstyre den
Angi et modellnavn, så trer ruteren til side. Angi en policy, så adlyder den policyen i stedet. Ruting er et standardvalg, ikke et bur — og standardvalget er ment å være det nesten ingen trenger å endre.
POST /v1/messages
{
"model": "auto", // default: the router decides
"route": {
"region": "la-vte-1", // refuse rather than leave
"max_kip": 75, // per-request ceiling
"prefer": "cheapest_passing" // or "fastest" | "best"
}
}
// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
// "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
// "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }Kilder
Bakgrunnslesing om multimodale modeller, fra primærdokumentasjon og artiklene feltet bygger på. Eksterne lenker, uten tilknytning til LaoGPT.
2024 — ruting mellom en sterk og en svak modell, og hvor mye det sparer.
arXiv 1701.06538Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer2017 — ruting inne i en modell i stedet for foran den, og ideens forfar.
CloudflareAI Gateway — Cloudflare documentationPraktisk dokumentasjon for å legge et rutings- og hurtigbufferlag foran modeller.
IBMWhat is a multimodal LLM? — IBMDen klareste korte definisjonen av en multimodal stor språkmodell og hva den er til.
Program for førversjonen
Velg hvordan du vil bli med.
Tre grupper er åpne. Velger du én, settes skjemaet nedenfor opp — du kan endre det der.
Førversjon · påmelding åpen
Meld deg på førversjonen.
Tre felt. Fortell oss hvem du er og hvor vi skriver, så sender vi e-post når invitasjonen er klar.
- Tre felt, ingenting du må slå opp
- To samtykker, atskilte, ingen forhåndskrysset
- En plass i køen med én gang
Virker på 3G · ພາສາລາວ / English