Smart routing
Den billigste model, der klarer barren.
En router er forskellen på en AI-platform og en AI-regning. LaoGPT klassificerer hver forespørgsel, vurderer den mod det, hver model i familien faktisk kan, og sender den til den mindste, der gør det rigtigt — tjekker derefter svaret og eskalerer, hvis den ikke gjorde. Denne side viser, hvordan den beslutning træffes, og hvad du må gennemtvinge.
Fire beslutninger, før en token genereres
Hvilken model
Lite til en omskrivning, Base til det meste, Pro når konteksten ikke kan være der, Vision når der er et billede, Voice når der er lyd, Reason når et menneske skal revidere kæden.
Hvor den kører
På enheden, hvis enheden kan klare det, i landet, hvis den ikke kan, og slet ingen steder, hvis arbejdsrummet har låst en region, som forespørgslen ville forlade.
Hvad det koster
Routeren kender prisen på hver model i kip og den resterende saldo på kontoen. En billig forespørgsel sendes ikke til en dyr model for en sikkerheds skyld.
Om den skal eskalere
Det første svar tjekkes mod forespørgslen. Et fejlet tjek router opad og siger det i svaret — du ser, at det skete, og hvad det kostede.
Hvad den læser
Otte signaler, og ingen af dem kræver, at du beskriver din forespørgsel. Alle otte fremgår af svaret, så en routingbeslutning er noget, du kan diskutere med, frem for noget, der sker for dig.
Opgavetype
Skrive, opsummere, oversætte, udtrække, klassificere, ræsonnere. Udledt og kan tilsidesættes.
Skrift og variant
Laotisk fra Vientiane, nord- eller sydlaotisk, laotisk blandet med thai eller engelsk, eller laotisk tastet med latinske bogstaver.
Modalitet
Tekst, billede, scannet PDF, lyd. Et billede i forespørgslen udelukker enhver model, der kun håndterer tekst.
Kontekstlængde
Målt med den laotiske tokenizer, ikke anslået ud fra antal tegn — det er dér, udenlandske platforme tager fejl.
Følsomhed
Et laotisk ID-kortnummer, en post i en familiebog, en patientjournal, et skattenummer. Opdages lokalt; det låser ruten, før forespørgslen sendes nogen steder hen.
Forbindelse
Offline, datasparetilstand eller fuld. Routeren sænker modellen, ikke svaret.
Budget
Resterende forudbetalt saldo i kip og det loft pr. forespørgsel, kontoen har sat.
Latenskrav
Et stemmesvar skal have første token inden for et sekund. En natlig batch skal ikke.
Routingtabellen
Illustrativ. Den aktive tabel leveres fra platformen og ændres, når der kommer nye modeller til — hvilket er hele pointen med ikke at navngive en model i din klient.
En rute, den må afvise
Alle andre routinglag optimerer for pris og latens. Dette har en tredje akse, og det er den, en institution faktisk køber: et arbejdsrum kan fastsætte, at dets forespørgsler aldrig forlader la-vte-1, og så returnerer routeren en fejl i stedet for i stilhed at finde en model et andet sted. En afvisning er en funktion. Det er også den eneste form for dataresidens, der overlever mødet med en router.
409 route_forbidden · workspace pinned to la-vte-1Eskaleringsstigen
Eskalering er synlig og faktureres efter, hvad den kostede, ikke til den største models pris. Hvis routeren tog fejl, kan du se, at den tog fejl.
Hvert trin tages kun, hvis det foregående svar ikke består sit eget tjek.
Og du kan altid tilsidesætte den
Angiv et modelnavn, og routeren træder til side. Angiv en politik, og den følger den i stedet. Routing er en standard, ikke et bur — og standarden er tænkt som den, næsten ingen behøver at ændre.
POST /v1/messages
{
"model": "auto", // default: the router decides
"route": {
"region": "la-vte-1", // refuse rather than leave
"max_kip": 75, // per-request ceiling
"prefer": "cheapest_passing" // or "fastest" | "best"
}
}
// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
// "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
// "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }Kilder
Baggrundslæsning om multimodale modeller, fra primær dokumentation og de artikler, feltet bygger på. Eksterne links, uden tilknytning til LaoGPT.
2024 — routing mellem en stærk og en svag model, og hvor meget det sparer.
arXiv 1701.06538Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer2017 — routing inde i en model i stedet for foran den, og idéens forfader.
CloudflareAI Gateway — Cloudflare documentationPraktisk dokumentation for at lægge et routing- og cachelag foran modeller.
IBMWhat is a multimodal LLM? — IBMDen klareste korte definition af en multimodal stor sprogmodel, og hvad den er til.
Førudgivelsesprogram
Vælg, hvordan du vil med.
Tre grupper er åbne. Vælger du én, sættes formularen nedenfor op — du kan ændre det der.
Førudgivelse · tilmelding åben nu
Tilmeld dig førudgivelsen.
Tre felter. Fortæl os, hvem du er, og hvor vi skriver til, så sender vi en mail, når din invitation er klar.
- Tre felter, intet du skal slå op
- To samtykker, adskilte, ingen af dem sat på forhånd
- En plads i køen med det samme
Virker på 3G · ພາສາລາວ / English