Smart routning
Den billigaste modellen som klarar ribban.
En router är skillnaden mellan en AI-plattform och en AI-räkning. LaoGPT klassificerar varje förfrågan, bedömer den mot vad varje modell i familjen faktiskt klarar och skickar den till den minsta som gör rätt — kontrollerar sedan svaret och eskalerar om den inte gjorde det. Den här sidan visar hur det beslutet fattas och vad du får tvinga fram.
Fyra beslut, innan en token genereras
Vilken modell
Lite för en omskrivning, Base för det mesta, Pro när kontexten inte får plats, Vision när det finns en bild, Voice när det finns ljud, Reason när en människa måste granska kedjan.
Var den körs
På enheten om enheten klarar det, i landet om den inte gör det, och ingenstans alls om arbetsytan har låst en region som förfrågan skulle lämna.
Vad det kostar
Routern känner till priset för varje modell i kip och det saldo som finns kvar på kontot. En billig förfrågan skickas inte till en dyr modell för säkerhets skull.
Om den ska eskalera
Det första svaret kontrolleras mot förfrågan. En misslyckad kontroll routar uppåt och säger det i svaret — du ser att det hände och vad det kostade.
Vad den läser
Åtta signaler, och ingen av dem kräver att du beskriver din förfrågan. Alla åtta syns i svaret, så ett routningsbeslut är något du kan argumentera med snarare än något som händer dig.
Uppgiftstyp
Skriva, sammanfatta, översätta, extrahera, klassificera, resonera. Härledd och går att åsidosätta.
Skrift och variant
Laotiska från Vientiane, nord- eller sydlaotiska, laotiska blandad med thailändska eller engelska, eller laotiska skriven med latinska bokstäver.
Modalitet
Text, bild, skannad PDF, ljud. En bild i förfrågan utesluter varje modell som bara hanterar text.
Kontextlängd
Mätt med den laotiska tokenizern, inte uppskattad utifrån antal tecken — det är där utländska plattformar gör fel.
Känslighet
Ett laotiskt id-kortnummer, en post i en familjebok, en patientjournal, ett skattenummer. Upptäcks lokalt; det låser rutten innan förfrågan skickas någonstans.
Uppkoppling
Offline, datasparläge eller full. Routern sänker modellen, inte svaret.
Budget
Kvarvarande förbetalt saldo i kip och det tak per förfrågan som kontot har satt.
Latenskrav
Ett röstsvar behöver första token inom en sekund. En nattlig batch gör det inte.
Routningstabellen
Illustrativ. Den skarpa tabellen levereras från plattformen och ändras när modeller läggs till — vilket är hela poängen med att inte namnge en modell i din klient.
En rutt den får vägra
Alla andra routningslager optimerar för kostnad och latens. Det här har en tredje axel, och det är den som en institution faktiskt köper: en arbetsyta kan fastställa att dess förfrågningar aldrig lämnar la-vte-1, och routern returnerar då ett fel i stället för att i tysthet hitta en modell någon annanstans. En vägran är en funktion. Det är också den enda formen av dataresidens som överlever mötet med en router.
409 route_forbidden · workspace pinned to la-vte-1Eskaleringsstegen
Eskalering syns och debiteras efter vad den kostade, inte till den största modellens pris. Om routern hade fel kan du se att den hade fel.
Varje steg tas bara om det föregående svaret inte klarar sin egen kontroll.
Och du kan alltid åsidosätta den
Ange ett modellnamn så kliver routern åt sidan. Ange en policy så följer den den i stället. Routning är ett standardval, inte en bur — och standardvalet är tänkt att vara det som nästan ingen behöver ändra.
POST /v1/messages
{
"model": "auto", // default: the router decides
"route": {
"region": "la-vte-1", // refuse rather than leave
"max_kip": 75, // per-request ceiling
"prefer": "cheapest_passing" // or "fastest" | "best"
}
}
// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
// "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
// "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }Källor
Bakgrundsläsning om multimodala modeller, från primär dokumentation och de artiklar som området bygger på. Externa länkar, utan koppling till LaoGPT.
2024 — routning mellan en stark och en svag modell, och hur mycket det sparar.
arXiv 1701.06538Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer2017 — routning inuti en modell i stället för framför den, och idéns förfader.
CloudflareAI Gateway — Cloudflare documentationPraktisk dokumentation för att lägga ett routnings- och cachelager framför modeller.
IBMWhat is a multimodal LLM? — IBMDen tydligaste korta definitionen av en multimodal stor språkmodell och vad den är till för.
Program för förhandsversionen
Välj hur du vill vara med.
Tre grupper är öppna. Väljer du en ställs formuläret nedan in — du kan ändra det där.
Förhandsversion · anmälan öppen
Anmäl dig till förhandsversionen.
Tre fält. Berätta vem du är och vart vi skriver, så mejlar vi när din inbjudan är klar.
- Tre fält, inget du behöver slå upp
- Två samtycken, åtskilda, inget förkryssat
- En plats i kön direkt
Fungerar på 3G · ພາສາລາວ / English