Enrutamiento inteligente

El modelo más barato que da la talla.

Un enrutador es la diferencia entre una plataforma de IA y una factura de IA. LaoGPT clasifica cada solicitud, la contrasta con lo que cada modelo de la familia sabe hacer de verdad y la envía al más pequeño que la resolverá bien; después comprueba la respuesta y escala si no ha sido así. Esta página explica cómo se toma esa decisión y qué puedes forzar.

Cuatro decisiones, antes de generar un token

1

Qué modelo

Lite para reescribir, Base para casi todo, Pro cuando el contexto no cabe, Vision cuando hay una imagen, Voice cuando hay audio, Reason cuando una persona tiene que auditar la cadena.

2

Dónde se ejecuta

En el dispositivo si el dispositivo puede, en el país si no, y en ninguna parte si el espacio de trabajo ha fijado una región de la que la solicitud saldría.

3

Cuánto cuesta

El enrutador conoce el precio de cada modelo en kip y el saldo que queda en la cuenta. Una solicitud barata no se manda a un modelo caro por si acaso.

4

Si hay que escalar

La primera respuesta se comprueba contra la solicitud. Una comprobación fallida reenruta hacia arriba y lo indica en la respuesta: ves que ocurrió y lo que costó.


Lo que lee

Ocho señales, ninguna de las cuales te obliga a describir tu solicitud. Las ocho aparecen en la respuesta, de modo que una decisión de enrutamiento es algo que puedes discutir, no algo que te pasa.

task

Tipo de tarea

Redactar, resumir, traducir, extraer, clasificar, razonar. Inferido y modificable.

dialect

Escritura y variedad

Lao de Vientián, del norte o del sur, lao mezclado con tailandés o inglés, o lao tecleado con letras latinas.

modality

Modalidad

Texto, imagen, PDF escaneado, audio. Una imagen en la solicitud descarta cualquier modelo solo de texto.

tokens

Longitud del contexto

Medida con el tokenizador de lao, no estimada a partir del número de caracteres, que es como se equivocan las plataformas extranjeras.

pii

Sensibilidad

Un número de documento de identidad laosiano, una inscripción del libro de familia, un historial clínico, un número fiscal. Se detecta localmente y fija la ruta antes de que la solicitud se envíe a ninguna parte.

network

Conectividad

Sin conexión, ahorro de datos o completa. El enrutador degrada el modelo, no la respuesta.

kip

Presupuesto

El saldo prepago que queda en kip y el límite por solicitud que fijó la cuenta.

ttft

Requisito de latencia

Una respuesta por voz necesita el primer token en menos de un segundo. Un lote nocturno, no.


La tabla de enrutamiento

Ilustrativa. La tabla real la sirve la plataforma y cambia a medida que se añaden modelos, que es justo la razón para no nombrar un modelo en tu cliente.

SolicitudEnrutada aPor qué
«Reescribe esto en registro cortés»LaoLLM-Lite · en el dispositivoBreve, sin recuperación, sin red
«Resume esta circular de 6 páginas»LaoLLM-BaseCabe en el contexto, necesita citas
«¿Qué cláusulas cambiaron en estas 400 páginas?»LaoLLM-ProEl contexto supera a Base
[foto de un formulario sellado]LaoLLM-Vision → BasePrimero la imagen, después el razonamiento sobre lo leído
[voz, con acento del sur]LaoLLM-Voice → BaseSe detecta la variedad, se transcribe y se responde en la variedad oída
«¿Esta contratación cumple el umbral?»LaoLLM-ReasonUna persona tiene que poder comprobar cada paso
Cualquier cosa que contenga un número de identidad nacionalEn el dispositivo, o rechazadoPolítica del espacio de trabajo, aplicada antes de transmitir

Una ruta que puede rechazar

Todas las demás capas de enrutamiento optimizan coste y latencia. Esta tiene un tercer eje, y es el que una institución compra de verdad: un espacio de trabajo puede declarar que sus solicitudes nunca salen de la-vte-1, y el enrutador devolverá un error en lugar de buscar en silencio un modelo en otra parte. Un rechazo es una funcionalidad. También es la única versión de la residencia de datos que sobrevive al contacto con un enrutador.

409 route_forbidden · workspace pinned to la-vte-1

La escalera de escalado

El escalado es visible y se factura por lo que costó, no a la tarifa del modelo más alto. Si el enrutador se equivocó, puedes ver que se equivocó.

LaoLLM-Lite×1
LaoLLM-Base×4
LaoLLM-Pro×11
LaoLLM-Reason×26

Cada paso solo se da si la respuesta anterior falla su propia comprobación.

Y siempre puedes anularlo

Indica un nombre de modelo y el enrutador se aparta. Indica una política y será esa la que obedezca. El enrutamiento es un valor por defecto, no una jaula, y ese valor por defecto está pensado para que casi nadie necesite cambiarlo.

POST /v1/messages
{
  "model": "auto",                    // default: the router decides
  "route": {
    "region": "la-vte-1",             // refuse rather than leave
    "max_kip": 75,                    // per-request ceiling
    "prefer": "cheapest_passing"      // or "fastest" | "best"
  }
}

// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
//   "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
//   "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }

Programa de preversión

Elige cómo entrar.

Hay tres cohortes abiertas. Elegir una prepara el formulario de abajo — puedes cambiarlo allí.