Enrutamiento inteligente
El modelo más barato que da la talla.
Un enrutador es la diferencia entre una plataforma de IA y una factura de IA. LaoGPT clasifica cada solicitud, la contrasta con lo que cada modelo de la familia sabe hacer de verdad y la envía al más pequeño que la resolverá bien; después comprueba la respuesta y escala si no ha sido así. Esta página explica cómo se toma esa decisión y qué puedes forzar.
Cuatro decisiones, antes de generar un token
Qué modelo
Lite para reescribir, Base para casi todo, Pro cuando el contexto no cabe, Vision cuando hay una imagen, Voice cuando hay audio, Reason cuando una persona tiene que auditar la cadena.
Dónde se ejecuta
En el dispositivo si el dispositivo puede, en el país si no, y en ninguna parte si el espacio de trabajo ha fijado una región de la que la solicitud saldría.
Cuánto cuesta
El enrutador conoce el precio de cada modelo en kip y el saldo que queda en la cuenta. Una solicitud barata no se manda a un modelo caro por si acaso.
Si hay que escalar
La primera respuesta se comprueba contra la solicitud. Una comprobación fallida reenruta hacia arriba y lo indica en la respuesta: ves que ocurrió y lo que costó.
Lo que lee
Ocho señales, ninguna de las cuales te obliga a describir tu solicitud. Las ocho aparecen en la respuesta, de modo que una decisión de enrutamiento es algo que puedes discutir, no algo que te pasa.
Tipo de tarea
Redactar, resumir, traducir, extraer, clasificar, razonar. Inferido y modificable.
Escritura y variedad
Lao de Vientián, del norte o del sur, lao mezclado con tailandés o inglés, o lao tecleado con letras latinas.
Modalidad
Texto, imagen, PDF escaneado, audio. Una imagen en la solicitud descarta cualquier modelo solo de texto.
Longitud del contexto
Medida con el tokenizador de lao, no estimada a partir del número de caracteres, que es como se equivocan las plataformas extranjeras.
Sensibilidad
Un número de documento de identidad laosiano, una inscripción del libro de familia, un historial clínico, un número fiscal. Se detecta localmente y fija la ruta antes de que la solicitud se envíe a ninguna parte.
Conectividad
Sin conexión, ahorro de datos o completa. El enrutador degrada el modelo, no la respuesta.
Presupuesto
El saldo prepago que queda en kip y el límite por solicitud que fijó la cuenta.
Requisito de latencia
Una respuesta por voz necesita el primer token en menos de un segundo. Un lote nocturno, no.
La tabla de enrutamiento
Ilustrativa. La tabla real la sirve la plataforma y cambia a medida que se añaden modelos, que es justo la razón para no nombrar un modelo en tu cliente.
Una ruta que puede rechazar
Todas las demás capas de enrutamiento optimizan coste y latencia. Esta tiene un tercer eje, y es el que una institución compra de verdad: un espacio de trabajo puede declarar que sus solicitudes nunca salen de la-vte-1, y el enrutador devolverá un error en lugar de buscar en silencio un modelo en otra parte. Un rechazo es una funcionalidad. También es la única versión de la residencia de datos que sobrevive al contacto con un enrutador.
409 route_forbidden · workspace pinned to la-vte-1La escalera de escalado
El escalado es visible y se factura por lo que costó, no a la tarifa del modelo más alto. Si el enrutador se equivocó, puedes ver que se equivocó.
Cada paso solo se da si la respuesta anterior falla su propia comprobación.
Y siempre puedes anularlo
Indica un nombre de modelo y el enrutador se aparta. Indica una política y será esa la que obedezca. El enrutamiento es un valor por defecto, no una jaula, y ese valor por defecto está pensado para que casi nadie necesite cambiarlo.
POST /v1/messages
{
"model": "auto", // default: the router decides
"route": {
"region": "la-vte-1", // refuse rather than leave
"max_kip": 75, // per-request ceiling
"prefer": "cheapest_passing" // or "fastest" | "best"
}
}
// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
// "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
// "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }Referencias
Lecturas de fondo sobre modelos multimodales, a partir de documentación primaria y de los artículos sobre los que se construye el campo. Enlaces externos, sin afiliación con LaoGPT.
2024: enrutamiento entre un modelo fuerte y uno débil, y cuánto ahorra.
arXiv 1701.06538Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer2017: enrutamiento dentro de un modelo en lugar de delante, y el antepasado de la idea.
CloudflareAI Gateway — Cloudflare documentationDocumentación práctica para poner una capa de enrutamiento y caché delante de los modelos.
IBMWhat is a multimodal LLM? — IBMLa definición breve más clara de un gran modelo de lenguaje multimodal y de para qué sirve.
Programa de preversión
Elige cómo entrar.
Hay tres cohortes abiertas. Elegir una prepara el formulario de abajo — puedes cambiarlo allí.
Preversión · inscripción abierta
Únete a la preversión.
Tres campos. Dinos quién eres y dónde escribirte, y te enviaremos un correo cuando tu invitación esté lista.
- Tres campos, nada que tengas que buscar
- Dos consentimientos, separados, ninguno marcado de antemano
- Tu posición en la cola al instante
Funciona con 3G · ພາສາລາວ / English