स्मार्ट रूटिंग

सबसे सस्ता मॉडल जो कसौटी पर खरा उतरे।

राउटर ही AI मंच और AI बिल के बीच का फ़र्क़ है। LaoGPT हर अनुरोध को वर्गीकृत करता है, उसे परिवार के हर मॉडल की असली क्षमता से मिलाता है, और उसे उस सबसे छोटे मॉडल को भेजता है जो उसे सही कर सके — फिर उत्तर जाँचता है और सही न होने पर ऊपर भेजता है। यह पेज दिखाता है कि यह फ़ैसला कैसे होता है और आप क्या तय करवा सकते हैं।

टोकन बनने से पहले के चार फ़ैसले

1

कौन-सा मॉडल

दोबारा लिखने के लिए Lite, ज़्यादातर कामों के लिए Base, संदर्भ न समाए तो Pro, तस्वीर हो तो Vision, ऑडियो हो तो Voice, और जब किसी इंसान को तर्क की कड़ी का ऑडिट करना हो तो Reason।

2

कहाँ चलेगा

उपकरण संभाल सके तो उपकरण पर, न संभाल सके तो देश के भीतर, और कहीं भी नहीं अगर कार्यक्षेत्र ने ऐसा क्षेत्र लॉक किया है जिससे अनुरोध बाहर चला जाएगा।

3

कितना ख़र्च होगा

राउटर हर मॉडल की कीप में क़ीमत और खाते में बचा बैलेंस जानता है। कोई सस्ता अनुरोध एहतियातन महँगे मॉडल को नहीं भेजा जाता।

4

ऊपर भेजना है या नहीं

पहला उत्तर अनुरोध के मुक़ाबले जाँचा जाता है। जाँच में असफल होने पर अनुरोध ऊपर रूट होता है और जवाब में यह बताया जाता है — आप देखते हैं कि ऐसा हुआ और इसकी क्या लागत आई।


यह क्या पढ़ता है

आठ संकेत, और उनमें से किसी के लिए आपको अपना अनुरोध समझाना नहीं पड़ता। आठों जवाब में दिखते हैं, इसलिए रूटिंग का फ़ैसला ऐसी चीज़ है जिस पर आप बहस कर सकते हैं, न कि ऐसी जो बस आपके साथ हो जाए।

task

काम का प्रकार

लिखना, सारांश, अनुवाद, निकालना, वर्गीकरण, तर्क। अपने-आप अनुमानित, और बदला जा सकता है।

dialect

लिपि और भाषा-रूप

वियनतियाने की, उत्तरी या दक्षिणी लाओ, थाई या अंग्रेज़ी से मिली लाओ, या रोमन अक्षरों में टाइप की गई लाओ।

modality

मोडैलिटी

पाठ, तस्वीर, स्कैन किया PDF, ऑडियो। अनुरोध में तस्वीर होते ही हर सिर्फ़-पाठ वाला मॉडल बाहर हो जाता है।

tokens

संदर्भ की लंबाई

लाओ टोकनाइज़र से मापी जाती है, अक्षरों की गिनती से अंदाज़ा नहीं लगाया जाता — विदेशी मंच ठीक इसी में ग़लती करते हैं।

pii

संवेदनशीलता

लाओ पहचान-पत्र की संख्या, परिवार पुस्तिका की कोई प्रविष्टि, मरीज़ का रिकॉर्ड, कर संख्या। स्थानीय रूप से पहचानी जाती है; अनुरोध कहीं भी भेजे जाने से पहले ही रास्ता लॉक कर देती है।

network

कनेक्टिविटी

ऑफ़लाइन, डेटा-सेवर या पूरा। राउटर मॉडल घटाता है, उत्तर नहीं।

kip

बजट

कीप में बचा प्रीपेड बैलेंस, और खाते द्वारा तय प्रति-अनुरोध सीमा।

ttft

लेटेंसी की ज़रूरत

आवाज़ वाले उत्तर को एक सेकंड के भीतर पहला टोकन चाहिए। रात के बैच काम को नहीं।


रूटिंग तालिका

उदाहरण के तौर पर। असली तालिका मंच से आती है और मॉडल जुड़ने पर बदलती है — यही वजह है कि अपने क्लाइंट में मॉडल का नाम नहीं लिखना चाहिए।

अनुरोधकिस पर रूट हुआक्यों
“इसे विनम्र शैली में दोबारा लिखिए”LaoLLM-Lite · उपकरण परछोटा, खोज की ज़रूरत नहीं, नेटवर्क की ज़रूरत नहीं
“इस 6 पन्नों के परिपत्र का सारांश दीजिए”LaoLLM-Baseसंदर्भ में समाता है, स्रोत चाहिए
“इन 400 पन्नों में कौन-सी धाराएँ बदली हैं?”LaoLLM-Proसंदर्भ Base से बड़ा है
[मुहर लगे फ़ॉर्म की फ़ोटो]LaoLLM-Vision → Baseपहले तस्वीर, फिर पढ़ी गई बात पर तर्क
[आवाज़, दक्षिणी लहजे में]LaoLLM-Voice → Baseभाषा-रूप पहचाना गया, लिखित में उतारा गया, और जो रूप सुना गया उसी में जवाब दिया गया
“क्या यह ख़रीद सीमा को पूरा करती है?”LaoLLM-Reasonइंसान को हर क़दम जाँच पाना चाहिए
कोई भी चीज़ जिसमें राष्ट्रीय पहचान संख्या होउपकरण पर, या अस्वीकृतकार्यक्षेत्र की नीति, भेजने से पहले लागू

एक रास्ता जिसे वह ठुकरा सकता है

बाक़ी हर रूटिंग परत लागत और लेटेंसी के लिए अनुकूलन करती है। इसमें एक तीसरा आयाम है, और कोई संस्थान असल में वही ख़रीदता है: कार्यक्षेत्र तय कर सकता है कि उसके अनुरोध कभी la-vte-1 से बाहर न जाएँ, और तब राउटर चुपचाप कहीं और मॉडल ढूँढने के बजाय त्रुटि लौटाता है। इनकार एक सुविधा है। यही डेटा-स्थान की गारंटी का अकेला ऐसा रूप भी है जो राउटर से सामना होने पर भी टिका रहता है।

409 route_forbidden · workspace pinned to la-vte-1

ऊपर भेजने की सीढ़ी

ऊपर भेजना दिखाई देता है और उसका बिल उतना ही बनता है जितना ख़र्च हुआ, सबसे बड़े मॉडल की दर पर नहीं। अगर राउटर ग़लत था, तो आप देख सकते हैं कि वह ग़लत था।

LaoLLM-Lite×1
LaoLLM-Base×4
LaoLLM-Pro×11
LaoLLM-Reason×26

हर क़दम तभी उठाया जाता है जब पिछला उत्तर अपनी ही जाँच में असफल हो।

और आप इसे हमेशा बदल सकते हैं

मॉडल का नाम दीजिए, राउटर हट जाएगा। नीति दीजिए, तो वह उसी का पालन करेगा। रूटिंग एक डिफ़ॉल्ट है, पिंजरा नहीं — और डिफ़ॉल्ट का मक़सद यही है कि लगभग किसी को उसे बदलना न पड़े।

POST /v1/messages
{
  "model": "auto",                    // default: the router decides
  "route": {
    "region": "la-vte-1",             // refuse rather than leave
    "max_kip": 75,                    // per-request ceiling
    "prefer": "cheapest_passing"      // or "fastest" | "best"
  }
}

// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
//   "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
//   "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }

प्री-रिलीज़ कार्यक्रम

चुनिए कि आप कैसे जुड़ना चाहते हैं।

तीन समूह खुले हैं। एक चुनने पर नीचे का फ़ॉर्म तैयार हो जाएगा — वहाँ बदल भी सकते हैं।