स्मार्ट रूटिंग
सबसे सस्ता मॉडल जो कसौटी पर खरा उतरे।
राउटर ही AI मंच और AI बिल के बीच का फ़र्क़ है। LaoGPT हर अनुरोध को वर्गीकृत करता है, उसे परिवार के हर मॉडल की असली क्षमता से मिलाता है, और उसे उस सबसे छोटे मॉडल को भेजता है जो उसे सही कर सके — फिर उत्तर जाँचता है और सही न होने पर ऊपर भेजता है। यह पेज दिखाता है कि यह फ़ैसला कैसे होता है और आप क्या तय करवा सकते हैं।
टोकन बनने से पहले के चार फ़ैसले
कौन-सा मॉडल
दोबारा लिखने के लिए Lite, ज़्यादातर कामों के लिए Base, संदर्भ न समाए तो Pro, तस्वीर हो तो Vision, ऑडियो हो तो Voice, और जब किसी इंसान को तर्क की कड़ी का ऑडिट करना हो तो Reason।
कहाँ चलेगा
उपकरण संभाल सके तो उपकरण पर, न संभाल सके तो देश के भीतर, और कहीं भी नहीं अगर कार्यक्षेत्र ने ऐसा क्षेत्र लॉक किया है जिससे अनुरोध बाहर चला जाएगा।
कितना ख़र्च होगा
राउटर हर मॉडल की कीप में क़ीमत और खाते में बचा बैलेंस जानता है। कोई सस्ता अनुरोध एहतियातन महँगे मॉडल को नहीं भेजा जाता।
ऊपर भेजना है या नहीं
पहला उत्तर अनुरोध के मुक़ाबले जाँचा जाता है। जाँच में असफल होने पर अनुरोध ऊपर रूट होता है और जवाब में यह बताया जाता है — आप देखते हैं कि ऐसा हुआ और इसकी क्या लागत आई।
यह क्या पढ़ता है
आठ संकेत, और उनमें से किसी के लिए आपको अपना अनुरोध समझाना नहीं पड़ता। आठों जवाब में दिखते हैं, इसलिए रूटिंग का फ़ैसला ऐसी चीज़ है जिस पर आप बहस कर सकते हैं, न कि ऐसी जो बस आपके साथ हो जाए।
काम का प्रकार
लिखना, सारांश, अनुवाद, निकालना, वर्गीकरण, तर्क। अपने-आप अनुमानित, और बदला जा सकता है।
लिपि और भाषा-रूप
वियनतियाने की, उत्तरी या दक्षिणी लाओ, थाई या अंग्रेज़ी से मिली लाओ, या रोमन अक्षरों में टाइप की गई लाओ।
मोडैलिटी
पाठ, तस्वीर, स्कैन किया PDF, ऑडियो। अनुरोध में तस्वीर होते ही हर सिर्फ़-पाठ वाला मॉडल बाहर हो जाता है।
संदर्भ की लंबाई
लाओ टोकनाइज़र से मापी जाती है, अक्षरों की गिनती से अंदाज़ा नहीं लगाया जाता — विदेशी मंच ठीक इसी में ग़लती करते हैं।
संवेदनशीलता
लाओ पहचान-पत्र की संख्या, परिवार पुस्तिका की कोई प्रविष्टि, मरीज़ का रिकॉर्ड, कर संख्या। स्थानीय रूप से पहचानी जाती है; अनुरोध कहीं भी भेजे जाने से पहले ही रास्ता लॉक कर देती है।
कनेक्टिविटी
ऑफ़लाइन, डेटा-सेवर या पूरा। राउटर मॉडल घटाता है, उत्तर नहीं।
बजट
कीप में बचा प्रीपेड बैलेंस, और खाते द्वारा तय प्रति-अनुरोध सीमा।
लेटेंसी की ज़रूरत
आवाज़ वाले उत्तर को एक सेकंड के भीतर पहला टोकन चाहिए। रात के बैच काम को नहीं।
रूटिंग तालिका
उदाहरण के तौर पर। असली तालिका मंच से आती है और मॉडल जुड़ने पर बदलती है — यही वजह है कि अपने क्लाइंट में मॉडल का नाम नहीं लिखना चाहिए।
एक रास्ता जिसे वह ठुकरा सकता है
बाक़ी हर रूटिंग परत लागत और लेटेंसी के लिए अनुकूलन करती है। इसमें एक तीसरा आयाम है, और कोई संस्थान असल में वही ख़रीदता है: कार्यक्षेत्र तय कर सकता है कि उसके अनुरोध कभी la-vte-1 से बाहर न जाएँ, और तब राउटर चुपचाप कहीं और मॉडल ढूँढने के बजाय त्रुटि लौटाता है। इनकार एक सुविधा है। यही डेटा-स्थान की गारंटी का अकेला ऐसा रूप भी है जो राउटर से सामना होने पर भी टिका रहता है।
409 route_forbidden · workspace pinned to la-vte-1ऊपर भेजने की सीढ़ी
ऊपर भेजना दिखाई देता है और उसका बिल उतना ही बनता है जितना ख़र्च हुआ, सबसे बड़े मॉडल की दर पर नहीं। अगर राउटर ग़लत था, तो आप देख सकते हैं कि वह ग़लत था।
हर क़दम तभी उठाया जाता है जब पिछला उत्तर अपनी ही जाँच में असफल हो।
और आप इसे हमेशा बदल सकते हैं
मॉडल का नाम दीजिए, राउटर हट जाएगा। नीति दीजिए, तो वह उसी का पालन करेगा। रूटिंग एक डिफ़ॉल्ट है, पिंजरा नहीं — और डिफ़ॉल्ट का मक़सद यही है कि लगभग किसी को उसे बदलना न पड़े।
POST /v1/messages
{
"model": "auto", // default: the router decides
"route": {
"region": "la-vte-1", // refuse rather than leave
"max_kip": 75, // per-request ceiling
"prefer": "cheapest_passing" // or "fastest" | "best"
}
}
// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
// "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
// "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }संदर्भ
मल्टीमॉडल मॉडलों पर पृष्ठभूमि-पठन, मूल दस्तावेज़ों और उन शोधपत्रों से जिन पर यह क्षेत्र खड़ा है। बाहरी लिंक, LaoGPT से असंबद्ध।
2024 — एक मज़बूत और एक कमज़ोर मॉडल के बीच रूटिंग, और इससे कितनी बचत होती है।
arXiv 1701.06538Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer2017 — मॉडल के आगे नहीं, मॉडल के भीतर रूटिंग; इस विचार का पूर्वज।
CloudflareAI Gateway — Cloudflare documentationमॉडलों के आगे रूटिंग और कैश की परत लगाने का व्यावहारिक दस्तावेज़।
IBMWhat is a multimodal LLM? — IBMमल्टीमॉडल बड़े भाषा मॉडल और उसके उपयोग की सबसे साफ़ छोटी परिभाषा।
प्री-रिलीज़ कार्यक्रम
चुनिए कि आप कैसे जुड़ना चाहते हैं।
तीन समूह खुले हैं। एक चुनने पर नीचे का फ़ॉर्म तैयार हो जाएगा — वहाँ बदल भी सकते हैं।
प्री-रिलीज़ · पंजीकरण खुला है
प्री-रिलीज़ में शामिल हों।
तीन ख़ाने। बताइए आप कौन हैं और कहाँ लिखें, न्योता तैयार होते ही हम ईमेल भेज देंगे।
- तीन ख़ाने, कुछ ढूँढ़ना नहीं पड़ेगा
- दो सहमतियाँ, अलग-अलग, कोई पहले से चुनी हुई नहीं
- क़तार में आपका स्थान तुरंत
3G पर चलता है · ພາສາລາວ / English