परिवार पुस्तिका के पन्ने की फ़ोटो लीजिए
कैमरा ປຶ້ມສຳມະໂນຄົວ की ओर कीजिए और हर फ़ील्ड संरचित डेटा के रूप में वापस पाइए — नाम, पहचान संख्याएँ, गाँव, ज़िला, प्रांत — बिना किसी कर्मचारी के शाम चार बजे उनमें से एक भी दोबारा टाइप किए।
मल्टीमॉडल · रोडमैप रोडमैप — अभी उपलब्ध नहीं
जो लाओ भाषा मायने रखती है, उसका ज़्यादातर हिस्सा टाइप नहीं होता। उस पर मुहर लगती है, उसकी फ़ोटो खींची जाती है, वह हाथ से लिखी जाती है, छपती है और फिर स्कैन होती है, किसी क्षेत्रीय लहजे में या दूसरी भाषा के रूप में बोली जाती है, या किसी ऐसे व्यक्ति को पढ़कर सुनाई जाती है जो उसे पढ़ नहीं सकता। सिर्फ़ पाठ वाला मॉडल इनमें से किसी तक नहीं पहुँचता। यहाँ बताया गया है कि क्या बदलता है, लाओ को ख़ास तौर पर इसकी ज़रूरत क्यों है, और लगभग कब।
मल्टीमॉडल मॉडल क्या है
पाठ मॉडल टोकन पढ़ता है। मल्टीमॉडल मॉडल एक से ज़्यादा तरह का इनपुट लेता है — तस्वीरें, ऑडियो, वीडियो, दस्तावेज़ — और उन पर उसी संदर्भ में तर्क करता है जिसमें पाठ पर। आम तौर पर हर मोडैलिटी के लिए एक एनकोडर को भाषा मॉडल से जोड़ा जाता है और उस जोड़ को प्रशिक्षित किया जाता है, ताकि तस्वीर ऐसी चीज़ बन जाए जिस पर भाषा मॉडल प्रॉम्प्ट के शब्दों के साथ ध्यान दे सके।
व्यवहार में जो शब्द मायने रखता है, वह है विज़न-लैंग्वेज मॉडल: इमेज एनकोडर वाला भाषा मॉडल, और लगभग हर “क्या यह मेरा स्क्रीनशॉट पढ़ सकता है” वाली क्षमता असल में यही होती है। IBM की परिभाषा छोटी वाली है — ऐसा मॉडल जो पाठ, तस्वीरों और ऑडियो जैसी कई मोडैलिटी को संसाधित कर सके और उनके पार तर्क कर सके — और दृश्य वाले हिस्से के लिए NVIDIA की शब्दावली छोटी वाली है।
यह विचार मौजूदा लहर से पुराना है। CLIP ने 2021 में दिखाया कि प्राकृतिक भाषा को पर्यवेक्षण बनाकर तस्वीर और पाठ को एक साझा स्थान में प्रशिक्षित किया जा सकता है; Flamingo ने दिखाया कि एक स्थिर (फ़्रोज़न) भाषा मॉडल को कुछ ही उदाहरणों से तस्वीरों पर ध्यान देना सिखाया जा सकता है; दृश्य निर्देश-ट्यूनिंग ने नतीजे को ऐसी चीज़ बना दिया जिससे बात की जा सके। आज जो कुछ इस्तेमाल में है, वह इन्हीं तीन से निकला है।
मूल स्रोत पढ़िएलाओ को इसकी ज़रूरत अंग्रेज़ी से ज़्यादा क्यों है
यह किसी दूसरी भाषा में वही सुविधा नहीं है। चार बातें लाओ के लिए दस्तावेज़-दृष्टि को एक अलग तकनीकी समस्या बनाती हैं, और चारों ही वजह हैं कि कोई सामान्य मॉडल यहाँ कमज़ोर पड़ता है।
शब्दों के बीच ख़ाली जगह नहीं होती, इसलिए पहचानने वाला तंत्र सीमाएँ ढूँढने के लिए ख़ाली जगह का सहारा नहीं ले सकता। स्वर और टोन चिह्न व्यंजन के ऊपर, नीचे और चारों ओर लगते हैं, इसलिए जो स्कैन इनमें से एक भी खो दे, वह शब्द को साफ़ तौर पर बिगाड़ने के बजाय चुपचाप बदल देता है — और सीखने के लिए लाओ पाठ किसी भी बड़ी भाषा की तुलना में कहीं कम है।
असली इनपुट मेज़ पर रखे मुहर लगे पन्ने की फ़ोन से खींची फ़ोटो है, तिरछी, एक ट्यूबलाइट वाले दफ़्तर में। साफ़ स्कैन वाले बेंचमार्क इसके बारे में कुछ नहीं बताते।
गाँव के रजिस्टर, क्लिनिक के नोट, डिलीवरी पर्चियाँ, स्कूलों की अंक-सूचियाँ, परिवार पुस्तिका। लाओ हस्तलेख ऐसे ढंग से अक्षर जोड़ता और छोटा करता है जिसे छपे पाठ पर प्रशिक्षण नहीं पकड़ पाता।
अरबी अंकों के साथ लाओ अंक ໐–໙, सरकारी काग़ज़ों पर ग्रेगोरियन वर्ष और मंदिरों के अभिलेखों में 543 वर्ष आगे चलने वाले बौद्ध संवत् के वर्ष, और कीप की इतनी बड़ी रक़में कि हज़ारों का विभाजक ग़लत पढ़ने से आँकड़ा हज़ार गुना बदल जाता है। वर्ष ग़लत पढ़ा तो दस्तावेज़ की हर तारीख़ ग़लत।
चार इंद्रियाँ, तीन मॉडल
एक बड़े मॉडल के बजाय अलग-अलग मॉडल के रूप में दिए जाते हैं, क्योंकि तब राउटर फ़ोटो को पढ़ने वाले मॉडल को और रिकॉर्डिंग को सुनने वाले मॉडल को भेज सकता है — और किसी को भी दूसरे के वेट्स का दाम नहीं चुकाना पड़ता।
फ़ोटो, स्क्रीनशॉट, चार्ट, शेल्फ़, दृश्य, फ़ॉर्म। फ़्रेम में जो है उसके बारे में लाओ में जवाब देता है, और साथ में बताता है कि जवाब किस क्षेत्र से दिया गया।
दस्तावेज़ों का विशेषज्ञ: मुहर लगे, स्कैन किए, तिरछे, कई कॉलम वाले, कुछ हिस्से में हाथ से लिखे लाओ काग़ज़ों को ऐसे संरचित फ़ील्ड में बदलता है जिन्हें आप डेटाबेस में डाल सकें।
क्षेत्रीय रूपों में लाओ वाक्-पहचान और वाक्-संश्लेषण, उस आम स्थिति समेत जिसमें सवाल ऐसा व्यक्ति पूछता है जिसकी पहली भाषा लाओ नहीं है, और जवाब सरल लाओ में दिया जाता है।
जो असल में मायने रखता है: एक ही अनुरोध में एक फ़ोटो और बोलकर पूछा गया सवाल, जिसका जवाब आपके अपने दस्तावेज़ों के आधार पर मिले। अलग-अलग मॉडल इसी क्षमता को सस्ता बनाने के लिए हैं।
अठारह काम जो पहले नहीं हो पाते थे
हर एक ऐसा काम है जिसे आज लाओस में कोई अपने सामने रखी चीज़ को दोबारा टाइप करके करता है। उदाहरण के तौर पर — ये इच्छित क्षमता बताते हैं, जारी हो चुकी सुविधाएँ नहीं।
कैमरा ປຶ້ມສຳມະໂນຄົວ की ओर कीजिए और हर फ़ील्ड संरचित डेटा के रूप में वापस पाइए — नाम, पहचान संख्याएँ, गाँव, ज़िला, प्रांत — बिना किसी कर्मचारी के शाम चार बजे उनमें से एक भी दोबारा टाइप किए।
राजपत्र का स्कैन किया गया पन्ना ऐसा सारांश बन जाता है जिसमें हर दायित्व को उस अनुच्छेद तक खोजा जा सके जहाँ से वह आया, और लागू होने की तारीख़ अंदाज़े से नहीं, पढ़कर तय होती है।
समिति सचिव ने जो पन्ना सचमुच लिखा था उसकी फ़ोटो लीजिए और सरकारी शैली में टाइप किया लाओ कार्यवृत्त पाइए, जिसमें नाम एक जैसे लिखे हों और निर्णय क्रमांकित हों।
मंत्रालय के आधे भरे फ़ॉर्म की फ़ोटो लीजिए और जानिए कि कौन-से खाने ख़ाली हैं, कौन-सी मुहर छूटी है, और कौन-से संलग्नक की वजह से दफ़्तर आपको घर लौटा देगा।
दवा दुकान के लेबल की फ़ोटो — लेबल अक्सर लाओ के बजाय किसी दूसरी भाषा में छपा होता है — सरल लाओ में ख़ुराक और समय की बोली गई व्याख्या बन जाती है, उस मरीज़ के लिए जो धीरे पढ़ता है, या वह भाषा बिल्कुल नहीं पढ़ पाता।
अस्पताल के डिस्चार्ज सारांश की फ़ोटो लीजिए और घर में बोली जाने वाली भाषा में “इस हफ़्ते क्या करना है” पाइए, साथ में अगली जाँच की तारीख़ रिमाइंडर में दर्ज।
नुक़सान दिखाइए और जानिए कि वह किस जैसा दिखता है, अक्सर किससे भ्रमित होता है, और किस ज़िला कृषि कार्यालय को फ़ोन करना है — साथ में ऐसा रसायन बताने से साफ़ इनकार, जिसके बारे में वह पक्का न हो।
बोरी की फ़ोटो लीजिए, खेत का आकार हेक्टेयर में बोलिए, और मिश्रण का अनुपात बोले गए जवाब के रूप में पाइए — ऑफ़लाइन, खेत में खड़े-खड़े।
ढेर की फ़ोटो लीजिए। विक्रेता, कर पहचान संख्या, तारीख़, VAT और कुल राशि वाली तालिका पाइए, जिसमें वे रसीदें चिह्नित हों जो वैध VAT बीजक नहीं हैं और ऑडिट में नहीं टिकेंगी।
बैंक ऐप या राष्ट्रीय QR से हुए ट्रांसफ़र की रसीद का स्क्रीनशॉट उस बीजक से मिलाया जाता है जिसका भुगतान वह करती है, राशि और संदर्भ जाँचे जाते हैं, और अंतर को चुपचाप नज़रअंदाज़ करने के बजाय साफ़ बताया जाता है।
शेल्फ़ की फ़ोटो लीजिए और फ़ेसिंग व ख़ाली जगहों सहित लाओ में उत्पाद-सूची पाइए — वह काम जो आज क्लिपबोर्ड लिए एक व्यक्ति गलियारे के दो चक्कर लगाकर करता है।
पन्ने की फ़ोटो लीजिए और राष्ट्रीय पाठ्यक्रम के लक्ष्यों से जुड़ी पाठ-योजना पाइए, जिसमें वे दो लक्ष्य साफ़ बताए गए हों जिन्हें वह पन्ना नहीं छूता।
छात्र के पन्ने की फ़ोटो लीजिए और वर्तनी, स्वर और टोन चिह्नों की ग़लतियाँ पाइए, हर एक के साथ वह नियम जो उसने तोड़ा — ताकि जाँच सिखाए, सिर्फ़ अंक न दे।
मेन्यू की फ़ोटो लीजिए। मेहमान को अपनी भाषा और एलर्जी की जानकारी मिलती है; व्यंजन अपना लाओ नाम बनाए रखता है, क्योंकि ລາບ “मांस का सलाद” नहीं है, और किसी रेस्तराँ को ऐसा दिखावा करने पर मजबूर नहीं होना चाहिए।
मंदिर के शिलालेख या ताड़पत्र पांडुलिपि की फ़ोटो लीजिए और लिप्यंतरण, सरल लाओ में पाठ, और एक ईमानदार टिप्पणी पाइए कि कौन-से अक्षर इतने घिस चुके हैं कि पढ़े नहीं जा सकते।
लोडिंग डॉक पर डिलीवरी पर्ची की फ़ोटो लीजिए और संरचित फ़ील्ड सीधे WMS में जाने दीजिए — उस मात्रा-सुधार समेत जो किसी ने पेन से हाथ से किया था।
CCTV का एक स्थिर फ़्रेम लाओ में वर्णित, समय-अंकित घटना-टिप्पणी बन जाता है, उस शैली में जिसमें रिपोर्ट दाख़िल होनी है, ताकि कोई इंसान उस पर हस्ताक्षर करे।
कैमरा उठाइए और लाओ में सुनिए कि आपके सामने क्या है, चलने की रफ़्तार से — इस तकनीक का वह रूप जो उत्पादकता की सुविधा बिल्कुल नहीं है।
API में यह कैसा दिखता है
वही एंडपॉइंट। content ऐरे में एक तस्वीर, और बाकी राउटर सँभाल लेता है — यही पूरी वजह है कि रूटिंग सबसे पहले उपलब्ध कराई गई।
POST /v1/messages
{
"model": "auto", // the router picks
"messages": [{
"role": "user",
"content": [
{ "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
{ "type": "text", "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
]
}],
"lao": { "register": "official", "dialect": "auto" }
}
// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
// "region": "la-vte-1", "usage": { "kip": 42.60 } }रोडमैप
चार चरण। इनमें से कोई भी तारीख़ नहीं है: हर चरण तब खुलता है जब उसका परीक्षण-समूह पास हो जाए, और उसके अंक लाओ भाषी देते हैं, कोई लीडरबोर्ड नहीं।
छपे और स्कैन किए लाओ दस्तावेज़ों को संरचित फ़ील्ड में बदलना। लाओ अंक और दोनों कैलेंडर पढ़ते समय ही सँभाले जाते हैं, बाद में जोड़-तोड़ से नहीं।
द्वारतिरछी फ़ोन फ़ोटो, मुहरें, सील और लाओ हस्तलेख। यही चरण तय करता है कि उत्पाद दफ़्तर के बाहर काम का है या नहीं।
द्वारआवाज़ अंदर और आवाज़ बाहर, हर क्षेत्रीय रूप के लिए और दूसरी भाषा के रूप में लाओ बोलने वालों के लिए अलग-अलग अंकित — क्योंकि सबका मिला-जुला औसत ठीक वही विफलता छिपा लेता है जो मायने रखती है।
द्वारएक संकुचित दृष्टि मॉडल जो मध्यम श्रेणी के Android फ़ोन पर बिना कनेक्शन के चलता है, उस काम के लिए जो वहाँ होता है जहाँ सिग्नल नहीं है।
द्वारसंदर्भ
मल्टीमॉडल मॉडलों पर पृष्ठभूमि-पठन, मूल दस्तावेज़ों और उन शोधपत्रों से जिन पर यह क्षेत्र खड़ा है। बाहरी लिंक, LaoGPT से असंबद्ध।
मल्टीमॉडल बड़े भाषा मॉडल और उसके उपयोग की सबसे साफ़ छोटी परिभाषा।
NVIDIAWhat are vision-language models? — NVIDIA glossaryइमेज एनकोडर को भाषा मॉडल से कैसे जोड़ा जाता है ताकि उसे दृष्टि मिले।
WikipediaVision-language model — Wikipediaविस्तृत ग्रंथसूची वाला एक तटस्थ अवलोकन, अगर आप विवरण से पहले क्षेत्र का पूरा आकार देखना चाहें।
AnthropicVision — Claude API documentationकिसी मॉडल को तस्वीरें भेजने का व्यावहारिक दस्तावेज़, और ऐसा करने की व्यावहारिक सीमाएँ।
GoogleImage understanding — Gemini API documentationजड़ से मल्टीमॉडल एक API, जिसमें दस्तावेज़ और वीडियो भी इनपुट के रूप में शामिल हैं।
OpenAIImages and vision — OpenAI platform documentationतस्वीरों के लिए व्यापक रूप से इस्तेमाल होने वाला दूसरा API, अनुरोधों के रूप की तुलना के लिए।
Hugging FaceImage-text-to-text — Hugging Faceखुले मॉडलों वाला पक्ष: काम की परिभाषा और ऐसे मॉडल जिन्हें आप ख़ुद चला सकते हैं।
arXiv 2103.00020Learning Transferable Visual Models From Natural Language SupervisionCLIP, 2021 — तस्वीर और पाठ को एक साझा निरूपण में प्रशिक्षित किया गया। वह शोधपत्र जहाँ से आधुनिक क्षेत्र शुरू होता है।
arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learning2022 — एक स्थिर भाषा मॉडल को तस्वीरों पर ध्यान देना कैसे सिखाया जाता है।
arXiv 2304.08485Visual Instruction Tuning2023 — LLaVA, और वह क़दम जिसने विज़न-लैंग्वेज मॉडलों को संवादी बनाया।
प्री-रिलीज़ कार्यक्रम
तीन समूह खुले हैं। एक चुनने पर नीचे का फ़ॉर्म तैयार हो जाएगा — वहाँ बदल भी सकते हैं।
प्री-रिलीज़ · पंजीकरण खुला है
तीन ख़ाने। बताइए आप कौन हैं और कहाँ लिखें, न्योता तैयार होते ही हम ईमेल भेज देंगे।
3G पर चलता है · ພາສາລາວ / English