मल्टीमॉडल · रोडमैप रोडमैप — अभी उपलब्ध नहीं

एक लाओ मॉडल जिसे आप चीज़ें दिखा सकते हैं।

जो लाओ भाषा मायने रखती है, उसका ज़्यादातर हिस्सा टाइप नहीं होता। उस पर मुहर लगती है, उसकी फ़ोटो खींची जाती है, वह हाथ से लिखी जाती है, छपती है और फिर स्कैन होती है, किसी क्षेत्रीय लहजे में या दूसरी भाषा के रूप में बोली जाती है, या किसी ऐसे व्यक्ति को पढ़कर सुनाई जाती है जो उसे पढ़ नहीं सकता। सिर्फ़ पाठ वाला मॉडल इनमें से किसी तक नहीं पहुँचता। यहाँ बताया गया है कि क्या बदलता है, लाओ को ख़ास तौर पर इसकी ज़रूरत क्यों है, और लगभग कब।

मल्टीमॉडल मॉडल क्या है

पाठ मॉडल टोकन पढ़ता है। मल्टीमॉडल मॉडल एक से ज़्यादा तरह का इनपुट लेता है — तस्वीरें, ऑडियो, वीडियो, दस्तावेज़ — और उन पर उसी संदर्भ में तर्क करता है जिसमें पाठ पर। आम तौर पर हर मोडैलिटी के लिए एक एनकोडर को भाषा मॉडल से जोड़ा जाता है और उस जोड़ को प्रशिक्षित किया जाता है, ताकि तस्वीर ऐसी चीज़ बन जाए जिस पर भाषा मॉडल प्रॉम्प्ट के शब्दों के साथ ध्यान दे सके।

व्यवहार में जो शब्द मायने रखता है, वह है विज़न-लैंग्वेज मॉडल: इमेज एनकोडर वाला भाषा मॉडल, और लगभग हर “क्या यह मेरा स्क्रीनशॉट पढ़ सकता है” वाली क्षमता असल में यही होती है। IBM की परिभाषा छोटी वाली है — ऐसा मॉडल जो पाठ, तस्वीरों और ऑडियो जैसी कई मोडैलिटी को संसाधित कर सके और उनके पार तर्क कर सके — और दृश्य वाले हिस्से के लिए NVIDIA की शब्दावली छोटी वाली है।

यह विचार मौजूदा लहर से पुराना है। CLIP ने 2021 में दिखाया कि प्राकृतिक भाषा को पर्यवेक्षण बनाकर तस्वीर और पाठ को एक साझा स्थान में प्रशिक्षित किया जा सकता है; Flamingo ने दिखाया कि एक स्थिर (फ़्रोज़न) भाषा मॉडल को कुछ ही उदाहरणों से तस्वीरों पर ध्यान देना सिखाया जा सकता है; दृश्य निर्देश-ट्यूनिंग ने नतीजे को ऐसी चीज़ बना दिया जिससे बात की जा सके। आज जो कुछ इस्तेमाल में है, वह इन्हीं तीन से निकला है।

मूल स्रोत पढ़िए

लाओ को इसकी ज़रूरत अंग्रेज़ी से ज़्यादा क्यों है

यह किसी दूसरी भाषा में वही सुविधा नहीं है। चार बातें लाओ के लिए दस्तावेज़-दृष्टि को एक अलग तकनीकी समस्या बनाती हैं, और चारों ही वजह हैं कि कोई सामान्य मॉडल यहाँ कमज़ोर पड़ता है।

1

लाओ OCR हल नहीं हुआ है

शब्दों के बीच ख़ाली जगह नहीं होती, इसलिए पहचानने वाला तंत्र सीमाएँ ढूँढने के लिए ख़ाली जगह का सहारा नहीं ले सकता। स्वर और टोन चिह्न व्यंजन के ऊपर, नीचे और चारों ओर लगते हैं, इसलिए जो स्कैन इनमें से एक भी खो दे, वह शब्द को साफ़ तौर पर बिगाड़ने के बजाय चुपचाप बदल देता है — और सीखने के लिए लाओ पाठ किसी भी बड़ी भाषा की तुलना में कहीं कम है।

2

काग़ज़ों की फ़ोटो खींची जाती है, स्कैन नहीं

असली इनपुट मेज़ पर रखे मुहर लगे पन्ने की फ़ोन से खींची फ़ोटो है, तिरछी, एक ट्यूबलाइट वाले दफ़्तर में। साफ़ स्कैन वाले बेंचमार्क इसके बारे में कुछ नहीं बताते।

3

हस्तलेख अब भी मुख्य इंटरफ़ेस है

गाँव के रजिस्टर, क्लिनिक के नोट, डिलीवरी पर्चियाँ, स्कूलों की अंक-सूचियाँ, परिवार पुस्तिका। लाओ हस्तलेख ऐसे ढंग से अक्षर जोड़ता और छोटा करता है जिसे छपे पाठ पर प्रशिक्षण नहीं पकड़ पाता।

4

अंक सिर्फ़ अंक नहीं हैं

अरबी अंकों के साथ लाओ अंक ໐–໙, सरकारी काग़ज़ों पर ग्रेगोरियन वर्ष और मंदिरों के अभिलेखों में 543 वर्ष आगे चलने वाले बौद्ध संवत् के वर्ष, और कीप की इतनी बड़ी रक़में कि हज़ारों का विभाजक ग़लत पढ़ने से आँकड़ा हज़ार गुना बदल जाता है। वर्ष ग़लत पढ़ा तो दस्तावेज़ की हर तारीख़ ग़लत।


चार इंद्रियाँ, तीन मॉडल

एक बड़े मॉडल के बजाय अलग-अलग मॉडल के रूप में दिए जाते हैं, क्योंकि तब राउटर फ़ोटो को पढ़ने वाले मॉडल को और रिकॉर्डिंग को सुनने वाले मॉडल को भेज सकता है — और किसी को भी दूसरे के वेट्स का दाम नहीं चुकाना पड़ता।

तस्वीर · वीडियो फ़्रेम

LaoLLM-Vision

फ़ोटो, स्क्रीनशॉट, चार्ट, शेल्फ़, दृश्य, फ़ॉर्म। फ़्रेम में जो है उसके बारे में लाओ में जवाब देता है, और साथ में बताता है कि जवाब किस क्षेत्र से दिया गया।

दस्तावेज़ · हस्तलेख

LaoLLM-Scribe

दस्तावेज़ों का विशेषज्ञ: मुहर लगे, स्कैन किए, तिरछे, कई कॉलम वाले, कुछ हिस्से में हाथ से लिखे लाओ काग़ज़ों को ऐसे संरचित फ़ील्ड में बदलता है जिन्हें आप डेटाबेस में डाल सकें।

ऑडियो अंदर · ऑडियो बाहर

LaoLLM-Voice

क्षेत्रीय रूपों में लाओ वाक्-पहचान और वाक्-संश्लेषण, उस आम स्थिति समेत जिसमें सवाल ऐसा व्यक्ति पूछता है जिसकी पहली भाषा लाओ नहीं है, और जवाब सरल लाओ में दिया जाता है।

ऊपर का सब कुछ, एक साथ

क्रॉस-मॉडल

जो असल में मायने रखता है: एक ही अनुरोध में एक फ़ोटो और बोलकर पूछा गया सवाल, जिसका जवाब आपके अपने दस्तावेज़ों के आधार पर मिले। अलग-अलग मॉडल इसी क्षमता को सस्ता बनाने के लिए हैं।


अठारह काम जो पहले नहीं हो पाते थे

हर एक ऐसा काम है जिसे आज लाओस में कोई अपने सामने रखी चीज़ को दोबारा टाइप करके करता है। उदाहरण के तौर पर — ये इच्छित क्षमता बताते हैं, जारी हो चुकी सुविधाएँ नहीं।

सरकार और सार्वजनिक क्षेत्र

परिवार पुस्तिका के पन्ने की फ़ोटो लीजिए

कैमरा ປຶ້ມສຳມະໂນຄົວ की ओर कीजिए और हर फ़ील्ड संरचित डेटा के रूप में वापस पाइए — नाम, पहचान संख्याएँ, गाँव, ज़िला, प्रांत — बिना किसी कर्मचारी के शाम चार बजे उनमें से एक भी दोबारा टाइप किए।

फ़ोटो से राजपत्र की अधिसूचना पढ़िए

राजपत्र का स्कैन किया गया पन्ना ऐसा सारांश बन जाता है जिसमें हर दायित्व को उस अनुच्छेद तक खोजा जा सके जहाँ से वह आया, और लागू होने की तारीख़ अंदाज़े से नहीं, पढ़कर तय होती है।

हाथ से लिखे ग्राम कार्यवृत्त को दस्तावेज़ बनाइए

समिति सचिव ने जो पन्ना सचमुच लिखा था उसकी फ़ोटो लीजिए और सरकारी शैली में टाइप किया लाओ कार्यवृत्त पाइए, जिसमें नाम एक जैसे लिखे हों और निर्णय क्रमांकित हों।

क़तार में लगने से पहले फ़ॉर्म जाँचिए

मंत्रालय के आधे भरे फ़ॉर्म की फ़ोटो लीजिए और जानिए कि कौन-से खाने ख़ाली हैं, कौन-सी मुहर छूटी है, और कौन-से संलग्नक की वजह से दफ़्तर आपको घर लौटा देगा।

स्वास्थ्य

दवा का लेबल बोलकर समझाइए

दवा दुकान के लेबल की फ़ोटो — लेबल अक्सर लाओ के बजाय किसी दूसरी भाषा में छपा होता है — सरल लाओ में ख़ुराक और समय की बोली गई व्याख्या बन जाती है, उस मरीज़ के लिए जो धीरे पढ़ता है, या वह भाषा बिल्कुल नहीं पढ़ पाता।

अस्पताल से छुट्टी के काग़ज़ को काम का बनाइए

अस्पताल के डिस्चार्ज सारांश की फ़ोटो लीजिए और घर में बोली जाने वाली भाषा में “इस हफ़्ते क्या करना है” पाइए, साथ में अगली जाँच की तारीख़ रिमाइंडर में दर्ज।

कृषि

फ़ोटो से धान के पत्ते की बीमारी पहचानिए

नुक़सान दिखाइए और जानिए कि वह किस जैसा दिखता है, अक्सर किससे भ्रमित होता है, और किस ज़िला कृषि कार्यालय को फ़ोन करना है — साथ में ऐसा रसायन बताने से साफ़ इनकार, जिसके बारे में वह पक्का न हो।

खाद की बोरी पढ़िए और मात्रा निकालिए

बोरी की फ़ोटो लीजिए, खेत का आकार हेक्टेयर में बोलिए, और मिश्रण का अनुपात बोले गए जवाब के रूप में पाइए — ऑफ़लाइन, खेत में खड़े-खड़े।

व्यापार और वित्त

रसीदों के ढेर को VAT तालिका बनाइए

ढेर की फ़ोटो लीजिए। विक्रेता, कर पहचान संख्या, तारीख़, VAT और कुल राशि वाली तालिका पाइए, जिसमें वे रसीदें चिह्नित हों जो वैध VAT बीजक नहीं हैं और ऑडिट में नहीं टिकेंगी।

QR भुगतान रसीद का बीजक से मिलान कीजिए

बैंक ऐप या राष्ट्रीय QR से हुए ट्रांसफ़र की रसीद का स्क्रीनशॉट उस बीजक से मिलाया जाता है जिसका भुगतान वह करती है, राशि और संदर्भ जाँचे जाते हैं, और अंतर को चुपचाप नज़रअंदाज़ करने के बजाय साफ़ बताया जाता है।

शेल्फ़ की गिनती कीजिए

शेल्फ़ की फ़ोटो लीजिए और फ़ेसिंग व ख़ाली जगहों सहित लाओ में उत्पाद-सूची पाइए — वह काम जो आज क्लिपबोर्ड लिए एक व्यक्ति गलियारे के दो चक्कर लगाकर करता है।

शिक्षा

पाठ्यपुस्तक के पन्ने से पाठ तैयार कीजिए

पन्ने की फ़ोटो लीजिए और राष्ट्रीय पाठ्यक्रम के लक्ष्यों से जुड़ी पाठ-योजना पाइए, जिसमें वे दो लक्ष्य साफ़ बताए गए हों जिन्हें वह पन्ना नहीं छूता।

हाथ से लिखे लाओ गृहकार्य की जाँच कीजिए

छात्र के पन्ने की फ़ोटो लीजिए और वर्तनी, स्वर और टोन चिह्नों की ग़लतियाँ पाइए, हर एक के साथ वह नियम जो उसने तोड़ा — ताकि जाँच सिखाए, सिर्फ़ अंक न दे।

पर्यटन और सेवाएँ

व्यंजन खोए बिना मेन्यू का अनुवाद कीजिए

मेन्यू की फ़ोटो लीजिए। मेहमान को अपनी भाषा और एलर्जी की जानकारी मिलती है; व्यंजन अपना लाओ नाम बनाए रखता है, क्योंकि ລາບ “मांस का सलाद” नहीं है, और किसी रेस्तराँ को ऐसा दिखावा करने पर मजबूर नहीं होना चाहिए।

शिलालेख पढ़िए

मंदिर के शिलालेख या ताड़पत्र पांडुलिपि की फ़ोटो लीजिए और लिप्यंतरण, सरल लाओ में पाठ, और एक ईमानदार टिप्पणी पाइए कि कौन-से अक्षर इतने घिस चुके हैं कि पढ़े नहीं जा सकते।

उद्योग और लॉजिस्टिक्स

डिलीवरी पर्ची को सिस्टम में डालिए

लोडिंग डॉक पर डिलीवरी पर्ची की फ़ोटो लीजिए और संरचित फ़ील्ड सीधे WMS में जाने दीजिए — उस मात्रा-सुधार समेत जो किसी ने पेन से हाथ से किया था।

फ़्रेम से घटना-रिपोर्ट लिखिए

CCTV का एक स्थिर फ़्रेम लाओ में वर्णित, समय-अंकित घटना-टिप्पणी बन जाता है, उस शैली में जिसमें रिपोर्ट दाख़िल होनी है, ताकि कोई इंसान उस पर हस्ताक्षर करे।

सुलभता

कमरे का वर्णन कीजिए

कैमरा उठाइए और लाओ में सुनिए कि आपके सामने क्या है, चलने की रफ़्तार से — इस तकनीक का वह रूप जो उत्पादकता की सुविधा बिल्कुल नहीं है।


API में यह कैसा दिखता है

वही एंडपॉइंट। content ऐरे में एक तस्वीर, और बाकी राउटर सँभाल लेता है — यही पूरी वजह है कि रूटिंग सबसे पहले उपलब्ध कराई गई।

POST /v1/messages
{
  "model": "auto",                     // the router picks
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
      { "type": "text",  "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
    ]
  }],
  "lao": { "register": "official", "dialect": "auto" }
}

// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
//   "region": "la-vte-1", "usage": { "kip": 42.60 } }

रोडमैप

चार चरण। इनमें से कोई भी तारीख़ नहीं है: हर चरण तब खुलता है जब उसका परीक्षण-समूह पास हो जाए, और उसके अंक लाओ भाषी देते हैं, कोई लीडरबोर्ड नहीं।

  1. 1
    चरण 1 · दस्तावेज़-दृष्टि

    छपे और स्कैन किए लाओ दस्तावेज़ों को संरचित फ़ील्ड में बदलना। लाओ अंक और दोनों कैलेंडर पढ़ते समय ही सँभाले जाते हैं, बाद में जोड़-तोड़ से नहीं।

    द्वार
  2. 2
    चरण 2 · फ़ोटो और हस्तलेख

    तिरछी फ़ोन फ़ोटो, मुहरें, सील और लाओ हस्तलेख। यही चरण तय करता है कि उत्पाद दफ़्तर के बाहर काम का है या नहीं।

    द्वार
  3. 3
    चरण 3 · आवाज़, हर रूप

    आवाज़ अंदर और आवाज़ बाहर, हर क्षेत्रीय रूप के लिए और दूसरी भाषा के रूप में लाओ बोलने वालों के लिए अलग-अलग अंकित — क्योंकि सबका मिला-जुला औसत ठीक वही विफलता छिपा लेता है जो मायने रखती है।

    द्वार
  4. 4
    चरण 4 · उपकरण पर क्रॉस-मॉडल

    एक संकुचित दृष्टि मॉडल जो मध्यम श्रेणी के Android फ़ोन पर बिना कनेक्शन के चलता है, उस काम के लिए जो वहाँ होता है जहाँ सिग्नल नहीं है।

    द्वार

संदर्भ

मल्टीमॉडल मॉडलों पर पृष्ठभूमि-पठन, मूल दस्तावेज़ों और उन शोधपत्रों से जिन पर यह क्षेत्र खड़ा है। बाहरी लिंक, LaoGPT से असंबद्ध।

IBMWhat is a multimodal LLM? — IBM

मल्टीमॉडल बड़े भाषा मॉडल और उसके उपयोग की सबसे साफ़ छोटी परिभाषा।

NVIDIAWhat are vision-language models? — NVIDIA glossary

इमेज एनकोडर को भाषा मॉडल से कैसे जोड़ा जाता है ताकि उसे दृष्टि मिले।

WikipediaVision-language model — Wikipedia

विस्तृत ग्रंथसूची वाला एक तटस्थ अवलोकन, अगर आप विवरण से पहले क्षेत्र का पूरा आकार देखना चाहें।

AnthropicVision — Claude API documentation

किसी मॉडल को तस्वीरें भेजने का व्यावहारिक दस्तावेज़, और ऐसा करने की व्यावहारिक सीमाएँ।

GoogleImage understanding — Gemini API documentation

जड़ से मल्टीमॉडल एक API, जिसमें दस्तावेज़ और वीडियो भी इनपुट के रूप में शामिल हैं।

OpenAIImages and vision — OpenAI platform documentation

तस्वीरों के लिए व्यापक रूप से इस्तेमाल होने वाला दूसरा API, अनुरोधों के रूप की तुलना के लिए।

Hugging FaceImage-text-to-text — Hugging Face

खुले मॉडलों वाला पक्ष: काम की परिभाषा और ऐसे मॉडल जिन्हें आप ख़ुद चला सकते हैं।

arXiv 2103.00020Learning Transferable Visual Models From Natural Language Supervision

CLIP, 2021 — तस्वीर और पाठ को एक साझा निरूपण में प्रशिक्षित किया गया। वह शोधपत्र जहाँ से आधुनिक क्षेत्र शुरू होता है।

arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learning

2022 — एक स्थिर भाषा मॉडल को तस्वीरों पर ध्यान देना कैसे सिखाया जाता है।

arXiv 2304.08485Visual Instruction Tuning

2023 — LLaVA, और वह क़दम जिसने विज़न-लैंग्वेज मॉडलों को संवादी बनाया।

प्री-रिलीज़ कार्यक्रम

चुनिए कि आप कैसे जुड़ना चाहते हैं।

तीन समूह खुले हैं। एक चुनने पर नीचे का फ़ॉर्म तैयार हो जाएगा — वहाँ बदल भी सकते हैं।