صوّر صفحة من دفتر العائلة
وجِّه الكاميرا إلى ປຶ້ມສຳມະໂນຄົວ واحصل على كل حقل فيه في صورة بيانات منظّمة — الأسماء وأرقام الهوية والقرية والمديرية والإقليم — دون أن يعيد موظف كتابة أيٍّ منها في الرابعة عصرًا.
متعدد الوسائط · خريطة الطريق خريطة الطريق — لم يُسلَّم بعد
معظم اللاوسية المهمة لا تُكتب على لوحة مفاتيح. إنها تُختم، وتُصوَّر، وتُكتب باليد، وتُطبع ثم تُمسح ضوئيًا من جديد، وتُنطق بلكنة إقليمية أو بوصفها لغة ثانية، أو تُقرأ بصوت عالٍ لمن لا يستطيع قراءتها. والنموذج الذي لا يعالج إلا النص لا يصل إلى شيء من ذلك. إليك ما الذي يتغير، ولماذا تحتاج اللاوسية إليه تحديدًا، ومتى تقريبًا.
ما النموذج متعدد الوسائط
النموذج النصي يقرأ رموزًا. أما النموذج متعدد الوسائط فيستقبل أكثر من نوع واحد من المدخلات — صور، وصوت، وفيديو، ومستندات — ويستدلّ عليها في السياق نفسه الذي يستدلّ فيه على النص. والبناء الشائع يربط مُرمِّزًا لكل وسيط بنموذج لغوي ويدرّب هذا الربط، فتصبح الصورة شيئًا يستطيع النموذج اللغوي الانتباه إليه إلى جانب كلمات الموجّه النصي.
المصطلح المهم عمليًا هو النموذج البصري اللغوي: نموذج لغوي مزوّد بمُرمِّز للصور، وهو في الحقيقة ما تكونه كل قدرة تقريبًا من نوع «هل يستطيع قراءة لقطة شاشتي». تعريف IBM هو التعريف الموجز — نموذج قادر على معالجة وسائط متعددة كالنص والصور والصوت والاستدلال عبرها — ومسرد NVIDIA هو الموجز للنصف البصري.
الفكرة أقدم من الموجة الحالية. أظهر CLIP عام 2021 أن الصورة والنص يمكن تدريبهما في فضاء مشترك باستخدام اللغة الطبيعية إشرافًا؛ وأظهر Flamingo أن نموذجًا لغويًا مجمّدًا يمكن تعليمه الانتباه إلى الصور من أمثلة قليلة؛ ثم جعل الضبط البصري بالتعليمات النتيجةَ شيئًا يمكن التحاور معه. وكل ما هو قيد الاستخدام اليوم ينحدر من هذه الثلاثة.
اقرأ المصادر الأوليةلماذا تحتاج اللاوسية إلى هذا أكثر من الإنجليزية
ليست هذه الميزةَ نفسها بلغة أخرى. أربعة أمور تجعل الرؤية الحاسوبية للمستندات اللاوسية مشكلة هندسية قائمة بذاتها، والأربعة كلها أسباب لضعف أداء النموذج العام فيها.
لا مسافات بين الكلمات، فلا يستطيع المعرِّف أن يستعين بالفراغ لإيجاد الحدود. وتقع الحركات وعلامات النغمات فوق الحرف الصامت وتحته وحوله، فإذا فقد المسحُ إحداها غيّر الكلمة بصمت بدل أن يفسدها بشكل ظاهر — والنصوص اللاوسية المتاحة للتعلّم منها أقل بكثير مما هو متاح لأي لغة كبرى.
المدخل الحقيقي صورة بالهاتف لصفحة مختومة على مكتب، مائلة، في مكتب فيه مصباح فلوري واحد. والاختبارات المرجعية على مسوحات نظيفة لا تقول شيئًا عن ذلك.
سجلات القرى، وملاحظات العيادات، وإيصالات التسليم، وكشوف درجات المدارس، ودفتر العائلة. والخط اليدوي اللاوسي يصل الحروف ويختصرها بطرق لا يغطيها التدريب على النص المطبوع.
أرقام لاوسية ໐–໙ إلى جانب الأرقام العربية، وسنوات ميلادية في الأوراق الحكومية، وسنوات التقويم البوذي المتقدمة عليها 543 سنة في سجلات المعابد، ومبالغ بالكيب كبيرة إلى حد أن خطأً في قراءة فاصل الآلاف يغيّر الرقم ألف ضعف. أخطِئ في قراءة السنة فيصبح كل تاريخ في المستند خاطئًا.
أربع حواس، ثلاثة نماذج
تُسلَّم نماذج منفصلة بدل نموذج واحد كبير، لأن الموجِّه يستطيع حينئذ أن يرسل الصورة إلى النموذج الذي يقرأ والتسجيل إلى النموذج الذي يسمع — ولا يدفع أيٌّ منهما ثمن أوزان الآخر.
صور، ولقطات شاشة، ورسوم بيانية، ورفوف، ومشاهد، واستمارات. يجيب باللاوسية عمّا في الصورة، ومع كل إجابة المنطقة التي قُدِّمت منها.
اختصاصي المستندات: أوراق لاوسية مختومة وممسوحة ومائلة ومتعددة الأعمدة ومكتوب بعضها باليد، تتحول إلى حقول منظّمة يمكنك وضعها في قاعدة بيانات.
التعرّف على الكلام اللاوسي وتوليده عبر المتغيرات الإقليمية، بما في ذلك الحالة الشائعة لسؤال يطرحه شخص لغته الأولى ليست اللاوسية، ويُجاب عنه بلاوسية بسيطة.
الأهم بينها: صورة وسؤال منطوق في الطلب نفسه، والإجابة من مستنداتك أنت. وهذه هي القدرة التي وُجدت النماذج المنفصلة لجعلها رخيصة.
ثمانية عشر أمرًا لم تكن ممكنة من قبل
كلٌّ منها عمل يقوم به أحدهم في لاوس اليوم بإعادة كتابة ما أمامه. أمثلة توضيحية — تصف القدرة المنشودة، لا ميزات مُسلَّمة.
وجِّه الكاميرا إلى ປຶ້ມສຳມະໂນຄົວ واحصل على كل حقل فيه في صورة بيانات منظّمة — الأسماء وأرقام الهوية والقرية والمديرية والإقليم — دون أن يعيد موظف كتابة أيٍّ منها في الرابعة عصرًا.
تتحول صفحة ممسوحة من الجريدة الرسمية إلى ملخص يمكن فيه تتبع كل التزام إلى المادة التي جاء منها، ويُقرأ تاريخ النفاذ بدل أن يُخمَّن.
صوّر الصفحة التي كتبها أمين سر اللجنة فعلًا، واحصل على محضر مطبوع باللاوسية بالمستوى اللغوي الرسمي، بأسماء مكتوبة بتهجئة موحّدة وقرارات مرقّمة.
صوّر استمارة وزارية نصف مملوءة واعرف أي الخانات ناقصة، وأي ختم غائب، وأي مرفق سيعيدك المكتب إلى البيت بسببه.
صورة ملصق صيدلية — كثيرًا ما يُطبع بلغة غير اللاوسية — تصبح شرحًا منطوقًا بلاوسية بسيطة للجرعة والمواعيد، لمريض يقرأ ببطء، أو لا يقرأ تلك اللغة أصلًا.
صوّر ملخص الخروج من المستشفى واحصل على «ما عليك فعله هذا الأسبوع» باللغة المستخدمة في البيت، مع إضافة موعد المراجعة إلى تذكير.
أرِه الإصابة واعرف بمَ تشبه، وبمَ تُخلط كثيرًا، وبأي مكتب للزراعة في المديرية ينبغي الاتصال — مع رفض صريح لوصف مادة كيميائية لا يمكنه التيقّن منها.
صوّر الكيس، وانطق مساحة الأرض بالهكتار، واحصل على نسبة الخلط إجابةً منطوقة، دون اتصال، وأنت واقف في الحقل.
صوّر الكومة. واحصل على جدول بالمورّد والرقم الضريبي والتاريخ وضريبة القيمة المضافة والإجمالي، مع تنبيه حيث لا يكون الإيصال فاتورة ضريبية صالحة ولن يصمد أمام التدقيق.
لقطة شاشة لإيصال تحويل من تطبيق مصرفي أو عبر رمز QR الوطني، تُطابَق مع الفاتورة التي يسددها، مع التحقق من المبلغ والمرجع وتسمية الفرق بدل تجاهله بصمت.
صوّر الرف واحصل على قائمة منتجات باللاوسية مع الواجهات والفراغات — العمل الذي يؤديه اليوم شخص يحمل لوحًا ويمرّ على الممر مرتين.
صوّر الصفحة واحصل على خطة درس مرتبطة بأهداف المنهج الوطني، مع تسمية الهدفين اللذين لا تغطيهما الصفحة صراحةً.
صوّر صفحة الطالب واحصل على أخطاء الإملاء والحركات وعلامات النغمات مُعلَّمة مع القاعدة التي يخالفها كلٌّ منها — لكي يُعلِّم التصحيح لا أن يمنح درجة فحسب.
صوّر القائمة. يحصل الضيف على لغته وعلى مسبّبات الحساسية؛ ويحتفظ الطبق باسمه اللاوسي، لأن ລາບ ليس «سلطة لحم»، ولا ينبغي أن يُضطر مطعم إلى التظاهر بذلك.
صوّر نقشًا في معبد أو مخطوطة على ورق النخيل، واحصل على نقل حرفي، وقراءة بلاوسية بسيطة، وملاحظة صادقة عن الأحرف التي بليت فلم تعد مقروءة.
صوّر إيصال التسليم عند رصيف التحميل ودَع الحقول المنظمة تصل إلى WMS — بما في ذلك تصحيح الكمية الذي كتبه أحدهم بقلم حبر.
لقطة ثابتة من كاميرا CCTV تصبح مذكرة حادث موصوفة ومزوّدة بطابع زمني باللاوسية، بالمستوى اللغوي الذي يجب أن يُقدَّم به التقرير، ليوقّعها إنسان.
وجِّه الكاميرا واسمع باللاوسية ما أمامك، بإيقاع المشي — النسخة من هذه التقنية التي ليست ميزة إنتاجية على الإطلاق.
كيف يبدو ذلك في الواجهة البرمجية
نقطة النهاية نفسها. صورة في مصفوفة content، والموجِّه يتولى الباقي — وهذا هو السبب كله في أن التوجيه سُلِّم أولًا.
POST /v1/messages
{
"model": "auto", // the router picks
"messages": [{
"role": "user",
"content": [
{ "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
{ "type": "text", "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
]
}],
"lao": { "register": "official", "dialect": "auto" }
}
// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
// "region": "la-vte-1", "usage": { "kip": 42.60 } }خريطة الطريق
أربع مراحل. لا شيء منها تاريخ: كل مرحلة تُفتح حين تجتاز مجموعة الاختبار الخاصة بها، ويمنح الدرجاتِ ناطقون باللاوسية، لا لوحة ترتيب.
مستندات لاوسية مطبوعة وممسوحة تتحول إلى حقول منظّمة. تُعالَج الأرقام اللاوسية والتقويمان كلاهما عند القراءة، ولا تُرقَّع لاحقًا.
بوابةصور هاتف مائلة، وأختام، ودمغات، وخط يدوي لاوسي. هذه هي المرحلة التي تحدد إن كان المنتج مفيدًا خارج المكتب.
بوابةالكلام إدخالًا وإخراجًا، تُمنح درجاته منفصلة لكل متغير إقليمي وللناطقين باللاوسية لغةً ثانية — لأن المتوسط العام يخفي بالضبط الإخفاق الذي يهمّ.
بوابةنموذج رؤية مضغوط يعمل دون اتصال على هاتف Android من الفئة المتوسطة، للعمل الذي يجري حيث لا تغطية.
بوابةمراجع
قراءات خلفية عن النماذج متعددة الوسائط، من التوثيق الأصلي والأوراق البحثية التي يقوم عليها هذا المجال. روابط خارجية، لا علاقة لها بـ LaoGPT.
أوضح تعريف موجز للنموذج اللغوي الكبير متعدد الوسائط والغرض منه.
NVIDIAWhat are vision-language models? — NVIDIA glossaryكيف يُربط مُرمِّز الصور بنموذج لغوي ليمنحه البصر.
WikipediaVision-language model — Wikipediaنظرة عامة محايدة مع قائمة مراجع واسعة، إن أردت أن ترى شكل المجال قبل التفاصيل.
AnthropicVision — Claude API documentationتوثيق عملي لإرسال الصور إلى نموذج، وحدود ذلك العملية.
GoogleImage understanding — Gemini API documentationواجهة برمجية متعددة الوسائط من أساسها، تقبل المستندات والفيديو مدخلاتٍ.
OpenAIImages and vision — OpenAI platform documentationالواجهة البرمجية الأخرى الشائعة الاستخدام للصور، لمقارنة شكل الطلبات.
Hugging FaceImage-text-to-text — Hugging Faceجانب النماذج المفتوحة: تعريف المهمة، ونماذج يمكنك تشغيلها بنفسك.
arXiv 2103.00020Learning Transferable Visual Models From Natural Language SupervisionCLIP، 2021 — صورة ونص مدرَّبان في تمثيل مشترك. الورقة التي ينطلق منها المجال الحديث.
arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learning2022 — كيف يُعلَّم نموذج لغوي مجمّد الانتباه إلى الصور.
arXiv 2304.08485Visual Instruction Tuning2023 — LLaVA، والخطوة التي جعلت النماذج البصرية اللغوية حوارية.
برنامج الإصدار التمهيدي
ثلاث مجموعات مفتوحة. اختيار واحدة يهيّئ النموذج أدناه — ويمكنك تغييره هناك.
إصدار تمهيدي · التسجيل مفتوح
ثلاثة حقول. أخبرنا من أنت وأين نراسلك، وسنرسل بريداً إلكترونياً فور جهوز دعوتك.
يعمل على 3G · ພາສາລາວ / English