Vyfoťte stránku rodinné knihy
Namiřte fotoaparát na ປຶ້ມສຳມະໂນຄົວ a dostanete každé pole zpět jako strukturovaná data — jména, čísla průkazů, vesnici, okres, provincii — aniž by úředník ve čtyři odpoledne kterékoli z nich přepisoval.
Multimodalita · plán vývoje Plán vývoje — zatím nedodáno
Většina laoštiny, na které záleží, se nepíše na klávesnici. Je orazítkovaná, vyfocená, psaná rukou, vytištěná a znovu naskenovaná, mluvená s regionálním přízvukem nebo jako druhý jazyk, případně předčítaná někomu, kdo ji neumí přečíst. Model, který zvládá jen text, nedosáhne na nic z toho. Tady je, co se mění, proč to potřebuje právě laoština a zhruba kdy.
Co je multimodální model
Textový model čte tokeny. Multimodální model přijímá víc než jeden druh vstupu — obrázky, zvuk, video, dokumenty — a uvažuje nad nimi ve stejném kontextu jako nad textem. Běžná konstrukce připojí k jazykovému modelu enkodér pro každou modalitu a natrénuje toto spojení, takže se obrázek stane něčím, čemu může jazykový model věnovat pozornost vedle slov v promptu.
Pojem, na kterém v praxi záleží, je vizuálně-jazykový model: jazykový model s obrazovým enkodérem, což je ve skutečnosti téměř každá schopnost typu „přečte můj snímek obrazovky?“. Definice IBM je ta krátká — model, který dokáže zpracovávat více modalit, jako je text, obrázky a zvuk, a uvažovat napříč nimi — a glosář NVIDIA je ta krátká pro vizuální polovinu.
Myšlenka je starší než současná vlna. CLIP v roce 2021 ukázal, že obraz a text lze natrénovat do společného prostoru s přirozeným jazykem jako supervizí; Flamingo ukázal, že zmrazený jazykový model lze naučit věnovat pozornost obrázkům z několika příkladů; vizuální ladění instrukcí z výsledku udělalo něco, s čím se dá mluvit. Vše, co je dnes v provozu, pochází z těchto tří.
Přečtěte si primární zdrojeProč to laoština potřebuje víc než angličtina
Není to stejná funkce v jiném jazyce. Čtyři věci dělají z počítačového vidění laoských dokumentů samostatný technický problém a všechny čtyři jsou důvodem, proč v něm obecný model zaostává.
Žádné mezery mezi slovy, takže rozpoznávač nemůže hledat hranice podle prázdného místa. Samohlásky a tónová znaménka jsou nad souhláskou, pod ní i kolem ní, takže sken, který jedno z nich ztratí, slovo potichu změní, místo aby ho viditelně poškodil — a laoských textů, na kterých se dá učit, je mnohem méně než u kteréhokoli velkého jazyka.
Skutečný vstup je fotka orazítkované stránky z telefonu na stole, nakřivo, v kanceláři s jedinou zářivkou. Srovnávací testy s čistými skeny o tom neříkají nic.
Vesnické rejstříky, poznámky ze zdravotních středisek, dodací listy, školní klasifikační archy, rodinná kniha. Laoský rukopis spojuje a zkracuje způsoby, které trénink na tištěném textu nepokryje.
Laoské číslice ໐–໙ vedle arabských, gregoriánské roky na úředních listinách a v chrámových záznamech roky buddhistické éry, které jsou o 543 let napřed, a částky v kipech tak vysoké, že špatně přečtený oddělovač tisíců změní částku tisícinásobně. Přečtěte špatně rok a každé datum v dokumentu je špatně.
Čtyři smysly, tři modely
Dodávány jako samostatné modely místo jednoho velkého, protože router pak může poslat fotku modelu, který čte, a nahrávku modelu, který slyší — a žádný z nich neplatí za váhy toho druhého.
Fotky, snímky obrazovky, grafy, regály, scény, formuláře. Odpovídá laosky o tom, co je v záběru, i s regionem, ze kterého byla odpověď obsloužena.
Specialista na dokumenty: orazítkované, naskenované, zkosené, vícesloupcové, částečně ručně psané laoské písemnosti převádí na strukturovaná pole, která můžete uložit do databáze.
Rozpoznávání a syntéza laoské řeči napříč regionálními varietami, včetně běžného případu, kdy se ptá někdo, jehož prvním jazykem není laoština, a odpověď dostane v jednoduché laoštině.
Ten, na kterém záleží: fotka a vyslovená otázka v jednom požadavku, zodpovězené na základě vašich vlastních dokumentů. To je schopnost, kterou mají samostatné modely zlevnit.
Osmnáct věcí, které dřív nešly
Každá z nich je práce, kterou dnes někdo v Laosu dělá tak, že přepisuje, co má před sebou. Ilustrativní — popisují zamýšlené schopnosti, ne dodané funkce.
Namiřte fotoaparát na ປຶ້ມສຳມະໂນຄົວ a dostanete každé pole zpět jako strukturovaná data — jména, čísla průkazů, vesnici, okres, provincii — aniž by úředník ve čtyři odpoledne kterékoli z nich přepisoval.
Naskenovaná stránka Úředního věstníku se změní ve shrnutí, kde lze každou povinnost dohledat k článku, ze kterého pochází, a datum účinnosti se přečte, místo aby se hádalo.
Vyfoťte stránku, kterou tajemník výboru skutečně napsal, a získejte laoský zápis přepsaný na počítači v úředním registru, se jmény psanými jednotně a s očíslovanými usneseními.
Vyfoťte napůl vyplněný formulář ministerstva a zjistěte, která pole chybějí, které razítko chybí a kvůli které příloze vás úřad pošle domů.
Fotka lékárenské etikety — často vytištěné v jiném jazyce než v laoštině — se změní v mluvené vysvětlení dávky a doby užívání v jednoduché laoštině, pro pacienta, který čte pomalu nebo v tom jazyce vůbec neumí číst.
Vyfoťte nemocniční propouštěcí zprávu a získejte „co dělat tento týden“ v jazyce, kterým se mluví doma, s datem kontroly vloženým do připomínky.
Ukažte poškození a zjistěte, čemu se podobá, s čím se často plete a kterému okresnímu zemědělskému úřadu zavolat — s výslovným odmítnutím předepsat přípravek, kterým si nemůže být jistý.
Vyfoťte pytel, řekněte nahlas velikost pozemku v hektarech a dostanete poměr míchání jako mluvenou odpověď, offline, přímo na poli.
Vyfoťte hromádku. Dostanete tabulku s dodavatelem, daňovým číslem, datem, DPH a součtem, s označením tam, kde účtenka není platným daňovým dokladem a kontrolou neprojde.
Snímek obrazovky potvrzení o převodu z bankovní aplikace nebo přes národní QR, spárovaný s fakturou, kterou hradí, s ověřenou částkou a referencí a s pojmenovaným rozdílem, místo aby byl potichu ignorován.
Vyfoťte regál a získejte laoský seznam produktů s čely a mezerami — dnes je to práce pro člověka s psací podložkou, který uličku projde dvakrát.
Vyfoťte stránku a získejte přípravu na hodinu navázanou na cíle národního kurikula, se dvěma cíli, které stránka nepokrývá, výslovně uvedenými.
Vyfoťte žákovu stránku a dostanete chyby v pravopisu, samohláskách a tónových znaménkách označené pravidlem, které každá porušuje — aby oprava učila, a ne jen známkovala.
Vyfoťte jídelní lístek. Host dostane svůj jazyk i alergeny; jídlo si ponechá laoský název, protože ລາບ není „masový salát“ a restaurace by neměla muset předstírat, že je.
Vyfoťte chrámový nápis nebo rukopis na palmových listech a získejte transliteraci, čtení v jednoduché laoštině a poctivou poznámku o tom, které znaky jsou už příliš ošoupané, než aby se daly přečíst.
Vyfoťte dodací list u rampy a nechte strukturovaná pole dopadnout do WMS — včetně ručně psané opravy množství, kterou někdo udělal propiskou.
Záběr z CCTV se změní v popsaný záznam o incidentu v laoštině s časovým razítkem, v registru, v jakém se hlášení musí podat, připravený k podpisu člověkem.
Namiřte fotoaparát a slyšte laosky, co je před vámi, v tempu chůze — ta podoba této technologie, která vůbec není funkcí pro produktivitu.
Jak to vypadá v API
Stejný endpoint. Obrázek v poli content a router se postará o zbytek — což je celý důvod, proč bylo směrování dodáno jako první.
POST /v1/messages
{
"model": "auto", // the router picks
"messages": [{
"role": "user",
"content": [
{ "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
{ "type": "text", "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
]
}],
"lao": { "register": "official", "dialect": "auto" }
}
// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
// "region": "la-vte-1", "usage": { "kip": 42.60 } }Plán vývoje
Čtyři fáze. Žádná z nich není datum: každá se otevře, až projde svou testovací sadou — a tu nehodnotí žebříček, ale mluvčí laoštiny.
Tištěné a naskenované laoské dokumenty převedené na strukturovaná pole. Laoské číslice i oba kalendáře se řeší už při čtení, ne dodatečnými záplatami.
BránaFotky z telefonu pořízené pod úhlem, razítka, pečeti a laoský rukopis. Tohle je fáze, která rozhodne, zda je produkt použitelný i mimo kancelář.
BránaŘeč na vstupu i na výstupu, hodnocená zvlášť pro každou regionální varietu i pro lidi, pro něž je laoština druhým jazykem — protože průměr napříč nimi skrývá přesně to selhání, na kterém záleží.
BránaKomprimovaný vizuální model, který běží bez připojení na telefonu s Androidem ze střední třídy, pro práci, která se odehrává tam, kde není signál.
BránaZdroje
Doplňkové čtení o multimodálních modelech, z primární dokumentace a článků, na kterých obor stojí. Externí odkazy, bez vazby na LaoGPT.
Nejjasnější krátká definice multimodálního velkého jazykového modelu a toho, k čemu slouží.
NVIDIAWhat are vision-language models? — NVIDIA glossaryJak se obrazový enkodér připojuje k jazykovému modelu, aby mu dal zrak.
WikipediaVision-language model — WikipediaNeutrální přehled s rozsáhlou bibliografií, pokud chcete vidět tvar oboru před detaily.
AnthropicVision — Claude API documentationPraktická dokumentace k posílání obrázků modelu a k praktickým limitům toho.
GoogleImage understanding — Gemini API documentationAPI multimodální od základu, včetně dokumentů a videa jako vstupu.
OpenAIImages and vision — OpenAI platform documentationDruhé široce používané API pro obrázky, pro srovnání podoby požadavků.
Hugging FaceImage-text-to-text — Hugging FaceStrana otevřených modelů: definice úlohy a modely, které si můžete spustit sami.
arXiv 2103.00020Learning Transferable Visual Models From Natural Language SupervisionCLIP, 2021 — obraz a text natrénované do společné reprezentace. Článek, ze kterého moderní obor vychází.
arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learning2022 — jak naučit zmrazený jazykový model věnovat pozornost obrázkům.
arXiv 2304.08485Visual Instruction Tuning2023 — LLaVA a krok, který z vizuálně-jazykových modelů udělal konverzační.
Program předverze
Otevřené jsou tři skupiny. Výběr jedné nastaví formulář níže — tam jej můžete změnit.
Předverze · registrace otevřena
Tři pole. Řekněte nám, kdo jste a kam psát, a jakmile bude pozvánka připravená, pošleme e-mail.
Funguje na 3G · ພາສາລາວ / English