Multimodale · roadmap Roadmap — non ancora disponibile

Un modello lao a cui si possono mostrare le cose.

La maggior parte del lao che conta non viene digitata. Viene timbrata, fotografata, scritta a mano, stampata e scansionata di nuovo, parlata con un accento regionale o come lingua seconda, o letta ad alta voce a chi non sa leggerla. Un modello solo testuale non arriva a nulla di tutto questo. Ecco cosa cambia, perché il lao in particolare ne ha bisogno e, più o meno, quando.

Cos'è un modello multimodale

Un modello di testo legge token. Un modello multimodale accetta più di un tipo di input — immagini, audio, video, documenti — e ragiona su di essi nello stesso contesto del testo. La costruzione tipica collega un encoder per ogni modalità a un modello linguistico e ne addestra l'unione, così un'immagine diventa qualcosa a cui il modello linguistico può prestare attenzione accanto alle parole del prompt.

Il termine che conta in pratica è modello visione-linguaggio: un modello linguistico con un encoder di immagini, che è ciò che è davvero quasi ogni capacità del tipo «riesce a leggere il mio screenshot?». La definizione di IBM è quella breve — un modello in grado di elaborare e ragionare su più modalità come testo, immagini e audio — e il glossario di NVIDIA è quello breve per la metà visiva.

L'idea è più vecchia dell'ondata attuale. CLIP ha mostrato nel 2021 che immagine e testo potevano essere addestrati in uno spazio condiviso grazie alla supervisione in linguaggio naturale; Flamingo ha mostrato che a un modello linguistico congelato si poteva insegnare a prestare attenzione alle immagini con pochi esempi; il visual instruction tuning ne ha fatto qualcosa con cui si può parlare. Tutto ciò che oggi è in produzione discende da questi tre.

Leggi le fonti primarie

Perché il lao ne ha più bisogno dell'inglese

Non è la stessa funzione in un'altra lingua. Quattro elementi fanno della visione documentale in lao un problema di ingegneria a sé, e tutti e quattro spiegano perché un modello generico qui rende meno.

1

L'OCR del lao non è risolto

Nessuno spazio tra le parole, quindi un sistema di riconoscimento non può usare gli spazi bianchi per trovare i confini delle parole. Vocali e segni tonali stanno sopra, sotto e attorno alla consonante, così una scansione che ne perde uno cambia la parola in silenzio invece di corromperla in modo visibile — e c'è molto meno testo lao da cui imparare che per qualsiasi grande lingua.

2

Le pratiche si fotografano, non si scansionano

L'input reale è la foto col telefono di una pagina timbrata su una scrivania, di sbieco, in un ufficio con un solo tubo al neon. I benchmark su scansioni pulite non dicono nulla al riguardo.

3

La scrittura a mano è ancora l'interfaccia

Registri di villaggio, note d'ambulatorio, bolle di consegna, pagelle scolastiche, il libretto di famiglia. Nella scrittura lao a mano le lettere si legano e le parole si abbreviano in modi che l'addestramento su testo stampato non copre.

4

I numeri non sono i numeri

Cifre lao ໐–໙ accanto a quelle arabe, anni gregoriani sui documenti ufficiali e anni dell'era buddista, avanti di 543, nei registri dei templi, e importi in kip così alti che un separatore delle migliaia letto male li sposta di un fattore mille. Leggi male l'anno e ogni data del documento è sbagliata.


Quattro sensi, tre modelli

Rilasciati come modelli separati anziché come uno grande, perché così il router può mandare una foto al modello che legge e una registrazione al modello che ascolta, e nessuno dei due paga per i pesi dell'altro.

immagine · fotogramma video

LaoLLM-Vision

Foto, screenshot, grafici, scaffali, scene, moduli. Risponde in lao su ciò che c'è nell'inquadratura, indicando la regione che ha servito la risposta.

documento · scrittura a mano

LaoLLM-Scribe

Lo specialista dei documenti: pratiche lao timbrate, scansionate, storte, su più colonne e in parte scritte a mano, trasformate in campi strutturati che puoi inserire in un database.

audio in · audio out

LaoLLM-Voice

Riconoscimento e sintesi vocale del lao nelle varietà regionali, compreso il caso comune di una domanda posta da chi non ha il lao come prima lingua, con risposta in lao semplice.

tutto quanto sopra, insieme

Crossmodale

Quello che conta: una foto e una domanda a voce nella stessa richiesta, con la risposta basata sui tuoi documenti. È la capacità che i modelli separati esistono per rendere economica.


Diciotto cose che prima non si potevano fare

Ognuna è un lavoro che qualcuno in Laos oggi fa ribattendo ciò che ha davanti. A titolo illustrativo — descrivono capacità previste, non funzioni già rilasciate.

Governo e pubblica amministrazione

Fotografare una pagina del libretto di famiglia

Punta la fotocamera su un ປຶ້ມສຳມະໂນຄົວ e ottieni ogni campo come dati strutturati — nomi, numeri d'identità, villaggio, distretto, provincia — senza che un impiegato ne debba ribattere nemmeno uno alle quattro del pomeriggio.

Leggere un avviso della Gazzetta ufficiale da una foto

Una pagina scansionata della Gazzetta ufficiale diventa un riassunto in cui ogni obbligo rimanda all'articolo da cui proviene, e la data di entrata in vigore viene letta invece che indovinata.

Trasformare un verbale di villaggio scritto a mano in un documento

Fotografa la pagina che il segretario di un comitato ha davvero scritto e ottieni un verbale dattiloscritto in lao, in registro ufficiale, con i nomi scritti in modo coerente e le delibere numerate.

Controllare un modulo prima di mettersi in coda

Fotografa un modulo ministeriale compilato a metà e scopri quali caselle mancano, quale timbro è assente e per quale allegato l'ufficio ti rimanderà a casa.

Sanità

Spiegare ad alta voce l'etichetta di un farmaco

La foto di un'etichetta di farmacia — spesso stampata in una lingua diversa dal lao — diventa una spiegazione a voce, in lao semplice, della dose e degli orari, per un paziente che legge lentamente o che quella lingua non la legge affatto.

Rendere utilizzabile una lettera di dimissione

Fotografa la lettera di dimissione dell'ospedale e ottieni «cosa fare questa settimana» nella lingua parlata a casa, con la data del controllo inserita in un promemoria.

Agricoltura

Diagnosticare una foglia di riso da una foto

Mostra la lesione e scopri a cosa assomiglia, con cosa viene spesso confusa e quale ufficio agricolo distrettuale chiamare — con un rifiuto esplicito di prescrivere un prodotto chimico di cui il modello non può essere sicuro.

Leggere un sacco di fertilizzante e fare i conti

Fotografa il sacco, di' ad alta voce la superficie dell'appezzamento in ettari e ricevi la dose di miscela come risposta vocale, offline, in piedi nel campo.

Commercio e finanza

Trasformare una pila di scontrini in una tabella IVA

Fotografa la pila. Ottieni una tabella con fornitore, partita IVA, data, IVA e totale, che segnala i casi in cui uno scontrino non è una fattura IVA valida e non supererà una verifica.

Riconciliare una ricevuta di pagamento QR con una fattura

Lo screenshot di una ricevuta di bonifico da app bancaria o tramite QR nazionale, abbinato alla fattura che paga, con importo e causale verificati e la discrepanza indicata invece che ignorata in silenzio.

Contare uno scaffale

Fotografa lo scaffale e ottieni un elenco di prodotti in lao con facing e vuoti — il lavoro che oggi fa una persona con una cartellina percorrendo una corsia due volte.

Istruzione

Costruire una lezione da una pagina del libro

Fotografa la pagina e ottieni un piano di lezione collegato ai traguardi del curricolo nazionale, con i due traguardi che la pagina non copre indicati esplicitamente.

Correggere compiti scritti a mano in lao

Fotografa la pagina di uno studente e ottieni gli errori di ortografia, di vocali e di segni tonali segnalati con la regola che ciascuno viola — così correggere diventa insegnare, non dare un voto.

Turismo e servizi

Tradurre un menù senza perdere il piatto

Fotografa il menù. L'ospite ottiene la sua lingua e gli allergeni; il piatto mantiene il suo nome lao, perché ລາບ non è «insalata di carne» e un ristorante non dovrebbe essere costretto a fingere che lo sia.

Leggere un'iscrizione

Fotografa l'iscrizione di un tempio o un manoscritto su foglia di palma e ottieni una traslitterazione, una lettura in lao semplice e una nota onesta su quali caratteri sono troppo consumati per essere leggibili.

Industria e logistica

Inserire una bolla di consegna nel sistema

Fotografa la bolla alla baia di carico e fai arrivare i campi strutturati nel WMS — compresa la correzione a penna della quantità fatta da qualcuno.

Scrivere il rapporto d'incidente dal fotogramma

Il fermo immagine di una telecamera CCTV diventa una nota d'incidente descritta e con marca temporale, in lao, nel registro in cui il rapporto va archiviato, pronta per la firma di una persona.

Accessibilità

Descrivere la stanza

Punta la fotocamera e senti in lao ciò che hai davanti, al passo di chi cammina — la versione di questa tecnologia che non è affatto una funzione di produttività.


Come appare nell'API

Lo stesso endpoint. Un'immagine nell'array dei contenuti, e il router fa il resto — ed è proprio per questo che il routing è arrivato per primo.

POST /v1/messages
{
  "model": "auto",                     // the router picks
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
      { "type": "text",  "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
    ]
  }],
  "lao": { "register": "official", "dialect": "auto" }
}

// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
//   "region": "la-vte-1", "usage": { "kip": 42.60 } }

Roadmap

Quattro fasi. Nessuna è una data: ognuna si apre quando la sua batteria di valutazione viene superata, e la batteria è giudicata da parlanti lao, non da una classifica.

  1. 1
    Fase 1 · Visione documentale

    Documenti lao stampati e scansionati trasformati in campi strutturati. Cifre lao ed entrambi i calendari gestiti già in lettura, non rattoppati dopo.

    Barriera
  2. 2
    Fase 2 · Foto e scrittura a mano

    Foto col telefono scattate di sbieco, timbri, sigilli e scrittura lao a mano. È la fase che decide se il prodotto è utile fuori da un ufficio.

    Barriera
  3. 3
    Fase 3 · Voce, tutte le varietà

    Voce in ingresso e in uscita, valutata separatamente per ogni varietà regionale e per chi parla il lao come lingua seconda — perché una media complessiva nasconde proprio il fallimento che conta.

    Barriera
  4. 4
    Fase 4 · Crossmodale sul dispositivo

    Un modello di visione compresso che gira su un telefono Android di fascia media senza connessione, per il lavoro che si svolge dove non c'è segnale.

    Barriera

Riferimenti

Letture di approfondimento sui modelli multimodali, dalla documentazione primaria e dagli articoli su cui si fonda il campo. Link esterni, senza affiliazione con LaoGPT.

Programma di preversione

Scegli come entrare.

Tre gruppi sono aperti. Sceglierne uno prepara il modulo qui sotto — puoi cambiarlo lì.