멀티모달 · 로드맵 로드맵 — 아직 제공 전

무언가를 보여 줄 수 있는 라오어 모델.

중요한 라오어의 대부분은 키보드로 입력되지 않습니다. 도장이 찍히고, 사진으로 찍히고, 손으로 쓰이고, 인쇄된 뒤 다시 스캔되고, 지역 억양으로 또는 제2언어로 말해지고, 읽지 못하는 사람을 위해 소리 내어 읽힙니다. 텍스트만 다루는 모델은 그 어느 것에도 닿지 못합니다. 무엇이 달라지는지, 왜 라오어에 특히 필요한지, 그리고 대략 언제인지 소개합니다.

멀티모달 모델이란

텍스트 모델은 토큰을 읽습니다. 멀티모달 모델은 이미지, 음성, 동영상, 문서처럼 두 가지 이상의 입력을 받아, 텍스트와 같은 맥락 안에서 그것들에 대해 추론합니다. 흔한 구조는 모달리티별 인코더를 언어 모델에 연결하고 그 연결부를 학습시키는 것입니다. 그러면 이미지는 언어 모델이 프롬프트의 단어와 나란히 주의를 기울일 수 있는 대상이 됩니다.

실무에서 중요한 개념은 비전-언어 모델입니다. 이미지 인코더를 갖춘 언어 모델로, “내 스크린숏을 읽을 수 있나?” 같은 기능은 사실상 거의 모두 이것입니다. 짧은 정의로는 IBM의 것(텍스트, 이미지, 음성 등 여러 모달리티를 처리하고 이를 가로질러 추론할 수 있는 모델)이 있고, 시각 쪽은 NVIDIA 용어집이 간결합니다.

이 발상은 지금의 물결보다 오래되었습니다. CLIP은 2021년에 자연어를 지도 신호로 삼아 이미지와 텍스트를 하나의 공간에 학습시킬 수 있음을 보였습니다. Flamingo는 고정된 언어 모델이 몇 개의 예시만으로 이미지에 주의를 기울이도록 학습할 수 있음을 보였습니다. 시각 지시 튜닝은 그 결과를 대화할 수 있는 것으로 바꾸었습니다. 오늘 쓰이는 모든 것이 이 셋에서 이어져 왔습니다.

1차 자료 읽기

왜 라오어에는 영어보다 이것이 더 필요한가

같은 기능을 다른 언어로 내놓는 것이 아닙니다. 네 가지 점이 라오어 문서 인식을 별개의 기술 과제로 만들며, 네 가지 모두 범용 모델이 여기서 제 성능을 내지 못하는 이유이기도 합니다.

1

라오어 OCR은 해결되지 않았다

단어 사이에 띄어쓰기가 없어서 인식기가 공백으로 경계를 찾을 수 없습니다. 모음 기호와 성조 기호가 자음의 위, 아래, 주위에 붙기 때문에, 스캔에서 그중 하나를 잃으면 눈에 띄게 깨지는 대신 조용히 다른 단어로 바뀝니다. 게다가 학습할 수 있는 라오어 텍스트는 어떤 주요 언어보다도 훨씬 적습니다.

2

문서는 스캔하지 않고 사진으로 찍는다

실제 입력은 형광등 하나뿐인 사무실 책상 위에서 비스듬히 찍은, 도장 찍힌 페이지의 휴대전화 사진입니다. 깨끗한 스캔본으로 한 벤치마크는 이에 대해 아무것도 알려 주지 않습니다.

3

손글씨는 여전히 주요 인터페이스다

마을 대장, 진료소 기록, 납품서, 학교 성적표, 가족 등록부. 라오어 손글씨는 인쇄된 글자로 학습해서는 다룰 수 없는 방식으로 글자를 잇고 줄여 씁니다.

4

숫자가 그냥 숫자가 아니다

아라비아 숫자 옆의 라오 숫자 ໐–໙, 정부 문서의 서기 연도와 사원 기록의 543년 앞선 불기 연도, 천 단위 구분 기호 하나만 잘못 읽어도 수치가 천 배로 달라질 만큼 큰 킵 금액. 연도를 잘못 읽으면 문서의 모든 날짜가 틀립니다.


네 가지 감각, 세 가지 모델

하나의 큰 모델이 아니라 별도의 모델로 제공합니다. 그래야 라우터가 사진은 읽는 모델로, 녹음은 듣는 모델로 보낼 수 있고, 어느 쪽도 다른 모델의 가중치 비용을 내지 않습니다.

이미지 · 동영상 프레임

LaoLLM-Vision

사진, 스크린숏, 도표, 진열대, 장면, 양식. 화면 속에 무엇이 있는지 라오어로 답하고, 처리한 리전을 함께 표시합니다.

문서 · 손글씨

LaoLLM-Scribe

문서 전문가. 도장이 찍히고, 스캔되고, 비뚤어지고, 여러 단으로 되어 있고, 일부는 손으로 쓴 라오어 서류를 데이터베이스에 넣을 수 있는 구조화된 항목으로 바꿉니다.

음성 입력 · 음성 출력

LaoLLM-Voice

지역 변종 전반의 라오어 음성 인식과 음성 합성. 라오어가 모어가 아닌 사람이 한 질문에 쉬운 라오어로 답하는 흔한 경우도 포함합니다.

위의 모든 것을 함께

크로스모달

정말 중요한 것은 이것입니다. 사진 한 장과 말로 한 질문을 같은 요청에 담아, 자체 문서를 근거로 답합니다. 별도의 모델들은 바로 이 능력을 싸게 만들기 위해 존재합니다.


예전에는 할 수 없던 열여덟 가지

모두 오늘 라오스에서 누군가가 눈앞의 내용을 다시 입력하며 하고 있는 일입니다. 설명용 예시로, 목표로 하는 능력을 보여 줄 뿐 제공 중인 기능은 아닙니다.

정부·공공 부문

가족 등록부 한 쪽을 찍기

ປຶ້ມສຳມະໂນຄົວ에 카메라를 대면 이름, 신분증 번호, 마을, 군, 도까지 모든 항목이 구조화된 데이터로 돌아옵니다. 오후 4시에 직원이 그중 하나라도 다시 입력할 필요가 없습니다.

사진으로 관보 고시 읽기

스캔한 관보 한 쪽이 요약이 되고, 각 의무는 근거 조항까지 추적됩니다. 시행일은 짐작하지 않고 읽어 냅니다.

손으로 쓴 마을 회의록을 문서로 만들기

위원회 서기가 실제로 쓴 페이지를 찍으면, 공문 문체로 정서한 라오어 회의록이 나옵니다. 이름 표기는 통일되고 결의 사항에는 번호가 붙습니다.

줄 서기 전에 양식 확인하기

반쯤 작성한 부처 양식을 찍으면, 빠진 칸, 빠진 도장, 그리고 창구에서 돌려보내질 원인이 될 첨부 서류를 알려 줍니다.

보건 의료

약 라벨을 소리 내어 설명하기

라오어가 아닌 다른 언어로 인쇄된 경우가 많은 약국 라벨의 사진이, 용량과 복용 시간을 쉬운 라오어로 설명하는 음성이 됩니다. 읽는 속도가 느리거나 그 언어를 아예 읽지 못하는 환자를 위해서입니다.

퇴원 안내문을 쓸모 있게 만들기

병원 퇴원 요약서를 찍으면 집에서 쓰는 언어로 “이번 주에 할 일”을 알려 주고, 재진 날짜는 알림으로 등록해 둡니다.

농업

사진으로 벼 잎 진단하기

병든 부위를 보여 주면 무엇과 비슷한지, 무엇과 자주 혼동되는지, 어느 군 농업사무소에 전화해야 하는지 알려 줍니다. 확신할 수 없는 약제를 처방하는 것은 분명하게 거절합니다.

비료 포대를 읽고 양 계산하기

포대를 찍고 밭 넓이를 헥타르로 소리 내어 말하면, 배합 비율을 음성으로 돌려받습니다. 오프라인으로, 밭에 선 채로.

상업·금융

영수증 더미를 부가세 표로 만들기

더미를 찍으세요. 공급자, 납세자 번호, 날짜, 부가세, 합계가 담긴 표가 나오고, 유효한 세금계산서가 아니어서 감사를 통과하지 못할 영수증에는 표시가 붙습니다.

QR 결제 영수증을 청구서와 대조하기

은행 앱이나 국가 QR 이체 영수증의 스크린숏을 그것이 지불한 청구서와 맞대어 금액과 참조 번호를 확인합니다. 불일치는 조용히 넘기지 않고 분명히 짚어 줍니다.

진열대 세기

진열대를 찍으면 페이스 수와 빈자리를 포함한 라오어 상품 목록이 나옵니다. 지금은 클립보드를 든 사람이 통로를 두 번 걸으며 하는 일입니다.

교육

교과서 한 쪽으로 수업 짜기

그 쪽을 찍으면 국가 교육과정 목표에 연결된 수업 계획이 나오고, 그 쪽에서 다루지 않는 목표 두 가지도 분명히 적어 줍니다.

손으로 쓴 라오어 숙제 첨삭하기

학생이 쓴 페이지를 찍으면 철자, 모음 기호, 성조 기호 오류가 각각 어긴 규칙과 함께 표시됩니다. 점수만 매기는 것이 아니라 가르치는 첨삭이 됩니다.

관광·서비스

요리를 잃지 않고 메뉴 번역하기

메뉴를 찍으세요. 손님은 자기 언어와 알레르기 유발 성분 정보를 받고, 요리는 라오어 이름을 그대로 지킵니다. ລາບ은 “고기 샐러드”가 아니며, 식당이 그런 척할 필요도 없기 때문입니다.

비문 읽기

사원의 비문이나 패엽 필사본을 찍으면 음역, 쉬운 라오어로 옮긴 풀이, 그리고 어느 글자가 너무 닳아 읽을 수 없는지에 대한 솔직한 메모를 받습니다.

산업·물류

납품서를 시스템에 넣기

하역장에서 납품서를 찍고, 구조화된 항목이 WMS로 바로 들어가게 하세요. 누군가 볼펜으로 고쳐 쓴 수량까지 포함해서.

영상 한 장면으로 사고 보고서 쓰기

CCTV 정지 화면이 설명과 시각이 기록된 라오어 사건 기록이 됩니다. 보고서를 제출해야 하는 문체로 작성되며, 서명은 사람이 합니다.

접근성

방을 묘사하기

카메라를 대면 눈앞에 무엇이 있는지 걷는 속도에 맞춰 라오어로 들려줍니다. 이 기술 가운데 생산성 기능과는 전혀 상관없는 쓰임새입니다.


API에서는 이렇게 보입니다

같은 엔드포인트입니다. content 배열에 이미지 하나를 넣으면 나머지는 라우터가 처리합니다. 라우팅을 가장 먼저 내놓은 이유가 바로 이것입니다.

POST /v1/messages
{
  "model": "auto",                     // the router picks
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
      { "type": "text",  "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
    ]
  }],
  "lao": { "register": "official", "dialect": "auto" }
}

// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
//   "region": "la-vte-1", "usage": { "kip": 42.60 } }

로드맵

네 단계이며, 어느 것도 날짜가 아닙니다. 각 단계는 해당 평가 모음을 통과해야 열리고, 채점은 순위표가 아니라 라오어 화자가 합니다.

  1. 1
    1단계 · 문서 인식

    인쇄되거나 스캔된 라오어 문서를 구조화된 항목으로 변환. 라오 숫자와 두 역법은 읽는 시점에 처리하며, 나중에 덧대지 않습니다.

    관문
  2. 2
    2단계 · 사진과 손글씨

    비스듬히 찍은 휴대전화 사진, 도장, 관인, 라오어 손글씨. 제품이 사무실 밖에서도 쓸모 있는지를 가르는 단계입니다.

    관문
  3. 3
    3단계 · 음성, 모든 변종

    음성 입력과 출력을 지역 변종마다, 그리고 라오어를 제2언어로 쓰는 사람에 대해 따로 채점합니다. 전체를 뭉뚱그린 평균은 정작 중요한 실패를 가려 버리기 때문입니다.

    관문
  4. 4
    4단계 · 기기 내 크로스모달

    중급 안드로이드 휴대전화에서 오프라인으로 작동하는 압축된 비전 모델. 신호가 닿지 않는 곳에서 이루어지는 일을 위해.

    관문

참고 자료

1차 문서와 이 분야의 토대가 된 논문에서 가져온 멀티모달 모델 배경 자료입니다. 외부 링크이며 LaoGPT와 제휴 관계가 없습니다.

프리릴리스 프로그램

참여 방식을 고르세요.

세 개의 그룹이 열려 있습니다. 하나를 고르면 아래 양식이 설정됩니다 — 거기서 바꿀 수도 있습니다.