ຖ່າຍຮູບໜ້າປຶ້ມສຳມະໂນຄົວ
ສ່ອງກ້ອງໄປທີ່ປຶ້ມສຳມະໂນຄົວ ແລ້ວໄດ້ທຸກຊ່ອງຂໍ້ມູນກັບຄືນມາເປັນຂໍ້ມູນທີ່ມີໂຄງສ້າງ — ຊື່, ເລກບັດປະຈຳຕົວ, ບ້ານ, ເມືອງ, ແຂວງ — ໂດຍບໍ່ຕ້ອງມີເຈົ້າໜ້າທີ່ພິມຄືນແມ່ນແຕ່ຊ່ອງດຽວ ຕອນສີ່ໂມງແລງ.
ມັລຕິໂມດອລ · ແຜນງານ ແຜນງານ — ຍັງບໍ່ໄດ້ສົ່ງມອບ
ພາສາລາວສ່ວນໃຫຍ່ທີ່ສຳຄັນ ບໍ່ໄດ້ຖືກພິມດ້ວຍແປ້ນພິມ. ມັນຖືກປະທັບຕາ, ຖ່າຍຮູບ, ຂຽນດ້ວຍມື, ພິມອອກແລ້ວສະແກນຄືນ, ເວົ້າດ້ວຍສຳນຽງທ້ອງຖິ່ນ ຫຼື ເປັນພາສາທີສອງ, ຫຼື ອ່ານອອກສຽງໃຫ້ຄົນທີ່ອ່ານເອງບໍ່ໄດ້ຟັງ. ໂມເດວທີ່ຮັບໄດ້ແຕ່ຂໍ້ຄວາມ ເຂົ້າບໍ່ເຖິງສິ່ງເຫຼົ່ານັ້ນເລີຍ. ນີ້ແມ່ນສິ່ງທີ່ຈະປ່ຽນໄປ, ເປັນຫຍັງພາສາລາວໂດຍສະເພາະຈຶ່ງຕ້ອງການມັນ ແລະ ປະມານເມື່ອໃດ.
ໂມເດວມັລຕິໂມດອລແມ່ນຫຍັງ
ໂມເດວຂໍ້ຄວາມອ່ານໂທເຄັນ. ໂມເດວມັລຕິໂມດອລ ຮັບຂໍ້ມູນເຂົ້າຫຼາຍກວ່າໜຶ່ງປະເພດ — ຮູບ, ສຽງ, ວິດີໂອ, ເອກະສານ — ແລະ ໃຊ້ເຫດຜົນກັບພວກມັນໃນບໍລິບົດດຽວກັບຂໍ້ຄວາມ. ໂຄງສ້າງທີ່ນິຍົມ ເຊື່ອມຕົວເຂົ້າລະຫັດ (encoder) ສຳລັບແຕ່ລະຮູບແບບຂໍ້ມູນເຂົ້າກັບໂມເດວພາສາ ແລະ ຝຶກສ່ວນເຊື່ອມນັ້ນ ເພື່ອໃຫ້ຮູບກາຍເປັນສິ່ງທີ່ໂມເດວພາສາເອົາໃຈໃສ່ໄດ້ ຄຽງຄູ່ກັບຄຳໃນ prompt.
ຄຳທີ່ສຳຄັນໃນທາງປະຕິບັດ ແມ່ນໂມເດວພາບ-ພາສາ (vision-language model): ໂມເດວພາສາທີ່ມີຕົວເຂົ້າລະຫັດຮູບ ເຊິ່ງເປັນສິ່ງທີ່ເກືອບທຸກຄວາມສາມາດແບບ “ມັນອ່ານພາບໜ້າຈໍຂອງຂ້ອຍໄດ້ບໍ່” ເປັນແທ້. ຄຳນິຍາມຂອງ IBM ແມ່ນສະບັບສັ້ນ — ໂມເດວທີ່ປະມວນຜົນ ແລະ ໃຊ້ເຫດຜົນຂ້າມຫຼາຍຮູບແບບຂໍ້ມູນ ເຊັ່ນ ຂໍ້ຄວາມ, ຮູບ ແລະ ສຽງ — ແລະ ອະພິທານສັບຂອງ NVIDIA ແມ່ນສະບັບສັ້ນສຳລັບເຄິ່ງດ້ານພາບ.
ແນວຄິດນີ້ເກົ່າກວ່າກະແສປັດຈຸບັນ. CLIP ສະແດງໃນປີ 2021 ວ່າ ຮູບ ແລະ ຂໍ້ຄວາມ ສາມາດຝຶກເຂົ້າໃນພື້ນທີ່ຮ່ວມກັນໄດ້ ໂດຍໃຊ້ພາສາທຳມະຊາດເປັນຕົວກຳກັບ; Flamingo ສະແດງວ່າ ໂມເດວພາສາທີ່ຖືກແຊ່ແຂງໄວ້ ສາມາດຮຽນຮູ້ການເອົາໃຈໃສ່ຮູບຈາກຕົວຢ່າງພຽງບໍ່ເທົ່າໃດ; ການປັບແຕ່ງດ້ວຍຄຳສັ່ງທາງພາບ ເຮັດໃຫ້ຜົນລັບກາຍເປັນສິ່ງທີ່ລົມນຳໄດ້. ທຸກຢ່າງທີ່ໃຊ້ງານຢູ່ມື້ນີ້ ສືບເຊື້ອສາຍມາຈາກສາມງານນີ້.
ອ່ານແຫຼ່ງຂໍ້ມູນຕົ້ນສະບັບເປັນຫຍັງພາສາລາວຈຶ່ງຕ້ອງການສິ່ງນີ້ຫຼາຍກວ່າພາສາອັງກິດ
ນີ້ບໍ່ແມ່ນຄຸນສົມບັດດຽວກັນໃນອີກພາສາໜຶ່ງ. ມີສີ່ຢ່າງທີ່ເຮັດໃຫ້ການອ່ານເອກະສານພາສາລາວດ້ວຍພາບ ເປັນບັນຫາດ້ານວິສະວະກຳສະເພາະ ແລະ ທັງສີ່ຢ່າງ ລ້ວນເປັນເຫດຜົນທີ່ໂມເດວທົ່ວໄປເຮັດໄດ້ບໍ່ດີ.
ບໍ່ມີການເວັ້ນວັກລະຫວ່າງຄຳ ລະບົບຈຳແນກຕົວອັກສອນຈຶ່ງໃຊ້ຊ່ອງຫວ່າງຊອກຫາຂອບເຂດຄຳບໍ່ໄດ້. ສະຫຼະ ແລະ ວັນນະຍຸດ ວາງຢູ່ເທິງ, ລຸ່ມ ແລະ ອ້ອມພະຍັນຊະນະ ດັ່ງນັ້ນການສະແກນທີ່ເຮັດໃຫ້ໜຶ່ງໃນນັ້ນຫາຍໄປ ຈະປ່ຽນຄຳໄປຢ່າງງຽບໆ ແທນທີ່ຈະເຮັດໃຫ້ມັນເສຍຫາຍຈົນເຫັນໄດ້ຊັດ — ແລະ ຂໍ້ຄວາມພາສາລາວທີ່ມີໃຫ້ຮຽນຮູ້ ມີໜ້ອຍກວ່າພາສາຫຼັກໃດໆຫຼາຍ.
ຂໍ້ມູນເຂົ້າແທ້ ແມ່ນຮູບຖ່າຍຈາກມືຖືຂອງໜ້າທີ່ປະທັບຕາເທິງໂຕະ, ອຽງ, ໃນຫ້ອງການທີ່ມີຫຼອດໄຟນີອອນດອກດຽວ. ການທົດສອບມາດຕະຖານດ້ວຍເອກະສານສະແກນທີ່ສະອາດ ບໍ່ໄດ້ບອກຫຍັງກ່ຽວກັບສິ່ງນັ້ນເລີຍ.
ທະບຽນຂອງບ້ານ, ບັນທຶກຂອງສຸກສາລາ, ໃບສົ່ງເຄື່ອງ, ໃບຄະແນນຂອງໂຮງຮຽນ, ປຶ້ມສຳມະໂນຄົວ. ລາຍມືລາວ ຂຽນຕໍ່ກັນ ແລະ ຫຍໍ້ຄຳ ໃນແບບທີ່ການຝຶກດ້ວຍຕົວພິມ ບໍ່ໄດ້ກວມເອົາ.
ຕົວເລກລາວ ໐–໙ ຄຽງຂ້າງຕົວເລກອາຣັບ, ປີຄິດສະຕະສັກກະລາດໃນເອກະສານລັດຖະການ ແລະ ປີພຸດທະສັກກະລາດ ທີ່ນຳໜ້າ 543 ປີ ໃນບັນທຶກຂອງວັດ, ແລະ ຈຳນວນເງິນກີບທີ່ໃຫຍ່ພໍ ຈົນການອ່ານເຄື່ອງໝາຍຂັ້ນຫຼັກພັນຜິດ ຈະເຮັດໃຫ້ຕົວເລກຜິດໄປພັນເທົ່າ. ອ່ານປີຜິດ ແລ້ວທຸກວັນທີໃນເອກະສານກໍຜິດໝົດ.
ສີ່ປະສາດສຳຜັດ, ສາມໂມເດວ
ສົ່ງມອບເປັນໂມເດວແຍກກັນ ແທນທີ່ຈະເປັນໂມເດວໃຫຍ່ຕົວດຽວ ເພາະເມື່ອນັ້ນເຣົາເຕີສາມາດສົ່ງຮູບໄປຫາໂມເດວທີ່ອ່ານ ແລະ ສຽງບັນທຶກໄປຫາໂມເດວທີ່ຟັງ — ແລະ ບໍ່ມີຕົວໃດຕ້ອງຈ່າຍຄ່ານ້ຳໜັກ (weights) ຂອງອີກຕົວ.
ຮູບຖ່າຍ, ພາບໜ້າຈໍ, ແຜນພູມ, ຊັ້ນວາງສິນຄ້າ, ສາກທົ່ວໄປ, ແບບຟອມ. ຕອບເປັນພາສາລາວ ກ່ຽວກັບສິ່ງທີ່ຢູ່ໃນພາບ ພ້ອມບອກພາກພື້ນທີ່ໃຫ້ບໍລິການ.
ຜູ້ຊ່ຽວຊານດ້ານເອກະສານ: ປ່ຽນເອກະສານພາສາລາວທີ່ປະທັບຕາ, ສະແກນ, ອຽງ, ມີຫຼາຍຖັນ ແລະ ຂຽນດ້ວຍມືບາງສ່ວນ ໃຫ້ເປັນຊ່ອງຂໍ້ມູນທີ່ມີໂຄງສ້າງ ທີ່ທ່ານນຳເຂົ້າຖານຂໍ້ມູນໄດ້.
ການຮັບຮູ້ ແລະ ສັງເຄາະສຽງເວົ້າພາສາລາວ ໃນທຸກພາສາຖິ່ນ ລວມທັງກໍລະນີທີ່ພົບເລື້ອຍ ເມື່ອຄຳຖາມມາຈາກຄົນທີ່ພາສາແມ່ບໍ່ແມ່ນພາສາລາວ ແລະ ຕ້ອງຕອບເປັນພາສາລາວທີ່ເຂົ້າໃຈງ່າຍ.
ອັນທີ່ສຳຄັນແທ້: ຮູບໜຶ່ງໃບ ແລະ ຄຳຖາມທີ່ເວົ້າອອກສຽງ ໃນຄຳຮ້ອງດຽວກັນ ຕອບໂດຍອີງໃສ່ເອກະສານຂອງທ່ານເອງ. ນັ້ນແມ່ນຄວາມສາມາດທີ່ໂມເດວແຍກກັນມີໄວ້ ເພື່ອເຮັດໃຫ້ມັນລາຄາຖືກ.
ສິບແປດຢ່າງທີ່ເມື່ອກ່ອນເຮັດບໍ່ໄດ້
ແຕ່ລະຢ່າງແມ່ນວຽກທີ່ມື້ນີ້ມີຄົນໃນປະເທດລາວເຮັດ ດ້ວຍການພິມສິ່ງທີ່ຢູ່ຕໍ່ໜ້າຄືນໃໝ່. ເປັນພຽງຕົວຢ່າງ — ອະທິບາຍຄວາມສາມາດທີ່ຕັ້ງໃຈໄວ້ ບໍ່ແມ່ນຄຸນສົມບັດທີ່ສົ່ງມອບແລ້ວ.
ສ່ອງກ້ອງໄປທີ່ປຶ້ມສຳມະໂນຄົວ ແລ້ວໄດ້ທຸກຊ່ອງຂໍ້ມູນກັບຄືນມາເປັນຂໍ້ມູນທີ່ມີໂຄງສ້າງ — ຊື່, ເລກບັດປະຈຳຕົວ, ບ້ານ, ເມືອງ, ແຂວງ — ໂດຍບໍ່ຕ້ອງມີເຈົ້າໜ້າທີ່ພິມຄືນແມ່ນແຕ່ຊ່ອງດຽວ ຕອນສີ່ໂມງແລງ.
ໜ້າຈົດໝາຍເຫດທາງລັດຖະການທີ່ສະແກນ ກາຍເປັນບົດສະຫຼຸບ ທີ່ທຸກພັນທະກວດຄືນໄດ້ເຖິງມາດຕາທີ່ມັນມາ ແລະ ວັນທີມີຜົນສັກສິດ ຖືກອ່ານອອກມາແທ້ ບໍ່ແມ່ນເດົາເອົາ.
ຖ່າຍຮູບໜ້າທີ່ເລຂານຸການຄະນະກຳມະການຂຽນແທ້ ແລ້ວໄດ້ບົດບັນທຶກກອງປະຊຸມພາສາລາວທີ່ພິມແລ້ວ ໃນລະດັບພາສາທາງການ ໂດຍສະກົດຊື່ຄົນແບບດຽວກັນທຸກບ່ອນ ແລະ ມີເລກລຳດັບມະຕິ.
ຖ່າຍຮູບແບບຟອມຂອງກະຊວງທີ່ຕື່ມໄປເຄິ່ງໜຶ່ງ ແລ້ວຮູ້ວ່າຊ່ອງໃດຍັງຂາດ, ຕາປະທັບໃດຍັງບໍ່ມີ ແລະ ເອກະສານຄັດຕິດໃດທີ່ຫ້ອງການຈະສົ່ງທ່ານກັບບ້ານ.
ຮູບຖ່າຍປ້າຍຢາຈາກຮ້ານຂາຍຢາ — ທີ່ມັກພິມເປັນພາສາອື່ນທີ່ບໍ່ແມ່ນພາສາລາວ — ກາຍເປັນຄຳອະທິບາຍດ້ວຍສຽງ ເປັນພາສາລາວທີ່ເຂົ້າໃຈງ່າຍ ກ່ຽວກັບປະລິມານ ແລະ ເວລາກິນຢາ ສຳລັບຄົນເຈັບທີ່ອ່ານຊ້າ ຫຼື ອ່ານພາສານັ້ນບໍ່ໄດ້ເລີຍ.
ຖ່າຍຮູບບົດສະຫຼຸບການອອກໂຮງໝໍ ແລ້ວໄດ້ “ສິ່ງທີ່ຕ້ອງເຮັດອາທິດນີ້” ເປັນພາສາທີ່ເວົ້າຢູ່ເຮືອນ ໂດຍໃສ່ວັນນັດກວດຄືນໄວ້ໃນການແຈ້ງເຕືອນ.
ສະແດງຈຸດທີ່ເປັນພະຍາດໃຫ້ເບິ່ງ ແລ້ວຮູ້ວ່າມັນຄ້າຍກັບຫຍັງ, ມັກຖືກສັບສົນກັບຫຍັງ ແລະ ຄວນໂທຫາຫ້ອງການກະສິກຳເມືອງໃດ — ພ້ອມກັບການປະຕິເສດຢ່າງຊັດເຈນ ທີ່ຈະແນະນຳສານເຄມີທີ່ມັນບໍ່ແນ່ໃຈ.
ຖ່າຍຮູບຖົງ, ບອກເນື້ອທີ່ດິນອອກສຽງເປັນເຮັກຕາ ແລ້ວໄດ້ອັດຕາການປະສົມກັບຄືນມາເປັນຄຳຕອບດ້ວຍສຽງ ແບບອອບໄລນ໌ ໃນຂະນະທີ່ຢືນຢູ່ກາງທົ່ງ.
ຖ່າຍຮູບກອງໃບບິນ. ໄດ້ຕາຕະລາງທີ່ມີຜູ້ຂາຍ, ເລກປະຈຳຕົວຜູ້ເສຍອາກອນ, ວັນທີ, ອາກອນມູນຄ່າເພີ່ມ ແລະ ຍອດລວມ ພ້ອມໝາຍບ່ອນທີ່ໃບບິນບໍ່ແມ່ນໃບເກັບເງິນອາກອນມູນຄ່າເພີ່ມທີ່ຖືກຕ້ອງ ແລະ ຈະບໍ່ຜ່ານການກວດສອບ.
ພາບໜ້າຈໍໃບໂອນເງິນຈາກແອັບທະນາຄານ ຫຼື QR ແຫ່ງຊາດ ຖືກຈັບຄູ່ກັບໃບແຈ້ງໜີ້ທີ່ມັນຈ່າຍ ໂດຍກວດຈຳນວນເງິນ ແລະ ເລກອ້າງອີງ ແລະ ບອກຈຸດທີ່ບໍ່ກົງກັນອອກມາ ແທນທີ່ຈະປ່ອຍຜ່ານຢ່າງງຽບໆ.
ຖ່າຍຮູບຊັ້ນວາງ ແລ້ວໄດ້ລາຍການສິນຄ້າເປັນພາສາລາວ ພ້ອມຈຳນວນໜ້າສິນຄ້າ ແລະ ບ່ອນທີ່ວ່າງ — ວຽກທີ່ມື້ນີ້ ຕ້ອງມີຄົນຖືກະດານບັນທຶກ ຍ່າງຜ່ານລ່ອງຊັ້ນວາງສອງເທື່ອ.
ຖ່າຍຮູບໜ້ານັ້ນ ແລ້ວໄດ້ແຜນການສອນທີ່ຕິດພັນກັບເປົ້າໝາຍຂອງຫຼັກສູດແຫ່ງຊາດ ພ້ອມບອກຊັດເຈນເຖິງສອງເປົ້າໝາຍທີ່ໜ້ານັ້ນບໍ່ໄດ້ກວມເອົາ.
ຖ່າຍຮູບໜ້າຂອງນັກຮຽນ ແລ້ວໄດ້ຄວາມຜິດດ້ານການສະກົດຄຳ, ສະຫຼະ ແລະ ວັນນະຍຸດ ທີ່ຖືກໝາຍໄວ້ ພ້ອມກົດທີ່ແຕ່ລະຈຸດລະເມີດ — ເພື່ອໃຫ້ການກວດເປັນການສອນ ບໍ່ແມ່ນພຽງການໃຫ້ຄະແນນ.
ຖ່າຍຮູບເມນູ. ແຂກໄດ້ພາສາຂອງຕົນ ແລະ ຂໍ້ມູນສານກໍ່ພູມແພ້; ອາຫານຍັງຄົງຊື່ພາສາລາວ ເພາະ ລາບ ບໍ່ແມ່ນ “ສະຫຼັດຊີ້ນ” ແລະ ຮ້ານອາຫານບໍ່ຄວນຕ້ອງທຳທ່າວ່າມັນແມ່ນ.
ຖ່າຍຮູບຈາລຶກໃນວັດ ຫຼື ໃບລານ ແລ້ວໄດ້ການຖອດອັກສອນ, ຄຳອ່ານເປັນພາສາລາວທີ່ເຂົ້າໃຈງ່າຍ ແລະ ໝາຍເຫດຢ່າງຊື່ສັດ ວ່າຕົວອັກສອນໃດສຶກຫຼໍ່ຈົນອ່ານບໍ່ອອກແລ້ວ.
ຖ່າຍຮູບໃບສົ່ງເຄື່ອງທີ່ບ່ອນຂຶ້ນລົງສິນຄ້າ ແລ້ວປ່ອຍໃຫ້ຊ່ອງຂໍ້ມູນທີ່ມີໂຄງສ້າງເຂົ້າໄປໃນ WMS — ລວມທັງການແກ້ຈຳນວນທີ່ມີຄົນຂຽນດ້ວຍບິກ.
ພາບນິ່ງຈາກກ້ອງ CCTV ກາຍເປັນບັນທຶກເຫດການພາສາລາວ ທີ່ມີຄຳບັນຍາຍ ແລະ ເວລາກຳກັບ ໃນລະດັບພາສາທີ່ລາຍງານຕ້ອງຍື່ນ ເພື່ອໃຫ້ຄົນເຊັນ.
ສ່ອງກ້ອງ ແລ້ວຟັງເປັນພາສາລາວວ່າມີຫຍັງຢູ່ຕໍ່ໜ້າທ່ານ ທັນຕາມຈັງຫວະການຍ່າງ — ເປັນເຕັກໂນໂລຊີນີ້ໃນແບບທີ່ບໍ່ແມ່ນຄຸນສົມບັດເພີ່ມປະສິດທິພາບການເຮັດວຽກເລີຍ.
ໜ້າຕາໃນ API
endpoint ດຽວກັນ. ຮູບໜຶ່ງໃບໃນ array content ແລ້ວເຣົາເຕີຈັດການສ່ວນທີ່ເຫຼືອ — ນັ້ນແຫຼະຄືເຫດຜົນທັງໝົດທີ່ການຈັດເສັ້ນທາງຖືກສົ່ງມອບກ່ອນ.
POST /v1/messages
{
"model": "auto", // the router picks
"messages": [{
"role": "user",
"content": [
{ "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
{ "type": "text", "text": "ແບບຟອມນີ້ຍັງຂາດຊ່ອງໃດແດ່" }
]
}],
"lao": { "register": "official", "dialect": "auto" }
}
// 200 OK
// { "routed_to": "LaoLLM-Vision", "then": "LaoLLM-Base",
// "region": "la-vte-1", "usage": { "kip": 42.60 } }ແຜນງານ
ສີ່ໄລຍະ. ບໍ່ມີອັນໃດເປັນວັນທີ: ແຕ່ລະໄລຍະຈະເປີດເມື່ອຊຸດປະເມີນຂອງມັນຜ່ານ ແລະ ຊຸດປະເມີນນັ້ນໃຫ້ຄະແນນໂດຍຄົນລາວ ບໍ່ແມ່ນໂດຍຕາຕະລາງຈັດອັນດັບ.
ເອກະສານພາສາລາວທີ່ພິມ ແລະ ສະແກນ ຖືກປ່ຽນເປັນຊ່ອງຂໍ້ມູນທີ່ມີໂຄງສ້າງ. ຕົວເລກລາວ ແລະ ທັງສອງປະຕິທິນ ຖືກຈັດການຕັ້ງແຕ່ຕອນອ່ານ ບໍ່ແມ່ນມາແກ້ໄຂພາຍຫຼັງ.
ປະຕູຮູບຖ່າຍຈາກມືຖືທີ່ຖ່າຍອຽງ, ຕາປະທັບ, ກາປະທັບ ແລະ ລາຍມືລາວ. ນີ້ແມ່ນໄລຍະທີ່ຕັດສິນວ່າຜະລິດຕະພັນໃຊ້ໄດ້ຢູ່ນອກຫ້ອງການຫຼືບໍ່.
ປະຕູສຽງເຂົ້າ ແລະ ສຽງອອກ ໃຫ້ຄະແນນແຍກກັນສຳລັບແຕ່ລະພາສາຖິ່ນ ແລະ ສຳລັບຄົນທີ່ເວົ້າພາສາລາວເປັນພາສາທີສອງ — ເພາະຄ່າສະເລ່ຍລວມ ຈະປິດບັງຄວາມລົ້ມເຫຼວທີ່ສຳຄັນນັ້ນພໍດີ.
ປະຕູໂມເດວພາບທີ່ບີບອັດ ທີ່ເຮັດວຽກແບບອອບໄລນ໌ເທິງມືຖື Android ລະດັບກາງ ສຳລັບວຽກທີ່ເກີດຂຶ້ນໃນບ່ອນທີ່ບໍ່ມີສັນຍານ.
ປະຕູເອກະສານອ້າງອີງ
ເອກະສານອ່ານປະກອບກ່ຽວກັບໂມເດວມັລຕິໂມດອລ ຈາກເອກະສານຕົ້ນສະບັບ ແລະ ບົດຄົ້ນຄວ້າທີ່ເປັນພື້ນຖານຂອງວົງການນີ້. ເປັນລິ້ງພາຍນອກ ບໍ່ມີສ່ວນກ່ຽວຂ້ອງກັບ LaoGPT.
ຄຳນິຍາມສັ້ນທີ່ຊັດເຈນທີ່ສຸດຂອງໂມເດວພາສາຂະໜາດໃຫຍ່ແບບມັລຕິໂມດອລ ແລະ ໃຊ້ເຮັດຫຍັງ.
NVIDIAWhat are vision-language models? — NVIDIA glossaryຕົວເຂົ້າລະຫັດຮູບ ເຊື່ອມກັບໂມເດວພາສາແນວໃດ ເພື່ອໃຫ້ມັນເບິ່ງເຫັນ.
WikipediaVision-language model — Wikipediaພາບລວມທີ່ເປັນກາງ ພ້ອມລາຍການອ້າງອີງກວ້າງຂວາງ ຖ້າທ່ານຢາກເຫັນຮູບຮ່າງຂອງວົງການກ່ອນລາຍລະອຽດ.
AnthropicVision — Claude API documentationເອກະສານພາກປະຕິບັດສຳລັບການສົ່ງຮູບໃຫ້ໂມເດວ ແລະ ຂໍ້ຈຳກັດພາກປະຕິບັດຂອງການເຮັດແນວນັ້ນ.
GoogleImage understanding — Gemini API documentationAPI ທີ່ເປັນມັລຕິໂມດອລມາແຕ່ພື້ນຖານ ລວມທັງຮັບເອກະສານ ແລະ ວິດີໂອເປັນຂໍ້ມູນເຂົ້າ.
OpenAIImages and vision — OpenAI platform documentationAPI ຮູບອີກອັນທີ່ໃຊ້ກັນຢ່າງກວ້າງຂວາງ ເພື່ອປຽບທຽບຮູບແບບຄຳຮ້ອງ.
Hugging FaceImage-text-to-text — Hugging Faceຝັ່ງໂມເດວເປີດ: ຄຳນິຍາມຂອງວຽກ ແລະ ໂມເດວທີ່ທ່ານແລ່ນເອງໄດ້.
arXiv 2103.00020Learning Transferable Visual Models From Natural Language SupervisionCLIP, 2021 — ຮູບ ແລະ ຂໍ້ຄວາມ ຝຶກເຂົ້າໃນຕົວແທນຮ່ວມກັນ. ບົດຄົ້ນຄວ້າທີ່ວົງການສະໄໝໃໝ່ເລີ່ມຕົ້ນຈາກ.
arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learning2022 — ວິທີສອນໂມເດວພາສາທີ່ຖືກແຊ່ແຂງ ໃຫ້ເອົາໃຈໃສ່ຮູບ.
arXiv 2304.08485Visual Instruction Tuning2023 — LLaVA ແລະ ບາດກ້າວທີ່ເຮັດໃຫ້ໂມເດວພາບ-ພາສາ ລົມນຳໄດ້.
ໂຄງການກ່ອນເປີດຕົວ
ເປີດຮັບສາມກຸ່ມ. ເລືອກກຸ່ມໜຶ່ງແລ້ວ ແບບຟອມຂ້າງລຸ່ມຈະຖືກຕັ້ງໃຫ້ — ປ່ຽນໄດ້ຢູ່ບ່ອນນັ້ນ.
ເປີດລົງທະບຽນລ່ວງໜ້າ
ສາມຊ່ອງ. ບອກພວກເຮົາວ່າທ່ານແມ່ນໃຜ ແລະ ຈະຕິດຕໍ່ໄປໃສ ແລ້ວພວກເຮົາຈະສົ່ງອີເມວເມື່ອຄຳເຊີນຂອງທ່ານພ້ອມ.
ໃຊ້ໄດ້ເທິງ 3G · ພາສາລາວ / English