Định tuyến thông minh
Mô hình rẻ nhất vẫn vượt ngưỡng yêu cầu.
Bộ định tuyến là khác biệt giữa một nền tảng AI và một hóa đơn AI. LaoGPT phân loại từng yêu cầu, chấm điểm nó theo những gì mỗi mô hình trong họ thực sự làm được, rồi gửi tới mô hình nhỏ nhất sẽ làm đúng — sau đó kiểm tra câu trả lời và leo thang nếu chưa đúng. Trang này trình bày quyết định đó được đưa ra thế nào, và bạn được phép ép buộc điều gì.
Bốn quyết định, trước khi một token được sinh ra
Mô hình nào
Lite để viết lại, Base cho phần lớn, Pro khi ngữ cảnh không vừa, Vision khi có hình ảnh, Voice khi có âm thanh, Reason khi con người phải kiểm toán chuỗi lập luận.
Chạy ở đâu
Trên máy nếu máy kham nổi, trong nước nếu không, và không ở đâu cả nếu không gian làm việc đã khóa một vùng mà yêu cầu sẽ rời khỏi.
Chi phí bao nhiêu
Bộ định tuyến biết giá của từng mô hình bằng kíp và số dư còn lại trong tài khoản. Một yêu cầu rẻ không bị gửi tới mô hình đắt chỉ để cho chắc.
Có leo thang không
Câu trả lời đầu tiên được kiểm tra so với yêu cầu. Kiểm tra thất bại sẽ định tuyến lên cấp cao hơn và nói rõ trong phản hồi — bạn thấy điều đó đã xảy ra và tốn bao nhiêu.
Nó đọc những gì
Tám tín hiệu, và không tín hiệu nào đòi bạn phải mô tả yêu cầu của mình. Cả tám đều hiển thị trong phản hồi, nên quyết định định tuyến là thứ bạn có thể tranh luận, chứ không phải thứ cứ thế xảy đến với bạn.
Loại tác vụ
Viết, tóm tắt, dịch, trích xuất, phân loại, suy luận. Được suy ra và có thể ghi đè.
Chữ viết và phương ngữ
Tiếng Lào Viêng Chăn, miền Bắc hoặc miền Nam, tiếng Lào trộn tiếng Thái hoặc tiếng Anh, hoặc tiếng Lào gõ bằng chữ Latinh.
Phương thức
Văn bản, hình ảnh, PDF quét, âm thanh. Một hình ảnh trong yêu cầu loại trừ mọi mô hình chỉ xử lý văn bản.
Độ dài ngữ cảnh
Đo bằng bộ tách token tiếng Lào, không ước lượng từ số ký tự — vốn là chỗ các nền tảng nước ngoài tính sai.
Độ nhạy cảm
Số thẻ căn cước Lào, một mục trong sổ hộ khẩu, hồ sơ bệnh nhân, mã số thuế. Được phát hiện ngay trên máy; nó khóa tuyến trước khi yêu cầu được gửi đi bất cứ đâu.
Kết nối
Ngoại tuyến, tiết kiệm dữ liệu hoặc đầy đủ. Bộ định tuyến hạ mô hình, không hạ câu trả lời.
Ngân sách
Số dư kíp trả trước còn lại, và mức trần cho mỗi yêu cầu mà tài khoản đã đặt.
Yêu cầu độ trễ
Câu trả lời bằng giọng nói cần token đầu tiên trong vòng một giây. Một tác vụ xử lý hàng loạt ban đêm thì không.
Bảng định tuyến
Minh họa. Bảng thực tế được cung cấp từ nền tảng và thay đổi khi có thêm mô hình — đó chính là lý do không nên ghi cứng tên mô hình trong máy khách của bạn.
Tuyến đường nó được phép từ chối
Mọi lớp định tuyến khác đều tối ưu cho chi phí và độ trễ. Lớp này có trục thứ ba, và đó là thứ một cơ quan thực sự bỏ tiền mua: không gian làm việc có thể tuyên bố rằng các yêu cầu của mình không bao giờ rời khỏi la-vte-1, và bộ định tuyến sẽ trả về lỗi thay vì lặng lẽ tìm một mô hình ở nơi khác. Từ chối là một tính năng. Đó cũng là hình thức duy nhất của việc giữ nơi đặt dữ liệu còn đứng vững khi gặp một bộ định tuyến.
409 route_forbidden · workspace pinned to la-vte-1Thang leo thang
Việc leo thang được hiển thị và tính phí theo chi phí thực tế, không theo giá của mô hình lớn nhất. Nếu bộ định tuyến sai, bạn có thể thấy nó đã sai.
Mỗi bậc chỉ được dùng nếu câu trả lời trước đó không vượt qua bước kiểm tra của chính nó.
Và bạn luôn có thể ghi đè nó
Chỉ định tên mô hình và bộ định tuyến sẽ đứng sang một bên. Chỉ định một chính sách và nó sẽ tuân theo chính sách đó. Định tuyến là mặc định, không phải cái lồng — và mặc định ấy được thiết kế để gần như không ai cần phải đổi.
POST /v1/messages
{
"model": "auto", // default: the router decides
"route": {
"region": "la-vte-1", // refuse rather than leave
"max_kip": 75, // per-request ceiling
"prefer": "cheapest_passing" // or "fastest" | "best"
}
}
// The decision comes back with the answer, every time:
// { "routed_to": "LaoLLM-Base", "considered": ["Lite", "Base", "Pro"],
// "reason": "context 4.1k > Lite 8k window at 0.62 confidence",
// "escalated": false, "region": "la-vte-1", "usage": { "kip": 11.40 } }Tài liệu tham khảo
Tài liệu đọc thêm về mô hình đa phương thức, từ tài liệu gốc và các bài báo làm nền tảng cho lĩnh vực này. Liên kết bên ngoài, không có quan hệ với LaoGPT.
2024 — định tuyến giữa một mô hình mạnh và một mô hình yếu, và tiết kiệm được bao nhiêu.
arXiv 1701.06538Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer2017 — định tuyến bên trong mô hình thay vì phía trước nó; tổ tiên của ý tưởng.
CloudflareAI Gateway — Cloudflare documentationTài liệu thực hành về việc đặt một lớp định tuyến và bộ nhớ đệm phía trước các mô hình.
IBMWhat is a multimodal LLM? — IBMĐịnh nghĩa ngắn gọn rõ ràng nhất về mô hình ngôn ngữ lớn đa phương thức và công dụng của nó.
Chương trình tiền phát hành
Chọn cách bạn tham gia.
Ba nhóm đang mở. Chọn một nhóm sẽ thiết lập biểu mẫu bên dưới — bạn có thể đổi ở đó.
Bản tiền phát hành · đang mở đăng ký
Tham gia bản tiền phát hành.
Ba trường. Cho chúng tôi biết bạn là ai và liên hệ ở đâu, chúng tôi sẽ gửi email khi lời mời sẵn sàng.
- Ba trường, không cần tra cứu gì
- Hai mục đồng thuận, tách biệt, không mục nào tick sẵn
- Nhận vị trí hàng đợi ngay lập tức
Chạy được trên 3G · ພາສາລາວ / English