Originally published on NextFuture
Bạn đang chọn embedding model cho hệ retrieval và mặc định lấy đúng vector size mà model xuất ra. WeMM-Embedding vừa cho một con số khiến quyết định đó đáng xem lại: ở 256 chiều, tác vụ ảnh và video giữ được 98,7% hiệu năng của bản 2048 chiều.
Tencent (team WeChat Vision) phát hành WeMM-Embedding tuần này — một họ model embedding multimodal cho text, ảnh, video, visual document và input trộn lẫn. Weight và code ra theo giấy phép Apache 2.0.
Con số đáng dùng là bản 2B, không phải 9B
Bản 9B đạt 80,6 trên MMEB-v2 và đứng đầu leaderboard chính thức tính đến ngày 24/8. Nhưng bản triển khai được là 2B: nó báo 77,9 điểm tổng trên MMEB-v2 — hơn Qwen3-VL-Embedding-2B 4,7 điểm, hơn DME-2B 3,1 điểm, và vượt nhẹ cả Qwen3-VL-Embedding-8B. Trên benchmark nội bộ 26 tác vụ của WeChat, bản 2B đạt 72,0 so với 60,9 của baseline open đại diện.
Con số nội bộ thì khó kiểm chứng từ bên ngoài — đây là signal, không phải bằng chứng để đổi stack ngay mai. Điểm đáng chú ý là một model 2B đã đủ tốt để làm component hệ thống, không còn là artifact nghiên cứu.
Vector dimension là một lựa chọn sản phẩm
Phần thực dụng nhất trong báo cáo là Matryoshka: WeMM hỗ trợ nhiều số chiều embedding từ một forward pass. Bản 2B công bố các mức 64, 128, 256, 512, 1024 và 2048.
Theo báo cáo, ở mức 256 chiều, tác vụ ảnh và video giữ 98,7% hiệu năng so với 2048 chiều, và cả ba nhóm tác vụ đều giữ trên 97% khi số chiều đạt 256. Ngoại lệ là visual document: chúng nhạy hơn với việc cắt chiều, hợp lý vì screenshot và trang tài liệu mang dày chữ và thông tin layout.
Khác biệt giữa 256 và 2048 chiều không phải chuyện thẩm mỹ. Nó quyết định bạn giữ warm được bao nhiêu dữ liệu, rebuild index nhanh cỡ nào, và liệu một hệ search local hay hosted giá rẻ có đủ hay không. Re-index 10 triệu item vì không ai đặt câu hỏi về mức 2048 là một khoản thuế tự nguyện.
Vì sao bài viết nhấn deployment thay vì leaderboard
Tác giả bản phân tích trên Dev.to lập luận rằng điểm đáng chú ý không nằm ở bảng benchmark, mà ở chi tiết model đã chạy trong WeChat — trong Channels, Official Accounts, Moments, e-commerce và search. Nói cách khác: nó đang phục vụ như một lớp biểu diễn dùng chung cho các surface có hình dạng nội dung rất khác nhau.
Cùng bài viết mô tả recipe huấn luyện hai stage: stage một align vài trăm triệu cặp source-target xuyên modality và tác vụ; stage hai tinh chỉnh bằng dữ liệu curated, tín hiệu relevance khó hơn và distillation từ model lớn hơn — bản 2B và 4B học từ bản 9B ở stage này. Danh sách tác vụ được huấn luyện gồm retrieval, classification, graded relevance, visual grounding, composed multimodal query, document, memory và tác vụ hướng agent.
Việc nên làm tuần này
Lấy 20 query mà hệ retrieval hiện tại của bạn trả sai — chọn cả những case xấu có screenshot, ảnh bìa, ảnh sản phẩm và trang tài liệu. Chạy bản 2B trên đúng 20 query đó rồi so kết quả, trước khi chạm vào phần còn lại của stack. Nếu các miss cải thiện, bạn có lý do migrate. Nếu không, bạn học được điều đó với giá rẻ hơn nhiều so với một cuộc migrate thật.
Và giữ một scorecard theo từng loại nội dung, vì mức chiều tối thiểu chấp nhận được của ảnh sản phẩm và của trang PDF gần như chắc chắn không giống nhau.
This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.
Top comments (0)