multi-modal
Các kho mã nguồn mở đang theo dõi được gắn thẻ multi-modal, sắp xếp theo số sao.
- #31★ 979-1Thay đổi số sao trong 7 ngày qua
- #32
FarmVibes.AI: Mô hình ML không gian địa lý đa phương thức dành cho nông nghiệp và phát triển bền vững
★ 895+0Thay đổi số sao trong 7 ngày qua - #33
【ICLR 2024🔥】 Mở rộng tiền huấn luyện Video-Language sang N-modality thông qua căn chỉnh ngữ nghĩa dựa trên ngôn ngữ.
★ 885+0Thay đổi số sao trong 7 ngày qua - #34
Sử dụng các mô hình đa phương thức tương tác muộn (late-interaction) như ColPali chỉ với vài dòng mã.
★ 852+0Thay đổi số sao trong 7 ngày qua - #35
[CVPR 2026🔥] 🧑🎨 OmniLottie, trình tạo hoạt ảnh vector đa phương thức mã nguồn mở, xuất ra định dạng Lottie JSON.
★ 774+3Thay đổi số sao trong 7 ngày qua - #36
Pipeline OCR đa phương thức được tối ưu hóa cho huấn luyện ML (văn bản, hình ảnh, toán học, bảng biểu, sơ đồ)
★ 676+0Thay đổi số sao trong 7 ngày qua - #37
Mô hình tạo hình ảnh trực quan có thể kiểm soát thống nhất
★ 662+0Thay đổi số sao trong 7 ngày qua - #38
[Bài báo xuất sắc ICCV 2025 & ICCV 2025 RIWM] Aether: Mô hình hóa thế giới thống nhất nhận thức hình học
★ 609+0Thay đổi số sao trong 7 ngày qua - #39★ 583-1Thay đổi số sao trong 7 ngày qua
- #40
FashionCLIP là một mô hình giống CLIP được tinh chỉnh cho lĩnh vực thời trang.
★ 537+3Thay đổi số sao trong 7 ngày qua - #41
Công cụ tạo phim AI dựa trên DAG đa mô hình — tăng tốc song song theo mức độ độc lập của cảnh; tạo các cảnh phim đồng thời thay vì tuần tự; tối ưu hóa lịch trình thực thi từ thứ tự topo sang đường dẫn tới hạn; công cụ tạo phim duy nhất mô hình hóa sự phụ thuộc tường thuật cảnh dưới dạng DAG và điều khiển lập lịch song song bằng thuật toán CPM.
★ 536+0Thay đổi số sao trong 7 ngày qua - #42
🔥🔥🔥 [AAAI 2026 Oral] Triển khai chính thức của Robust-R1: Suy luận nhận thức suy giảm để hiểu hình ảnh mạnh mẽ
★ 511+0Thay đổi số sao trong 7 ngày qua