multimodal
Các kho mã nguồn mở đang theo dõi được gắn thẻ multimodal, sắp xếp theo số sao.
- #91
Bộ công cụ thị giác và kỹ năng được thiết kế cho các mô hình thuần văn bản để "xem ảnh" — hỗ trợ hiểu đa ảnh, hỏi đáp hình ảnh, khôi phục UI frontend, tự động hóa GUI và tích hợp liền mạch tùy chọn vào nhiều agent phổ biến, nhận diện trực tiếp ảnh dán | Bộ công cụ thị giác và kỹ năng thiết kế cho LLM thuần văn bản — hỏi đáp hình ảnh, OCR ảnh chụp màn hình dài, khôi phục UI frontend và tự động hóa GUI, tích hợp liền mạch tùy chọn cho Codex, Claude Code, Pi, Oh My Pi và OpenCode
★ 1.136+18Thay đổi số sao trong 7 ngày qua - #92
Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho Cordova
★ 1.132+0Thay đổi số sao trong 7 ngày qua - #93
SGLang-Omni hỗ trợ phục vụ hiệu suất cao cho TTS, ASR, các mô hình giọng nói và đa năng (omni).
★ 1.118+143Thay đổi số sao trong 7 ngày qua - #94★ 1.110+5Thay đổi số sao trong 7 ngày qua
- #95★ 1.088+1Thay đổi số sao trong 7 ngày qua
- #96
Đôi mắt cho các tác nhân DeepSeek Harness chỉ có văn bản: chuỗi thị giác miễn phí tích hợp (không cần khóa) + công cụ thị giác cấp độ điểm ảnh (Hỏi đáp, định vị, cắt, so sánh điểm ảnh, màu sắc, OCR, dò tìm SVG, tách nền, ảnh chụp màn hình). Cài đặt bằng một lệnh, không cần Python, các lượt xử lý hình ảnh hoạt động giống như các lượt gọi công cụ thông thường.
★ 1.086+64Thay đổi số sao trong 7 ngày qua - #97
🩺 Mô hình y tế đa phương thức tiếng Trung đầu tiên có khả năng đọc phim chụp X-quang ngực.
★ 1.084+2Thay đổi số sao trong 7 ngày qua - #98
[Tiêu điểm ICLR'24] Dòng mô hình lớn đa phương thức tiếng Trung và tiếng Anh (Chat and Paint) | Dòng mô hình lớn đa phương thức song ngữ Trung-Anh dựa trên mô hình cơ sở CPM
★ 1.061-1Thay đổi số sao trong 7 ngày qua - #99
Mô hình biểu diễn tổng quát cho các phương thức thị giác, âm thanh và ngôn ngữ. Bài báo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Thay đổi số sao trong 7 ngày qua - #100
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Trao quyền cho các Large Language Model để hiểu đám mây điểm
★ 1.053+2Thay đổi số sao trong 7 ngày qua - #101
Bản triển khai chính thức cho "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval".
★ 1.032+1Thay đổi số sao trong 7 ngày qua - #102
Lập luận chuỗi suy nghĩ đa phương thức: Một khảo sát toàn diện
★ 1.025+2Thay đổi số sao trong 7 ngày qua - #103★ 1.017+38Thay đổi số sao trong 7 ngày qua
- #104
Tài nguyên, ví dụ và hướng dẫn cho AI đa phương thức, RAG và các tác nhân sử dụng tìm kiếm vector và LLM
★ 973-1Thay đổi số sao trong 7 ngày qua - #105★ 959+64Thay đổi số sao trong 7 ngày qua
- #106★ 903+4Thay đổi số sao trong 7 ngày qua
- #107
Bộ sưu tập các bài báo CVPR 2025 nổi bật và có ảnh hưởng nhất. 🔥 [Paper + Code + Demo]
★ 895+1Thay đổi số sao trong 7 ngày qua - #108
Dòng NEO: Các mô hình ngôn ngữ-thị giác gốc (Native Vision-Language Models) từ những nguyên lý cơ bản
★ 888+0Thay đổi số sao trong 7 ngày qua - #109★ 881-1Thay đổi số sao trong 7 ngày qua
- #110
⚡ Trình giải captcha tương thích YesCaptcha có thể tự lưu trữ, được xây dựng bằng FastAPI, Playwright và các mô hình đa phương thức tương thích với OpenAI.
★ 869+4Thay đổi số sao trong 7 ngày qua - #111
Một công cụ huấn luyện mô hình đa phương thức đơn giản và thống nhất. Tinh gọn, linh hoạt và được xây dựng để tùy chỉnh ở quy mô lớn.
★ 824+0Thay đổi số sao trong 7 ngày qua - #112
[TMLR 2025🔥] Khảo sát về các mô hình tự hồi quy trong thị giác máy tính.
★ 808+1Thay đổi số sao trong 7 ngày qua - #113★ 803+0Thay đổi số sao trong 7 ngày qua
- #114
Huấn luyện mô hình theo phương pháp tương phản (Contrastive) trong Pytorch
★ 802+0Thay đổi số sao trong 7 ngày qua - #115
Giám sát cục bộ + AI thị giác — Khung giám sát AI dựa trên mạng LAN sử dụng điện thoại thông minh với đầu ra sự kiện có cấu trúc để thu thập và phân tích dữ liệu.
★ 768+10Thay đổi số sao trong 7 ngày qua - #116
Danh sách các bài báo về mô hình đa phương thức và mô hình ngôn ngữ lớn, chỉ dùng để ghi lại các bài báo tôi đọc trên arxiv hàng ngày cho nhu cầu cá nhân.
★ 761+1Thay đổi số sao trong 7 ngày qua - #117
[ECCV 2024] InstructIR: Khôi phục hình ảnh chất lượng cao theo hướng dẫn của con người https://huggingface.co/spaces/marcosv/InstructIR
★ 741+0Thay đổi số sao trong 7 ngày qua - #118
Paddle Multimodal Integration and eXploration, hỗ trợ các tác vụ đa phương thức phổ biến, bao gồm các mô hình tiền huấn luyện đa phương thức quy mô lớn end-to-end và bộ công cụ mô hình khuếch tán. Hiệu suất cao và linh hoạt.
★ 723-1Thay đổi số sao trong 7 ngày qua - #119
Bộ công cụ cho hệ thống gợi ý đa phương thức (MultiModal Recommendation), tích hợp hơn 10 mô hình.
★ 689+1Thay đổi số sao trong 7 ngày qua - #120
Kho lưu trữ này chứa mã cho "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] và "MMEB-V3" [COLM 2026]
★ 682+2Thay đổi số sao trong 7 ngày qua