vision-language-model
Các kho mã nguồn mở đang theo dõi được gắn thẻ vision-language-model, sắp xếp theo số sao.
- #31★ 1.309+0Thay đổi số sao trong 7 ngày qua
- #32
Khung mã nguồn mở hoàn toàn dành cho đào tạo đa phương thức phi tập trung
★ 1.195+1Thay đổi số sao trong 7 ngày qua - #33
Chuỗi bài viết này sẽ đưa bạn từ các kiến thức cơ bản về NLP và Computer Vision đến các mô hình Vision-Language Models tiên tiến nhất.
★ 1.179+0Thay đổi số sao trong 7 ngày qua - #34★ 1.153-25Thay đổi số sao trong 7 ngày qua
- #35
Bộ công cụ thị giác và kỹ năng được thiết kế cho các mô hình thuần văn bản để "xem ảnh" — hỗ trợ hiểu đa ảnh, hỏi đáp hình ảnh, khôi phục UI frontend, tự động hóa GUI và tích hợp liền mạch tùy chọn vào nhiều agent phổ biến, nhận diện trực tiếp ảnh dán | Bộ công cụ thị giác và kỹ năng thiết kế cho LLM thuần văn bản — hỏi đáp hình ảnh, OCR ảnh chụp màn hình dài, khôi phục UI frontend và tự động hóa GUI, tích hợp liền mạch tùy chọn cho Codex, Claude Code, Pi, Oh My Pi và OpenCode
★ 1.136+18Thay đổi số sao trong 7 ngày qua - #36★ 979-1Thay đổi số sao trong 7 ngày qua
- #37
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), mô hình đầu tiên có khả năng tạo phản hồi bằng ngôn ngữ tự nhiên tích hợp liền mạch với các mặt nạ phân đoạn đối tượng.
★ 967+0Thay đổi số sao trong 7 ngày qua - #38
[CVPR 2024 Highlight🔥] Chat-UniVi: Biểu diễn hình ảnh hợp nhất giúp các mô hình ngôn ngữ lớn có khả năng hiểu hình ảnh và video
★ 941+0Thay đổi số sao trong 7 ngày qua - #39
Bộ sưu tập các bài báo CVPR 2025 nổi bật và có ảnh hưởng nhất. 🔥 [Paper + Code + Demo]
★ 895+1Thay đổi số sao trong 7 ngày qua - #40★ 874+0Thay đổi số sao trong 7 ngày qua
- #41
[dsh] Bộ công cụ thị giác mạnh mẽ hơn cho các mô hình văn bản thuần túy: cài đặt và sử dụng trong một dòng lệnh, dán ảnh để nhận diện trực tiếp, hỏi đáp nhiều ảnh, chụp màn hình để khôi phục giao diện người dùng|Tích hợp DeepSeek Harness cho bộ công cụ thị giác tác nhân: hỏi đáp ảnh, OCR chụp màn hình dài, khôi phục UI, grounding, so sánh pixel, Artifacts và Web UI.
★ 856+17Thay đổi số sao trong 7 ngày qua - #42
VoxPoser: Bản đồ giá trị 3D có thể kết hợp cho thao tác robot với các mô hình ngôn ngữ
★ 834+1Thay đổi số sao trong 7 ngày qua - #43
[NeurIPS 2025 Spotlight] OpenCUA: Nền tảng mở cho các tác nhân sử dụng máy tính (Computer-Use Agents).
★ 833+4Thay đổi số sao trong 7 ngày qua - #44★ 832+0Thay đổi số sao trong 7 ngày qua
- #45
Danh sách tổng hợp các bài báo về 3D Vision trong lĩnh vực Robotics thời đại mô hình lớn (LLMs/VLMs), lấy cảm hứng từ awesome-computer-vision, bao gồm bài báo, mã nguồn và các trang web liên quan
★ 821+2Thay đổi số sao trong 7 ngày qua - #46
Danh sách tổng hợp các phương pháp học prompt/adapter tuyệt vời cho các mô hình ngôn ngữ thị giác như CLIP.
★ 797+1Thay đổi số sao trong 7 ngày qua - #47
[ICLR 2026] Triển khai chính thức của "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model".
★ 725+5Thay đổi số sao trong 7 ngày qua - #48
OmniVinci là một LLM đa phương thức giúp hiểu đồng thời hình ảnh, âm thanh và ngôn ngữ.
★ 677+0Thay đổi số sao trong 7 ngày qua - #49★ 642+0Thay đổi số sao trong 7 ngày qua
- #50
[CVPR 2026] SpatialVID: Tập dữ liệu video quy mô lớn với chú thích không gian
★ 600+1Thay đổi số sao trong 7 ngày qua - #51
PILOT: Bộ công cụ học tập liên tục dựa trên mô hình được huấn luyện trước
★ 600+3Thay đổi số sao trong 7 ngày qua - #52
Đánh giá các mô hình chuyển văn bản thành hình ảnh/video/3D bằng VQAScore.
★ 600+0Thay đổi số sao trong 7 ngày qua - #53★ 596—Thay đổi số sao trong 7 ngày qua
- #54
[ECCV2024] Mô hình ngôn ngữ lớn đa phương thức có căn cứ với mã hóa hình ảnh cục bộ
★ 586+0Thay đổi số sao trong 7 ngày qua - #55
LLaVA-Mini là mô hình đa phương thức lớn (LMM) hợp nhất, hỗ trợ hiểu hình ảnh, hình ảnh độ phân giải cao và video một cách hiệu quả.
★ 577+0Thay đổi số sao trong 7 ngày qua - #56
Cambrian-S: Hướng tới siêu cảm biến không gian trong video.
★ 567-1Thay đổi số sao trong 7 ngày qua - #57
Chatbot Arena kết hợp đa phương thức! Multi-Modality Arena cho phép bạn so sánh các mô hình ngôn ngữ thị giác cạnh nhau với đầu vào là hình ảnh. Hỗ trợ MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 và nhiều mô hình khác!
★ 566+0Thay đổi số sao trong 7 ngày qua - #58
Flame là một hệ thống AI đa phương thức mã nguồn mở được thiết kế để chuyển đổi các bản thiết kế UI thành mã React chất lượng cao. Nó tận dụng mô hình ngôn ngữ thị giác, tổng hợp dữ liệu tự động và quy trình đào tạo có cấu trúc để thu hẹp khoảng cách giữa thiết kế và phát triển front-end.
★ 562+0Thay đổi số sao trong 7 ngày qua - #59
Mã nguồn và hướng dẫn triển khai cho bài báo Counting Anything. Trang dự án: https://mengqi-lei.github.io/count-anything-projectpage/
★ 539+2Thay đổi số sao trong 7 ngày qua