vision-language
Các kho mã nguồn mở đang theo dõi được gắn thẻ vision-language, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng vision-language trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ vision-language.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
[ECCV 2024] Triển khai chính thức của bài báo "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"
★ 10.536+14Thay đổi số sao trong 7 ngày qua - #2
Phiên bản tiếng Trung của CLIP giúp đạt được khả năng truy xuất đa phương thức và tạo biểu diễn bằng tiếng Trung.
★ 6.001+1Thay đổi số sao trong 7 ngày qua - #3
Kho lưu trữ chính thức của OFA (ICML 2022). Bài báo: OFA: Hợp nhất các kiến trúc, tác vụ và phương thức thông qua một framework học tập chuỗi sang chuỗi đơn giản
★ 2.557+0Thay đổi số sao trong 7 ngày qua - #4
Một bản cài đặt mã nguồn mở để tinh chỉnh chuỗi Qwen-VL bởi Alibaba Cloud.
★ 1.961+1Thay đổi số sao trong 7 ngày qua - #5
Bộ sưu tập các ý tưởng và thuật toán độc đáo, sáng tạo hướng tới Máy móc văn bản nâng cao. Dự án này được duy trì bởi Nhóm OCR thuộc Phòng thí nghiệm Công nghệ Ngôn ngữ, Phòng thí nghiệm Thông Y, Alibaba Group.
★ 1.835+1Thay đổi số sao trong 7 ngày qua - #6
Video-ChatGPT là một mô hình hội thoại video có khả năng tạo ra các cuộc hội thoại có ý nghĩa về video. Nó kết hợp khả năng của LLMs với một bộ mã hóa hình ảnh được huấn luyện trước, thích ứng cho biểu diễn video không gian-thời gian. Chúng tôi cũng giới thiệu một 'Đánh giá định lượng chuẩn hóa' nghiêm ngặt cho các mô hình hội thoại dựa trên video.
★ 1.507+1Thay đổi số sao trong 7 ngày qua - #7
Tổng quan về các LLM tiếng Nhật
★ 1.428+1Thay đổi số sao trong 7 ngày qua - #8
[ECCV 2024 Oral] DriveLM: Lái xe bằng Trả lời câu hỏi trực quan dựa trên đồ thị
★ 1.340+1Thay đổi số sao trong 7 ngày qua - #9
Mô hình biểu diễn tổng quát cho các phương thức thị giác, âm thanh và ngôn ngữ. Bài báo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Thay đổi số sao trong 7 ngày qua - #10
Khung mô hình đa phương thức lớn quy mô nhỏ
★ 1.004+1Thay đổi số sao trong 7 ngày qua - #11
CALVIN - Điểm chuẩn cho Học chính sách theo điều kiện ngôn ngữ đối với các tác vụ thao tác robot dài hạn
★ 983+8Thay đổi số sao trong 7 ngày qua - #12★ 874+0Thay đổi số sao trong 7 ngày qua
- #13
Đây là bản triển khai của bên thứ ba cho bài báo Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.
★ 846+2Thay đổi số sao trong 7 ngày qua - #14★ 842+0Thay đổi số sao trong 7 ngày qua
- #15
[ICLR 2024] Kiểm soát các mô hình ngôn ngữ thị giác (Vision-Language Models) để phục hồi hình ảnh phổ quát. Đạt giải 5 trong thử thách NTIRE 2024 Restore Any Image Model in the Wild.
★ 817+1Thay đổi số sao trong 7 ngày qua - #16★ 641-1Thay đổi số sao trong 7 ngày qua
- #17
🛰️ Kho lưu trữ chính thức của bài báo "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS)
★ 591+4Thay đổi số sao trong 7 ngày qua - #18★ 588—Thay đổi số sao trong 7 ngày qua