Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · vision-language

vision-language

Các kho mã nguồn mở đang theo dõi được gắn thẻ vision-language, sắp xếp theo số sao.

Kho mã
18
Tổng số sao
35.353
Số sao trung bình
1.964
Tỷ trọng
0,00%

Những chủ đề thường xuất hiện cùng vision-language trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ vision-language.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • GroundingDINO@IDEA-Research

    [ECCV 2024] Triển khai chính thức của bài báo "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"

    10.536+14Thay đổi số sao trong 7 ngày qua
  • Chinese-CLIP@OFA-Sys

    Phiên bản tiếng Trung của CLIP giúp đạt được khả năng truy xuất đa phương thức và tạo biểu diễn bằng tiếng Trung.

    6.001+1Thay đổi số sao trong 7 ngày qua
  • OFA@OFA-Sys

    Kho lưu trữ chính thức của OFA (ICML 2022). Bài báo: OFA: Hợp nhất các kiến trúc, tác vụ và phương thức thông qua một framework học tập chuỗi sang chuỗi đơn giản

    2.557+0Thay đổi số sao trong 7 ngày qua
  • Một bản cài đặt mã nguồn mở để tinh chỉnh chuỗi Qwen-VL bởi Alibaba Cloud.

    1.961+1Thay đổi số sao trong 7 ngày qua
  • AdvancedLiterateMachinery@AlibabaResearch

    Bộ sưu tập các ý tưởng và thuật toán độc đáo, sáng tạo hướng tới Máy móc văn bản nâng cao. Dự án này được duy trì bởi Nhóm OCR thuộc Phòng thí nghiệm Công nghệ Ngôn ngữ, Phòng thí nghiệm Thông Y, Alibaba Group.

    1.835+1Thay đổi số sao trong 7 ngày qua
  • Video-ChatGPT@mbzuai-oryx

    Video-ChatGPT là một mô hình hội thoại video có khả năng tạo ra các cuộc hội thoại có ý nghĩa về video. Nó kết hợp khả năng của LLMs với một bộ mã hóa hình ảnh được huấn luyện trước, thích ứng cho biểu diễn video không gian-thời gian. Chúng tôi cũng giới thiệu một 'Đánh giá định lượng chuẩn hóa' nghiêm ngặt cho các mô hình hội thoại dựa trên video.

    1.507+1Thay đổi số sao trong 7 ngày qua
  • awesome-japanese-llm@llm-jp

    Tổng quan về các LLM tiếng Nhật

    1.428+1Thay đổi số sao trong 7 ngày qua
  • DriveLM@OpenDriveLab

    [ECCV 2024 Oral] DriveLM: Lái xe bằng Trả lời câu hỏi trực quan dựa trên đồ thị

    1.340+1Thay đổi số sao trong 7 ngày qua
  • ONE-PEACE@OFA-Sys

    Mô hình biểu diễn tổng quát cho các phương thức thị giác, âm thanh và ngôn ngữ. Bài báo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Thay đổi số sao trong 7 ngày qua
  • TinyLLaVA_Factory@TinyLLaVA

    Khung mô hình đa phương thức lớn quy mô nhỏ

    1.004+1Thay đổi số sao trong 7 ngày qua
  • calvin@mees

    CALVIN - Điểm chuẩn cho Học chính sách theo điều kiện ngôn ngữ đối với các tác vụ thao tác robot dài hạn

    983+8Thay đổi số sao trong 7 ngày qua
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: Mô hình CLIP tập trung vào bất kỳ vị trí nào bạn muốn

    874+0Thay đổi số sao trong 7 ngày qua
  • Open-GroundingDino@longzw1997

    Đây là bản triển khai của bên thứ ba cho bài báo Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.

    846+2Thay đổi số sao trong 7 ngày qua
  • LLaVA-pp@mbzuai-oryx

    LLaVA++: Mở rộng LLaVA với Phi-3 và LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3).

    842+0Thay đổi số sao trong 7 ngày qua
  • daclip-uir@Algolzw

    [ICLR 2024] Kiểm soát các mô hình ngôn ngữ thị giác (Vision-Language Models) để phục hồi hình ảnh phổ quát. Đạt giải 5 trong thử thách NTIRE 2024 Restore Any Image Model in the Wild.

    817+1Thay đổi số sao trong 7 ngày qua
  • SEED@AILab-CVC

    Triển khai chính thức của SEED-LLaMA (ICLR 2024)

    641-1Thay đổi số sao trong 7 ngày qua
  • RemoteCLIP@ChenDelong1999

    🛰️ Kho lưu trữ chính thức của bài báo "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS)

    591+4Thay đổi số sao trong 7 ngày qua
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    588Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề