跳到主要內容
buildradar
Sign in
主題 · vision-language

vision-language

標記 vision-language 主題、收錄中的開源專案,依星數排序。

專案數
18
總星數
35,353
平均星數
1,964
佔比
0.00%

常跟 vision-language 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 vision-language 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • GroundingDINO@IDEA-Research

    [ECCV 2024] 論文「Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection」的官方實作

    10,536+14近 7 天星數變化
  • Chinese-CLIP@OFA-Sys

    中文版本的 CLIP,實現中文跨模態檢索與表徵生成。

    6,001+1近 7 天星數變化
  • OFA@OFA-Sys

    OFA (ICML 2022) 官方儲存庫。論文:OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2,557+0近 7 天星數變化
  • 阿里巴巴開源的 Qwen-VL 系列微調開源實現。

    1,961+1近 7 天星數變化
  • AdvancedLiterateMachinery@AlibabaResearch

    朝向先進文學機器(Advanced Literate Machinery)的原創創新點子與演算法集合。本專案由阿里巴巴集團通義實驗室語言技術實驗室 OCR 團隊維護。

    1,835+1近 7 天星數變化
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT 是一個能夠針對影片產生有意義對話的影片對話模型。它結合了 LLM 的能力與適應時空影片表示的預訓練視覺編碼器。我們也為基於影片的對話模型引入了嚴格的「量化評估基準」。

    1,507+1近 7 天星數變化
  • awesome-japanese-llm@llm-jp

    日本語LLM總結 - 日本語LLM概覽

    1,428+1近 7 天星數變化
  • DriveLM@OpenDriveLab

    [ECCV 2024 Oral] DriveLM:結合圖形視覺問答的自動駕駛

    1,340+1近 7 天星數變化
  • ONE-PEACE@OFA-Sys

    跨視覺、音訊、語言模態的通用表示模型。論文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0近 7 天星數變化
  • TinyLLaVA_Factory@TinyLLaVA

    小型大型多模態模型框架

    1,003+0近 7 天星數變化
  • calvin@mees

    CALVIN - 用於長視距機器人操作任務的語言條件策略學習基準測試

    985+10近 7 天星數變化
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP:一個能專注於你指定位置的 CLIP 模型

    875+0近 7 天星數變化
  • Open-GroundingDino@longzw1997

    這是論文 Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection 的第三方實作。

    846+2近 7 天星數變化
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++:使用 Phi-3 與 LLaMA-3 擴充 LLaVA(LLaVA LLaMA-3、LLaVA Phi-3)

    842+0近 7 天星數變化
  • daclip-uir@Algolzw

    [ICLR 2024] 控制視覺語言模型以實現通用影像修復。榮獲 NTIRE 2024 野外通用影像修復挑戰賽(Restore Any Image Model in the Wild Challenge)第五名。

    817+1近 7 天星數變化
  • SEED@AILab-CVC

    SEED-LLaMA (ICLR 2024) 官方實作。

    641-1近 7 天星數變化
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606近 7 天星數變化
  • RemoteCLIP@ChenDelong1999

    論文「RemoteCLIP: A Vision Language Foundation Model for Remote Sensing」(IEEE TGRS) 官方儲存庫

    592+4近 7 天星數變化
← 返回主題列表