跳到主要内容
buildradar
Sign in
主题 · vision-language

vision-language

标记 vision-language 主题、收录中的开源项目,按星标数排序。

项目数
18
总星标数
35,353
平均星标数
1,964
占比
0.00%

常跟 vision-language 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 vision-language 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • GroundingDINO@IDEA-Research

    [ECCV 2024] 论文「Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection」的官方实现

    10,536+14近 7 天星标变化
  • Chinese-CLIP@OFA-Sys

    中文版本的 CLIP,实现中文跨模态检索与表征生成。

    6,001+1近 7 天星标变化
  • OFA@OFA-Sys

    OFA (ICML 2022) 官方仓库。论文:OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2,557+0近 7 天星标变化
  • 阿里巴巴开源的 Qwen-VL 系列微调开源实现。

    1,961+1近 7 天星标变化
  • AdvancedLiterateMachinery@AlibabaResearch

    朝向高级文学机器(Advanced Literate Machinery)的原创创新点子与算法集合。本项目由阿里巴巴集团通义实验室语言技术实验室 OCR 团队维护。

    1,835+1近 7 天星标变化
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT 是一个能够针对视频生成有意义对话的视频对话模型。它结合了 LLM 的能力与适应时空视频表示的预训练视觉编码器。我们也为基于视频的对话模型引入了严格的“量化评估基准”。

    1,507+1近 7 天星标变化
  • awesome-japanese-llm@llm-jp

    日本語LLM总结 - 日本语LLM概览

    1,428+1近 7 天星标变化
  • DriveLM@OpenDriveLab

    [ECCV 2024 Oral] DriveLM:结合图形视觉问答的自动驾驶

    1,340+1近 7 天星标变化
  • ONE-PEACE@OFA-Sys

    跨视觉、音频、语言模态的通用表示模型。论文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0近 7 天星标变化
  • TinyLLaVA_Factory@TinyLLaVA

    小型大型多模态模型框架

    1,003+0近 7 天星标变化
  • calvin@mees

    CALVIN - 用于长视距机器人操作任务的语言条件策略学习基准测试

    985+10近 7 天星标变化
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP:一个能专注于你指定位置的 CLIP 模型

    875+1近 7 天星标变化
  • Open-GroundingDino@longzw1997

    这是论文 Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection 的第三方实现。

    846+2近 7 天星标变化
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++:使用 Phi-3 与 LLaMA-3 扩充 LLaVA(LLaVA LLaMA-3、LLaVA Phi-3)

    842+0近 7 天星标变化
  • daclip-uir@Algolzw

    [ICLR 2024] 控制视觉语言模型以实现通用图像修复。荣获 NTIRE 2024 野外通用图像修复挑战赛(Restore Any Image Model in the Wild Challenge)第五名。

    817+1近 7 天星标变化
  • SEED@AILab-CVC

    SEED-LLaMA (ICLR 2024) 官方实现。

    641-1近 7 天星标变化
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606近 7 天星标变化
  • RemoteCLIP@ChenDelong1999

    论文「RemoteCLIP: A Vision Language Foundation Model for Remote Sensing」(IEEE TGRS) 官方仓库

    592+5近 7 天星标变化
← 返回主题列表