跳到主要内容
buildradar
登录
主题 · video-understanding

video-understanding

标记 video-understanding 主题、收录中的开源项目,按星标数排序。

项目数
19
总星标数
34,235
平均星标数
1,802
占比
0.00%

常跟 video-understanding 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 video-understanding 主题的项目。

  • Code-as-World@MirroS-Lab

    Code as World: Agentic Discovery of Executable World Representations for Physical Reasoning

    429
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    OpenMMLab 的下一代视频理解工具箱和基准

    5,150+0近 7 天星标变化
  • lmms-eval@EvolvingLMMs-Lab

    涵盖文本、图像、视频和音频任务的全能多模态评估工具包

    4,390+0近 7 天星标变化
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] ChatGPT 具备视频理解功能!并支持 miniGPT4、StableLM、MOSS 等多种语言模型

    3,347+0近 7 天星标变化
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking:迈向具备可扩展强化学习的通用多模态推理

    2,379+0近 7 天星标变化
  • InternVideo@OpenGVLab

    [ECCV2024] 用于多模态理解的视频基础模型与数据

    2,374+0近 7 天星标变化
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] TSM:用于高效视频理解的时间位移模块

    2,222+0近 7 天星标变化
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA 视频搜索与摘要 (VSS) AI Blueprint 是一个 GPU 加速的参考架构,用于构建具备实时验证警报、可视化问答与自动化报告功能的视频分析代理程序。VSS Blueprint 采用如 NVIDIA Cosmos 等视觉语言模型 (VLM)、如 NVIDIA Nemotron 等 LLM、RAG 以及 NVIDIA NIM。

    1,840+0近 7 天星标变化
  • VideoAgent@HKUDS

    "VideoAgent: 用于视频理解、编辑与重制的全方位 Agentic 框架"

    1,834+0近 7 天星标变化
  • PaddleVideo@PaddlePaddle

    基于 PaddlePaddle 的强大视频理解工具包。支持视频数据标注工具、轻量级 RGB 与骨架动作识别模型,以及视频标签与运动动作检测的实用应用。

    1,702+0近 7 天星标变化
  • SALMONN@bytedance

    SALMONN 系列:一套先进的多模态 LLM

    1,521+0近 7 天星标变化
  • Lance@bytedance

    具备 3B 活跃参数的原生统一多模态模型,支持图像与视频的理解、生成及编辑。

    1,334+0近 7 天星标变化
  • 视觉接地(visual grounding)研究论文精选列表

    1,127+0近 7 天星标变化
  • :fire: :fire: :fire: 近期计算机视觉 (CV) 相关论文列表

    973+1近 7 天星标变化
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi:统一视觉表示赋能大型语言模型具备图像与视频理解能力

    941+0近 7 天星标变化
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: 通过双重遮罩扩展 Video Masked Autoencoders

    819+1近 7 天星标变化
  • MiniGPT4-video@Vision-CAIR

    用于长视频理解的 Goldfish 模型与用于短视频理解的 MiniGPT4-video 官方代码

    639+1近 7 天星标变化
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    620+81近 7 天星标变化
  • ComfyUI_VLM_nodes@gokayfem

    用于视觉语言模型的 ComfyUI 节点:Qwen3-VL、Moondream 3、Florence-2、SmolVLM2、InternVL、Gemma 3、MiniCPM-V。另支持开放词汇检测、SAM2/SAM3 分割、视频时序推理、通过 llama.cpp 的 GGUF 以及托管式 LLM/VLM API。

    588-1近 7 天星标变化
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS:用于动作表达视频分割的大规模基准测试。

    525+0近 7 天星标变化
← 返回主题列表