跳到主要內容
buildradar
Sign in
主題 · video-understanding

video-understanding

標記 video-understanding 主題、收錄中的開源專案,依星數排序。

專案數
19
總星數
34,235
平均星數
1,802
佔比
0.00%

常跟 video-understanding 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 video-understanding 主題的專案。

  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    OpenMMLab 的下一代視頻理解工具箱和基準

    5,150+3近 7 天星數變化
  • lmms-eval@EvolvingLMMs-Lab

    涵蓋文字、影像、影片與音訊任務的全能多模態評估工具包

    4,390+7近 7 天星數變化
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] ChatGPT 具備視訊理解功能!並支援 miniGPT4、StableLM、MOSS 等多種語言模型

    3,347+0近 7 天星數變化
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking:邁向具備可擴展強化學習的通用多模態推理

    2,379+2近 7 天星數變化
  • InternVideo@OpenGVLab

    [ECCV2024] 用於多模態理解的影片基礎模型與資料

    2,374+5近 7 天星數變化
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] TSM:用於高效率影片理解的時間位移模組

    2,222+1近 7 天星數變化
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA 影片搜尋與摘要 (VSS) AI Blueprint 是一個 GPU 加速的參考架構,用於建構具備即時驗證警報、視覺化問答與自動化報告功能的影片分析代理程式。VSS Blueprint 採用如 NVIDIA Cosmos 等視覺語言模型 (VLM)、如 NVIDIA Nemotron 等 LLM、RAG 以及 NVIDIA NIM。

    1,840+10近 7 天星數變化
  • VideoAgent@HKUDS

    "VideoAgent: 用於影片理解、編輯與重製的全方位 Agentic 框架"

    1,834+65近 7 天星數變化
  • PaddleVideo@PaddlePaddle

    基於 PaddlePaddle 的強大影片理解工具包。支援影片資料標註工具、輕量級 RGB 與骨架動作辨識模型,以及影片標籤與運動動作偵測的實用應用。

    1,702+0近 7 天星數變化
  • SALMONN@bytedance

    SALMONN 系列:一套先進的多模態 LLM

    1,521+3近 7 天星數變化
  • Lance@bytedance

    具備 3B 活躍參數的原生統一多模態模型,支援影像與影片的理解、生成及編輯。

    1,334+3近 7 天星數變化
  • 視覺接地(visual grounding)研究論文精選清單

    1,127+0近 7 天星數變化
  • :fire: :fire: :fire: 近期電腦視覺 (CV) 相關論文清單

    973+1近 7 天星數變化
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi:統一視覺表示賦能大型語言模型具備圖像與影片理解能力

    941+0近 7 天星數變化
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: 透過雙重遮罩擴展 Video Masked Autoencoders

    818+3近 7 天星數變化
  • MiniGPT4-video@Vision-CAIR

    用於長影片理解的 Goldfish 模型與用於短影片理解的 MiniGPT4-video 官方程式碼

    639+1近 7 天星數變化
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606近 7 天星數變化
  • ComfyUI_VLM_nodes@gokayfem

    用於視覺語言模型的 ComfyUI 節點:Qwen3-VL、Moondream 3、Florence-2、SmolVLM2、InternVL、Gemma 3、MiniCPM-V。另支援開放詞彙檢測、SAM2/SAM3 分割、影片時序推理、透過 llama.cpp 的 GGUF 以及託管式 LLM/VLM API。

    588-1近 7 天星數變化
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS:用於動作表達影片分割的大規模基準測試。

    525+0近 7 天星數變化
← 返回主題列表