メインコンテンツへスキップ
buildradar
Sign in
トピック · video-understanding

video-understanding

video-understanding がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
19
総スター数
34,235
平均スター数
1,802
シェア
0.00%

video-understanding と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、video-understanding がタグ付けされたリポジトリ。

  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    OpenMMLabの次世代ビデオ理解ツールボックスおよびベンチマーク。

    5,150+3直近 7 日のスター増減
  • lmms-eval@EvolvingLMMs-Lab

    テキスト、画像、ビデオ、オーディオタスクを網羅するオールインワンのマルチモーダル評価ツールキット

    4,390+7直近 7 日のスター増減
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] 動画理解機能を持つ ChatGPT!miniGPT4、StableLM、MOSS など、他にも多くの LM をサポート。

    3,347+0直近 7 日のスター増減
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking: スケーラブルな強化学習による汎用マルチモーダル推論に向けて

    2,379+2直近 7 日のスター増減
  • InternVideo@OpenGVLab

    [ECCV2024] マルチモーダル理解のためのビデオ基盤モデルとデータ

    2,374+5直近 7 日のスター増減
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] 効率的な動画理解のための TSM: Temporal Shift Module

    2,222+1直近 7 日のスター増減
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    動画検索および要約(VSS)向けのNVIDIA AI Blueprintは、リアルタイムの検証済みアラート、視覚的Q&A、自動レポート機能を備えた動画解析エージェントを構築するためのGPUアクセラレーテッド・リファレンスアーキテクチャです。VSS Blueprintは、NVIDIA Cosmosなどのビジョン言語モデル(VLM)、NVIDIA NemotronなどのLLM、RAG、およびNVIDIA NIMを使用します。

    1,840+10直近 7 日のスター増減
  • VideoAgent@HKUDS

    VideoAgent: 動画の理解、編集、リメイクのためのオールインワン型エージェントフレームワーク

    1,834+65直近 7 日のスター増減
  • PaddleVideo@PaddlePaddle

    PaddlePaddleベースの素晴らしい動画理解ツールキット。動画データアノテーションツール、軽量なRGBおよびスケルトンベースの行動認識モデル、動画タグ付けやスポーツ行動検出の実用的なアプリケーションをサポートしています。

    1,702+0直近 7 日のスター増減
  • SALMONN@bytedance

    SALMONN ファミリー:高度なマルチモーダル LLM のスイート

    1,521+3直近 7 日のスター増減
  • Lance@bytedance

    画像と動画の理解、生成、編集を行う、アクティブパラメータ数3Bのネイティブ統合マルチモーダルモデル

    1,334+3直近 7 日のスター増減
  • awesome grounding:ビジュアルグラウンディングに関する厳選された研究論文リスト

    1,127+0直近 7 日のスター増減
  • :fire: :fire: :fire: 最近の Computer Vision (CV) に関する論文リスト

    973+1直近 7 日のスター増減
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: 画像および動画の理解能力を大規模言語モデルに付与する統合型視覚表現

    941+0直近 7 日のスター増減
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: デュアルマスキングを用いたビデオマスクオートエンコーダーのスケーリング

    819+3直近 7 日のスター増減
  • MiniGPT4-video@Vision-CAIR

    長尺動画理解のための Goldfish モデルおよび短尺動画理解のための MiniGPT4-video の公式コード

    639+1直近 7 日のスター増減
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606直近 7 日のスター増減
  • ComfyUI_VLM_nodes@gokayfem

    視覚言語モデル(Qwen3-VL、Moondream 3、Florence-2、SmolVLM2、InternVL、Gemma 3、MiniCPM-V)用のComfyUIノード。さらに、オープン語彙検出、SAM2/SAM3セグメンテーション、動画の時間的推論、llama.cppによるGGUF、ホスト型LLM/VLM APIに対応。

    588-1直近 7 日のスター増減
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS: 動きの表現を伴う動画セグメンテーションのための大規模ベンチマーク。

    525+0直近 7 日のスター増減
← トピック一覧に戻る