मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · video-understanding

video-understanding

video-understanding टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
19
कुल स्टार
34,235
औसत स्टार
1,802
हिस्सा
0.00%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर video-understanding के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और video-understanding टैग वाली रिपॉजिटरी।

  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    OpenMMLab का अगली पीढ़ी का वीडियो अंडरस्टैंडिंग टूलबॉक्स और बेंचमार्क

    5,150+3पिछले 7 दिनों में स्टार का बदलाव
  • lmms-eval@EvolvingLMMs-Lab

    टेक्स्ट, इमेज, वीडियो और ऑडियो कार्यों के लिए वन-फॉर-ऑल मल्टीमॉडल मूल्यांकन टूलकिट।

    4,390+7पिछले 7 दिनों में स्टार का बदलाव
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] वीडियो समझ के साथ ChatGPT! और miniGPT4, StableLM, तथा MOSS जैसे कई अन्य समर्थित LM।

    3,347+0पिछले 7 दिनों में स्टार का बदलाव
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking: स्केलेबल रीइंफोर्समेंट लर्निंग के साथ बहुमुखी मल्टीमॉडल रीज़निंग की ओर

    2,379+2पिछले 7 दिनों में स्टार का बदलाव
  • InternVideo@OpenGVLab

    [ECCV2024] मल्टीमॉडल समझ के लिए वीडियो फाउंडेशन मॉडल और डेटा

    2,374+5पिछले 7 दिनों में स्टार का बदलाव
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] TSM: कुशल वीडियो समझ के लिए टेम्पोरल शिफ्ट मॉड्यूल

    2,222+1पिछले 7 दिनों में स्टार का बदलाव
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    वीडियो सर्च और समरीकरण (VSS) के लिए NVIDIA AI ब्लूप्रिंट, वास्तविक समय के सत्यापित अलर्ट, विजुअल Q&A और स्वचालित रिपोर्टिंग के साथ वीडियो एनालिटिक्स एजेंट बनाने के लिए एक GPU-त्वरित संदर्भ वास्तुकला है। VSS ब्लूप्रिंट NVIDIA Cosmos जैसे विजन लैंग्वेज मॉडल (VLM), NVIDIA Nemotron जैसे LLM, RAG और NVIDIA NIMs का उपयोग करता है।

    1,840+10पिछले 7 दिनों में स्टार का बदलाव
  • VideoAgent@HKUDS

    VideoAgent: वीडियो समझ, संपादन और रीमेक के लिए ऑल-इन-वन एजेंटिक फ्रेमवर्क

    1,834+65पिछले 7 दिनों में स्टार का बदलाव
  • PaddleVideo@PaddlePaddle

    PaddlePaddle पर आधारित शानदार वीडियो समझ टूलकिट। यह वीडियो डेटा एनोटेशन टूल, हल्के वजन वाले RGB और कंकाल-आधारित एक्शन रिकग्निशन मॉडल, वीडियो टैगिंग और स्पोर्ट्स एक्शन डिटेक्शन के लिए व्यावहारिक अनुप्रयोगों का समर्थन करता है।

    1,702+0पिछले 7 दिनों में स्टार का बदलाव
  • SALMONN@bytedance

    SALMONN परिवार: उन्नत मल्टी-मोडल LLMs का एक सूट

    1,521+3पिछले 7 दिनों में स्टार का बदलाव
  • Lance@bytedance

    छवि और वीडियो को समझने, जनरेट करने और संपादित करने के लिए एक 3B-सक्रिय-पैरामीटर मूल एकीकृत मल्टीमॉडल मॉडल।

    1,334+3पिछले 7 दिनों में स्टार का बदलाव
  • awesome grounding: विज़ुअल ग्राउंडिंग पर शोध पत्रों की एक क्यूरेटेड सूची।

    1,127+0पिछले 7 दिनों में स्टार का बदलाव
  • हाल के कुछ कंप्यूटर विज़न (CV) कार्यों की पेपर सूची

    973+1पिछले 7 दिनों में स्टार का बदलाव
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: यूनिफाइड विजुअल रिप्रेजेंटेशन लार्ज लैंग्वेज मॉडल्स को इमेज और वीडियो समझ के साथ सशक्त बनाता है

    941+0पिछले 7 दिनों में स्टार का बदलाव
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: डुअल मास्किंग के साथ वीडियो मास्क्ड ऑटोएनकोडर्स की स्केलिंग।

    819+3पिछले 7 दिनों में स्टार का बदलाव
  • MiniGPT4-video@Vision-CAIR

    लंबे वीडियो की समझ के लिए Goldfish मॉडल और छोटे वीडियो की समझ के लिए MiniGPT4-video का आधिकारिक कोड

    639+1पिछले 7 दिनों में स्टार का बदलाव
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596पिछले 7 दिनों में स्टार का बदलाव
  • ComfyUI_VLM_nodes@gokayfem

    विज़न-लैंग्वेज मॉडल्स के लिए ComfyUI नोड्स: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V। साथ ही ओपन-वोकैबुलरी डिटेक्शन, SAM2/SAM3 सेगमेंटेशन, वीडियो टेम्पोरल रीजनिंग, llama.cpp के माध्यम से GGUF, और होस्टेड LLM/VLM API।

    588-1पिछले 7 दिनों में स्टार का बदलाव
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS: मोशन एक्सप्रेशंस के साथ वीडियो सेगमेंटेशन के लिए एक लार्ज-स्केल बेंचमार्क

    525+0पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस