video-understanding
video-understanding टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर video-understanding के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और video-understanding टैग वाली रिपॉजिटरी।
- #1★ 5,150+3पिछले 7 दिनों में स्टार का बदलाव
- #2
टेक्स्ट, इमेज, वीडियो और ऑडियो कार्यों के लिए वन-फॉर-ऑल मल्टीमॉडल मूल्यांकन टूलकिट।
★ 4,390+7पिछले 7 दिनों में स्टार का बदलाव - #3
[CVPR2024 Highlight][VideoChatGPT] वीडियो समझ के साथ ChatGPT! और miniGPT4, StableLM, तथा MOSS जैसे कई अन्य समर्थित LM।
★ 3,347+0पिछले 7 दिनों में स्टार का बदलाव - #4
GLM-4.6V/4.5V/4.1V-Thinking: स्केलेबल रीइंफोर्समेंट लर्निंग के साथ बहुमुखी मल्टीमॉडल रीज़निंग की ओर
★ 2,379+2पिछले 7 दिनों में स्टार का बदलाव - #5
[ECCV2024] मल्टीमॉडल समझ के लिए वीडियो फाउंडेशन मॉडल और डेटा
★ 2,374+5पिछले 7 दिनों में स्टार का बदलाव - #6
[ICCV 2019] TSM: कुशल वीडियो समझ के लिए टेम्पोरल शिफ्ट मॉड्यूल
★ 2,222+1पिछले 7 दिनों में स्टार का बदलाव - #7
वीडियो सर्च और समरीकरण (VSS) के लिए NVIDIA AI ब्लूप्रिंट, वास्तविक समय के सत्यापित अलर्ट, विजुअल Q&A और स्वचालित रिपोर्टिंग के साथ वीडियो एनालिटिक्स एजेंट बनाने के लिए एक GPU-त्वरित संदर्भ वास्तुकला है। VSS ब्लूप्रिंट NVIDIA Cosmos जैसे विजन लैंग्वेज मॉडल (VLM), NVIDIA Nemotron जैसे LLM, RAG और NVIDIA NIMs का उपयोग करता है।
★ 1,840+10पिछले 7 दिनों में स्टार का बदलाव - #8
VideoAgent: वीडियो समझ, संपादन और रीमेक के लिए ऑल-इन-वन एजेंटिक फ्रेमवर्क
★ 1,834+65पिछले 7 दिनों में स्टार का बदलाव - #9
PaddlePaddle पर आधारित शानदार वीडियो समझ टूलकिट। यह वीडियो डेटा एनोटेशन टूल, हल्के वजन वाले RGB और कंकाल-आधारित एक्शन रिकग्निशन मॉडल, वीडियो टैगिंग और स्पोर्ट्स एक्शन डिटेक्शन के लिए व्यावहारिक अनुप्रयोगों का समर्थन करता है।
★ 1,702+0पिछले 7 दिनों में स्टार का बदलाव - #10★ 1,521+3पिछले 7 दिनों में स्टार का बदलाव
- #11
छवि और वीडियो को समझने, जनरेट करने और संपादित करने के लिए एक 3B-सक्रिय-पैरामीटर मूल एकीकृत मल्टीमॉडल मॉडल।
★ 1,334+3पिछले 7 दिनों में स्टार का बदलाव - #12
awesome grounding: विज़ुअल ग्राउंडिंग पर शोध पत्रों की एक क्यूरेटेड सूची।
★ 1,127+0पिछले 7 दिनों में स्टार का बदलाव - #13
हाल के कुछ कंप्यूटर विज़न (CV) कार्यों की पेपर सूची
★ 973+1पिछले 7 दिनों में स्टार का बदलाव - #14
[CVPR 2024 Highlight🔥] Chat-UniVi: यूनिफाइड विजुअल रिप्रेजेंटेशन लार्ज लैंग्वेज मॉडल्स को इमेज और वीडियो समझ के साथ सशक्त बनाता है
★ 941+0पिछले 7 दिनों में स्टार का बदलाव - #15
[CVPR 2023] VideoMAE V2: डुअल मास्किंग के साथ वीडियो मास्क्ड ऑटोएनकोडर्स की स्केलिंग।
★ 819+3पिछले 7 दिनों में स्टार का बदलाव - #16
लंबे वीडियो की समझ के लिए Goldfish मॉडल और छोटे वीडियो की समझ के लिए MiniGPT4-video का आधिकारिक कोड
★ 639+1पिछले 7 दिनों में स्टार का बदलाव - #17★ 596—पिछले 7 दिनों में स्टार का बदलाव
- #18
विज़न-लैंग्वेज मॉडल्स के लिए ComfyUI नोड्स: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V। साथ ही ओपन-वोकैबुलरी डिटेक्शन, SAM2/SAM3 सेगमेंटेशन, वीडियो टेम्पोरल रीजनिंग, llama.cpp के माध्यम से GGUF, और होस्टेड LLM/VLM API।
★ 588-1पिछले 7 दिनों में स्टार का बदलाव - #19
[ICCV 2023 & TPAMI 2025] MeViS: मोशन एक्सप्रेशंस के साथ वीडियो सेगमेंटेशन के लिए एक लार्ज-स्केल बेंचमार्क
★ 525+0पिछले 7 दिनों में स्टार का बदलाव