video-generation
video-generation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #91
टेक्स्ट और इमेज से वीडियो जनरेशन, पहली पीढ़ी
★ 919-2पिछले 7 दिनों में स्टार का बदलाव - #92
[AAAI 2025] Follow-Your-Click: यह रिपॉजिटरी "Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts" का आधिकारिक कार्यान्वयन है।
★ 908-1पिछले 7 दिनों में स्टार का बदलाव - #93★ 896+1पिछले 7 दिनों में स्टार का बदलाव
- #94
[ACM MM 2025] Ditto: नियंत्रित रीयलटाइम टॉकिंग हेड सिंथेसिस के लिए मोशन-स्पेस डिफ्यूजन
★ 881+10पिछले 7 दिनों में स्टार का बदलाव - #95
[ICLR2026] SeedVR2: डिफ्यूजन एडवरसैरियल पोस्ट-ट्रेनिंग के माध्यम से वन-स्टेप वीडियो रिस्टोरेशन
★ 867+13पिछले 7 दिनों में स्टार का बदलाव - #96
[CVPR 2025 Highlight🔥] फ्रीक्वेंसी डिकंपोजिशन द्वारा आइडेंटिटी-प्रिजर्विंग टेक्स्ट-टू-वीडियो जनरेशन।
★ 857+2पिछले 7 दिनों में स्टार का बदलाव - #97
UniAnimate-DiT: लार्ज-स्केल वीडियो डिफ्यूजन ट्रांसफॉर्मर के साथ ह्यूमन इमेज एनिमेशन
★ 850-2पिछले 7 दिनों में स्टार का बदलाव - #98
इमेज, वीडियो, ऑडियो, टेक्स्ट, क्रेडिट और मॉडल डिस्कवरी के लिए फ्लैटकी मीडिया जनरेशन CLI।
★ 845+211पिछले 7 दिनों में स्टार का बदलाव - #99
[SIGGRAPH 2025] डिफ्यूजन एज़ शेडर: बहुमुखी वीडियो जनरेशन कंट्रोल के लिए 3D-अवेयर वीडियो डिफ्यूजन
★ 834+3पिछले 7 दिनों में स्टार का बदलाव - #100
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers (ICML 2025), UltraViCo (ICLR 2026) और UltraImage के लिए आधिकारिक कार्यान्वयन
★ 827+2पिछले 7 दिनों में स्टार का बदलाव - #101
एक सरल, एकीकृत मल्टीमॉडल मॉडल ट्रेनिंग इंजन। लीन, फ्लेक्सिबल और बड़े पैमाने पर हैकिंग के लिए बनाया गया।
★ 825+1पिछले 7 दिनों में स्टार का बदलाव - #102
Kandinsky 5.0: वीडियो और इमेज जनरेशन के लिए डिफ्यूजन मॉडल्स का एक परिवार।
★ 822+6पिछले 7 दिनों में स्टार का बदलाव - #103
AI का उपयोग करके टेक्स्ट से वीडियो जनरेट करें।
★ 821+7पिछले 7 दिनों में स्टार का बदलाव - #104
एक इमेज या टेक्स्ट प्रॉम्प्ट से उच्च-गुणवत्ता वाले पैनोरमा वीडियो के साथ बड़े पैमाने पर एक्सप्लोरेबल 3D दृश्य उत्पन्न करें।
★ 816+12पिछले 7 दिनों में स्टार का बदलाव - #105
[TMLR 2025🔥] विजन में ऑटोरिग्रेसिव मॉडल के लिए एक सर्वेक्षण।
★ 808+1पिछले 7 दिनों में स्टार का बदलाव - #106
Open-WebUI Tools एक मॉड्यूलर टूलकिट है जिसे Open WebUI इंस्टेंस को विस्तारित और समृद्ध करने के लिए डिज़ाइन किया गया है, जो इसे एक शक्तिशाली AI वर्कस्टेशन में बदल देता है। 15 से अधिक विशेष टूल्स, फंक्शन पाइपलाइन्स और फिल्टर्स के साथ, यह प्रोजेक्ट शैक्षणिक अनुसंधान, एजेंटिक स्वायत्तता, मल्टीमॉडल क्रिएटिविटी और वर्कफ़्लो का समर्थन करता है।
★ 807+6पिछले 7 दिनों में स्टार का बदलाव - #107
[CVPR 2024 Highlight] GenAD: ऑटोनॉमस ड्राइविंग के लिए जनरलाइज़्ड प्रेडिक्टिव मॉडल
★ 805+0पिछले 7 दिनों में स्टार का बदलाव - #108
rCM और Causal-rCM: बड़े पैमाने पर द्विदिश/ऑटोरिग्र्रेसिव वीडियो डिफ्यूजन डिस्टिलेशन के लिए अग्रणी और एकीकृत एल्गोरिदम/इन्फ्रास्ट्रक्चर।
★ 800+6पिछले 7 दिनों में स्टार का बदलाव - #109
[NeurIPS 2025 Oral] Infinity⭐️: विज़ुअल जनरेशन के लिए यूनिफाइड स्पेसटाइम ऑटोरेग्रेसिव मॉडलिंग
★ 784+5पिछले 7 दिनों में स्टार का बदलाव - #110
शानदार वीडियो जनरेशन अध्ययनों का एक संग्रह।
★ 783+1पिछले 7 दिनों में स्टार का बदलाव - #111
[ICML 2024] MagicPose (जिसे MagicDance भी कहा जाता है): आइडेंटिटी-अवेयर डिफ्यूजन के साथ यथार्थवादी मानव पोज़ और चेहरे के भावों का रीटार्गेटिंग
★ 777+1पिछले 7 दिनों में स्टार का बदलाव - #112
लोगों और कोडिंग एजेंटों के लिए लोकल-फर्स्ट विजुअल जनरेशन रनटाइम और स्टूडियो, जिसमें कई प्रदाताओं के बीच पुनरुत्पादक इमेज और वीडियो वर्कफ़्लो शामिल हैं।
★ 751+32पिछले 7 दिनों में स्टार का बदलाव - #113
टेक्स्ट-टू-वीडियो जनरेशन/सिंथेसिस पर एक सर्वेक्षण।
★ 744+3पिछले 7 दिनों में स्टार का बदलाव - #114
Cosmos-Predict2.5 पर निर्मित Cosmos-Transfer2.5, जो कई स्थानिक नियंत्रण इनपुट के आधार पर उच्च-गुणवत्ता वाले वर्ल्ड सिमुलेशन तैयार करता है।
★ 736+7पिछले 7 दिनों में स्टार का बदलाव - #115
[ICCV 2025] पेपर का आधिकारिक कार्यान्वयन “MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control”
★ 729+1पिछले 7 दिनों में स्टार का बदलाव - #116
वर्ल्ड मॉडल साइंस को आगे बढ़ाने के लिए एक न्यूनतम, सभी सुविधाओं से युक्त रिपॉजिटरी।
★ 729+10पिछले 7 दिनों में स्टार का बदलाव - #117
ComfyUI के लिए लोकल-फर्स्ट, एजेंट-नेटिव कंट्रोल प्लेन — MCP सर्वर और साइडबार एजेंट जो इमेज, वीडियो और ऑडियो जेनरेट करता है, वर्कफ़्लो बनाता और चलाता है, और किसी भी LLM (Claude, ChatGPT, Gemini, ऑफलाइन Ollama, या कोई भी होस्टेड मॉडल) पर नेचुरल लैंग्वेज में आपके लाइव ग्राफ़ को एडिट करता है। 178 टूल्स, 36 AI स्किल्स, 55 इंस्टॉलर पैक्स। लोकल, LAN, VPS, या Comfy Cloud पर उपलब्ध।
★ 729+35पिछले 7 दिनों में स्टार का बदलाव - #118
[ICML 2025] "History-Guided Video Diffusion" का आधिकारिक PyTorch कार्यान्वयन
★ 709+1पिछले 7 दिनों में स्टार का बदलाव - #119
[ICLR 2026] ChronoEdit: इमेज एडिटिंग और वर्ल्ड सिमुलेशन के लिए टेम्पोरल रीजनिंग की दिशा में
★ 706+1पिछले 7 दिनों में स्टार का बदलाव - #120
[ECCV 2026] SparkVSR: स्पार्स कीफ्रेम प्रोपेगेशन के माध्यम से इंटरैक्टिव वीडियो सुपर-रिज़ॉल्यूशन
★ 702+3पिछले 7 दिनों में स्टार का बदलाव