FoundationVision
FoundationVision की ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #1
[NeurIPS 2024 बेस्ट पेपर अवार्ड][GPT बीट्स डिफ्यूजन🔥] [विजुअल जनरेशन में स्केलिंग कानून📈] "विजुअल ऑटोरेग्रेसिव मॉडलिंग: नेक्स्ट-स्कôi प्रेडिक्शन के माध्यम से स्केलेबल इमेज जनरेशन" का आधिकारिक कार्यान्वयन। ऑटोरेग्रेसिव इमेज जनरेशन के लिए एक *अति-सरल, उपयोगकर्ता के अनुकूल और अत्याधुनिक* कोडिंग बेस!
★ 8,728-1पिछले 7 दिनों में स्टार का बदलाव - #2
[ECCV 2022] ByteTrack: प्रत्येक डिटेक्शन बॉक्स को जोड़कर मल्टी-ऑब्जेक्ट ट्रैकिंग
★ 6,662+4पिछले 7 दिनों में स्टार का बदलाव - #3
ऑटोरिग्रेसिव मॉडल ने डिफ्यूजन को पछाड़ा: स्केलेबल इमेज जनरेशन के लिए 🦙 Llama
★ 1,966+0पिछले 7 दिनों में स्टार का बदलाव - #4
[CVPR 2025 Oral] Infinity ∞ : उच्च-रिज़ॉल्यूशन छवि संश्लेषण (Image Synthesis) के लिए स्केलिंग बिटवाइज़ ऑटोरिग्रेसिव मॉडलिंग
★ 1,587+0पिछले 7 दिनों में स्टार का बदलाव - #5
[CVPR2024 Highlight] GLEE: बड़े पैमाने पर छवियों और वीडियो के लिए जनरल ऑब्जेक्ट फाउंडेशन मॉडल
★ 1,170+0पिछले 7 दिनों में स्टार का बदलाव - #6
यूनिफाइड टेक्स्ट-टू-वीडियो (T2V) और इमेज-टू-वीडियो (I2V) जनरेशन के लिए इंडस्ट्री-लेवल वीडियो फाउंडेशन मॉडल
★ 952+0पिछले 7 दिनों में स्टार का बदलाव - #7
[NeurIPS 2025 Oral] Infinity⭐️: विज़ुअल जनरेशन के लिए यूनिफाइड स्पेसटाइम ऑटोरेग्रेसिव मॉडलिंग
★ 784+5पिछले 7 दिनों में स्टार का बदलाव - #8
(IJCV द्वारा स्वीकृत) Liquid: भाषा मॉडल स्केलेबल और एकीकृत मल्टी-मोडल जेनरेटर हैं
★ 640+0पिछले 7 दिनों में स्टार का बदलाव - #9
[ECCV2024] स्थानीयकृत विजुअल टोकराइजेशन के साथ ग्राउंडेड मल्टीमॉडल लार्ज लैंग्वेज मॉडल
★ 586+0पिछले 7 दिनों में स्टार का बदलाव - #10
[NeurIPS 2025 Spotlight] विजुअल जनरेशन और अंडरस्टैंडिंग के लिए एक एकीकृत टोकनाइज़र
★ 529-1पिछले 7 दिनों में स्टार का बदलाव