vision-language
vision-language टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर vision-language के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और vision-language टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
[ECCV 2024] पेपर का आधिकारिक कार्यान्वयन "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"
★ 10,536+14पिछले 7 दिनों में स्टार का बदलाव - #2
CLIP का चीनी संस्करण जो चीनी क्रॉस-मोडल पुनर्प्राप्ति और प्रतिनिधित्व पीढ़ी को प्राप्त करता है।
★ 6,001+1पिछले 7 दिनों में स्टार का बदलाव - #3
OFA (ICML 2022) की आधिकारिक रिपॉजिटरी। पेपर: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2,557+0पिछले 7 दिनों में स्टार का बदलाव - #4
Alibaba Cloud द्वारा Qwen-VL सीरीज़ को फाइन-ट्यून करने के लिए एक ओपन-सोर्स कार्यान्वयन।
★ 1,961+1पिछले 7 दिनों में स्टार का बदलाव - #5
Advanced Literate Machinery की दिशा में मूल, नवीन विचारों और एल्गोरिदम का एक संग्रह। इस प्रोजेक्ट का रखरखाव Alibaba Group के Tongyi Lab की OCR टीम द्वारा किया जाता है।
★ 1,835+1पिछले 7 दिनों में स्टार का बदलाव - #6
[ACL 2024 🔥] Video-ChatGPT एक वीडियो वार्तालाप मॉडल है जो वीडियो के बारे में सार्थक बातचीत उत्पन्न करने में सक्षम है। यह स्थानिक-अस्थायी वीडियो प्रतिनिधित्व के लिए अनुकूलित एक प्री-ट्रेनेड विजुअल एनकोडर के साथ LLM की क्षमताओं को जोड़ता है। हम वीडियो-आधारित संवादात्मक मॉडल के लिए एक कठोर 'मात्रात्मक मूल्यांकन बेंचमार्किंग' भी पेश करते हैं।
★ 1,507+1पिछले 7 दिनों में स्टार का बदलाव - #7
जापानी LLM सारांश - जापानी LLM का अवलोकन
★ 1,428+1पिछले 7 दिनों में स्टार का बदलाव - #8★ 1,340+1पिछले 7 दिनों में स्टार का बदलाव
- #9
विज़न, ऑडियो और भाषा मोडैलिटीज़ के लिए एक सामान्य प्रतिनिधित्व मॉडल। पेपर: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0पिछले 7 दिनों में स्टार का बदलाव - #10
छोटे पैमाने के लार्ज मल्टीमॉडल मॉडल्स का एक फ्रेमवर्क
★ 1,004+1पिछले 7 दिनों में स्टार का बदलाव - #11
CALVIN - लॉन्ग-होरिजोन रोबोट मैनिपुलेशन कार्यों के लिए लैंग्वेज-कंडीशंड पॉलिसी लर्निंग हेतु एक बेंचमार्क।
★ 983+8पिछले 7 दिनों में स्टार का बदलाव - #12
[CVPR 2024] Alpha-CLIP: एक CLIP मॉडल जो आपकी इच्छानुसार कहीं भी ध्यान केंद्रित करता है।
★ 874+0पिछले 7 दिनों में स्टार का बदलाव - #13
यह Grounding DINO पेपर का थर्ड-पार्टी कार्यान्वयन है: ओपन-सेट ऑब्जेक्ट डिटेक्शन के लिए DINO को ग्राउंडेड प्री-ट्रेनिंग के साथ जोड़ना।
★ 846+2पिछले 7 दिनों में स्टार का बदलाव - #14
🔥🔥 LLaVA++: Phi-3 और LLaMA-3 के साथ LLaVA का विस्तार (LLaVA LLaMA-3, LLaVA Phi-3)
★ 842+0पिछले 7 दिनों में स्टार का बदलाव - #15
[ICLR 2024] यूनिवर्सल इमेज रिस्टोरेशन के लिए विजन-लैंग्वेज मॉडल को नियंत्रित करना। NTIRE 2024 रिस्टोर एनी इमेज मॉडल इन द वाइल्ड चैलेंज में 5वां स्थान।
★ 817+1पिछले 7 दिनों में स्टार का बदलाव - #16★ 641-1पिछले 7 दिनों में स्टार का बदलाव
- #17
🛰️ पेपर "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS) की आधिकारिक रिपॉजिटरी
★ 591+4पिछले 7 दिनों में स्टार का बदलाव - #18★ 588—पिछले 7 दिनों में स्टार का बदलाव