vision-language-model
vision-language-model टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31★ 1,309+0पिछले 7 दिनों में स्टार का बदलाव
- #32
लोकतांत्रिक मल्टीमॉडल प्रशिक्षण के लिए पूर्ण रूप से ओपन फ्रेमवर्क
★ 1,195+1पिछले 7 दिनों में स्टार का बदलाव - #33
यह श्रृंखला आपको NLP और Computer Vision की बुनियादी बातों से लेकर Vision-Language Models के अत्याधुनिक स्तर तक की यात्रा पर ले जाएगी।
★ 1,179+0पिछले 7 दिनों में स्टार का बदलाव - #34★ 1,153-25पिछले 7 दिनों में स्टार का बदलाव
- #35
टेक्स्ट-ओनली LLMs के लिए डिज़ाइन किया गया एक विज़न टूलकिट - इमेज Q&A, लॉन्ग-स्क्रीनशॉट OCR, फ्रंटएंड UI रिस्टोरेशन और GUI ऑटोमेशन, जिसमें कई मुख्य एजेंट्स के साथ सहज एकीकरण का विकल्प है
★ 1,136+18पिछले 7 दिनों में स्टार का बदलाव - #36★ 979-1पिछले 7 दिनों में स्टार का बदलाव
- #37
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), अपनी तरह का पहला मॉडल जो ऑब्जेक्ट सेगमेंटेशन मास्क के साथ सहजता से एकीकृत प्राकृतिक भाषा प्रतिक्रियाएं उत्पन्न करने में सक्षम है।
★ 967+0पिछले 7 दिनों में स्टार का बदलाव - #38
[CVPR 2024 Highlight🔥] Chat-UniVi: यूनिफाइड विजुअल रिप्रेजेंटेशन लार्ज लैंग्वेज मॉडल्स को इमेज और वीडियो समझ के साथ सशक्त बनाता है
★ 941+0पिछले 7 दिनों में स्टार का बदलाव - #39
यह रिपॉजिटरी सबसे रोमांचक और प्रभावशाली CVPR 2025 पेपरों का एक क्यूरेटेड संग्रह है। 🔥 [पेपर + कोड + डेमो]
★ 895+1पिछले 7 दिनों में स्टार का बदलाव - #40
[CVPR 2024] Alpha-CLIP: एक CLIP मॉडल जो आपकी इच्छानुसार कहीं भी ध्यान केंद्रित करता है।
★ 875+1पिछले 7 दिनों में स्टार का बदलाव - #41
[dsh] सादे पाठ मॉडल के लिए अधिक शक्तिशाली विजुअल टूलबॉक्स: एक-लाइन इंस्टॉलेशन, सीधे इमेज पेस्ट करके पहचान, एकाधिक इमेज प्रश्नोत्तर, स्क्रीनशॉट से फ्रंटएंड UI बहाلی आदि।
★ 859+20पिछले 7 दिनों में स्टार का बदलाव - #42★ 834+1पिछले 7 दिनों में स्टार का बदलाव
- #43★ 833+4पिछले 7 दिनों में स्टार का बदलाव
- #44★ 832+0पिछले 7 दिनों में स्टार का बदलाव
- #45
लार्ज मॉडल्स (LLMs/VLMs) के युग में रोबोटिक्स डोमेन से संबंधित 3D विजन पेपर्स की एक क्यूरेटेड सूची, जिसमें पेपर्स, कोड और संबंधित वेबसाइटें शामिल हैं।
★ 822+3पिछले 7 दिनों में स्टार का बदलाव - #46
CLIP जैसे विजन-लैंग्वेज मॉडल के लिए बेहतरीन प्रॉम्प्ट/एडेप्टर लर्निंग विधियों की एक क्यूरेटेड सूची।
★ 797+1पिछले 7 दिनों में स्टार का बदलाव - #47
[ICLR 2026] "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model" का आधिकारिक कार्यान्वयन
★ 726+6पिछले 7 दिनों में स्टार का बदलाव - #48★ 678+1पिछले 7 दिनों में स्टार का बदलाव
- #49★ 641-1पिछले 7 दिनों में स्टार का बदलाव
- #50★ 606—पिछले 7 दिनों में स्टार का बदलाव
- #51
🎉 PILOT: प्री-ट्रेंड मॉडल-आधारित निरंतर शिक्षण (Continual Learning) टूलबॉक्स।
★ 601+4पिछले 7 दिनों में स्टार का बदलाव - #52
VQAScore के साथ टेक्स्ट-टू-इमेज/वीडियो/3D मॉडल का मूल्यांकन
★ 600+0पिछले 7 दिनों में स्टार का बदलाव - #53
[CVPR 2026] SpatialVID: स्थानिक एनोटेशन के साथ एक बड़े पैमाने का वीडियो डेटासेट
★ 600+1पिछले 7 दिनों में स्टार का बदलाव - #54
[ECCV2024] स्थानीयकृत विजुअल टोकराइजेशन के साथ ग्राउंडेड मल्टीमॉडल लार्ज लैंग्वेज मॉडल
★ 586+0पिछले 7 दिनों में स्टार का बदलाव - #55
LLaVA-Mini एक एकीकृत बड़ा मल्टीмодальный मॉडल (LMM) है जो छवियों, उच्च-रिज़ॉल्यूशन छवियों और वीडियो की समझ को कुशलता से समर्थन कर सकता है।
★ 577+0पिछले 7 दिनों में स्टार का बदलाव - #56
Cambrian-S: वीडियो में स्थानिक सुपरसेंसिंग की दिशा में
★ 567-1पिछले 7 दिनों में स्टार का बदलाव - #57
Chatbot Arena अब मल्टी-मोडैलिटी के साथ! Multi-Modality Arena आपको इनपुट के रूप में इमेज प्रदान करते हुए विज़न-लैंग्वेज मॉडल की तुलना करने की सुविधा देता है। यह MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 और कई अन्य का समर्थन करता है।
★ 566+0पिछले 7 दिनों में स्टार का बदलाव - #58
Flame एक ओपन-सोर्स मल्टीमॉडल AI सिस्टम है जिसे UI डिज़ाइन मॉकअप को उच्च-गुणवत्ता वाले React कोड में बदलने के लिए डिज़ाइन किया गया है। यह डिज़ाइन और फ्रंट-एंड डेवलपमेंट के बीच की खाई को पाटने के लिए विजन-लैंग्वेज मॉडलिंग, स्वचालित डेटा संश्लेषण और संरचित प्रशिक्षण वर्कफ़्लो का लाभ उठाता है।
★ 562+0पिछले 7 दिनों में स्टार का बदलाव - #59
✨Counting Anything पेपर के लिए कोड और कार्यान्वयन दिशानिर्देश। प्रोजेक्ट पेज: https://mengqi-lei.github.io/count-anything-projectpage/
★ 540+3पिछले 7 दिनों में स्टार का बदलाव