llava
llava टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर llava के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और llava टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
[NeurIPS'23 Oral] GPT-4V स्तर की क्षमताओं और उससे आगे की ओर निर्मित Visual Instruction Tuning (LLaVA)।
★ 25,014+12पिछले 7 दिनों में स्टार का बदलाव - #2
SUPIR का उद्देश्य इन-द-वाइल्ड फोटो-यथार्थवादी इमेज रिस्टोरेशन के लिए व्यावहारिक एल्गोरिदम विकसित करना है। हमारा नया ऑनलाइन डेमो suppixel.ai पर भी जारी किया गया है।
★ 5,649+0पिछले 7 दिनों में स्टार का बदलाव - #3
MLX-VLM MLX का उपयोग करके आपके Mac पर विजन लैंग्वेज मॉडल (VLMs) के अनुमान और फ़ाइन-ट्यूनिंग के लिए एक पैकेज है।
★ 5,462+41पिछले 7 दिनों में स्टार का बदलाव - #4
लार्ज मल्टी-मोडालिटी मॉडल (LMMs) का ओपन-सोर्स मूल्यांकन टूलकिट, 220+ LMMs, 80+ बेंचमार्क का समर्थन करता है।
★ 4,375+15पिछले 7 दिनों में स्टार का बदलाव - #5★ 3,836+2पिछले 7 दिनों में स्टार का बदलाव
- #6
आपके स्थानीय डिवाइस पर LLM (🦙LLaMA/LLaVA) को कुशलतापूर्वक चलाने के लिए एक C#/.NET लाइब्रेरी।
★ 3,790+3पिछले 7 दिनों में स्टार का बदलाव - #7★ 3,511+46पिछले 7 दिनों में स्टार का बदलाव
- #8★ 2,666+1पिछले 7 दिनों में स्टार का बदलाव
- #9
[ACL 2024 🔥] Video-ChatGPT एक वीडियो वार्तालाप मॉडल है जो वीडियो के बारे में सार्थक बातचीत उत्पन्न करने में सक्षम है। यह स्थानिक-अस्थायी वीडियो प्रतिनिधित्व के लिए अनुकूलित एक प्री-ट्रेनेड विजुअल एनकोडर के साथ LLM की क्षमताओं को जोड़ता है। हम वीडियो-आधारित संवादात्मक मॉडल के लिए एक कठोर 'मात्रात्मक मूल्यांकन बेंचमार्किंग' भी पेश करते हैं।
★ 1,507+1पिछले 7 दिनों में स्टार का बदलाव - #10★ 1,348+2पिछले 7 दिनों में स्टार का बदलाव
- #11
बहुभाषी टेक्स्ट, इमेज और 🔜 वीडियो में कंटेंट को समझने और जनरेट करने के लिए पॉकेट-साइज़ मल्टीमॉडल AI, जो OpenAI CLIP और LLaVA से 5 गुना तक तेज़ है 🖼️ & 🖋️
★ 1,247+2पिछले 7 दिनों में स्टार का बदलाव - #12
लोकतांत्रिक मल्टीमॉडल प्रशिक्षण के लिए पूर्ण रूप से ओपन फ्रेमवर्क
★ 1,195+3पिछले 7 दिनों में स्टार का बदलाव - #13
छोटे पैमाने के लार्ज मल्टीमॉडल मॉडल्स का एक फ्रेमवर्क
★ 1,004+1पिछले 7 दिनों में स्टार का बदलाव - #14
🔥🔥 LLaVA++: Phi-3 और LLaMA-3 के साथ LLaVA का विस्तार (LLaVA LLaMA-3, LLaVA Phi-3)
★ 842+0पिछले 7 दिनों में स्टार का बदलाव - #15★ 794+1पिछले 7 दिनों में स्टार का बदलाव
- #16
Paddle मल्टीमॉडल इंटीग्रेशन और एक्सप्लोरेशन, जो मुख्यधारा के मल्टी-मॉडल कार्यों का समर्थन करता है, जिसमें एंड-टू-एंड लार्ज-स्केल मल्टी-मॉडल प्रीट्रेन मॉडल और डिफ्यूजन मॉडल टूलबॉक्स शामिल हैं। उच्च प्रदर्शन और लचीलेपन से लैस।
★ 724+1पिछले 7 दिनों में स्टार का बदलाव - #17
विज़न-लैंग्वेज मॉडल पेपर और मॉडल्स का एक प्रमुख फ़्रंटएंड कलेक्शन और सर्वे GitHub रिपॉजिटरी। निरंतर अपडेट।
★ 705+5पिछले 7 दिनों में स्टार का बदलाव - #18
👁️ + 💬 + 🎧 = 🤖 शीर्ष फाउंडेशन और मल्टीमॉडल मॉडलों की क्यूरेटेड सूची! [पेपर + कोड + उदाहरण + ट्यूटोरियल]
★ 637+0पिछले 7 दिनों में स्टार का बदलाव - #19
विज़न-लैंग्वेज मॉडल्स के लिए ComfyUI नोड्स: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V। साथ ही ओपन-वोकैबुलरी डिटेक्शन, SAM2/SAM3 सेगमेंटेशन, वीडियो टेम्पोरल रीजनिंग, llama.cpp के माध्यम से GGUF, और होस्टेड LLM/VLM API।
★ 589+1पिछले 7 दिनों में स्टार का बदलाव - #20
LLaVA-Mini एक एकीकृत बड़ा मल्टीмодальный मॉडल (LMM) है जो छवियों, उच्च-रिज़ॉल्यूशन छवियों और वीडियो की समझ को कुशलता से समर्थन कर सकता है।
★ 577+0पिछले 7 दिनों में स्टार का बदलाव - #21
दैनिक कार्यों में सहायता के लिए AI-संचालित असिस्टेंट, जो Llama 3, DeepSeek R1 और HuggingFace पर उपलब्ध कई अन्य मॉडलों द्वारा संचालित है
★ 530+0पिछले 7 दिनों में स्टार का बदलाव