vision-language-model
vision-language-model टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर vision-language-model के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और vision-language-model टैग वाली रिपॉजिटरी।
- #1★ 1,153
- #2
टेक्स्ट-ओनली LLMs के लिए डिज़ाइन किया गया एक विज़न टूलकिट - इमेज Q&A, लॉन्ग-स्क्रीनशॉट OCR, फ्रंटएंड UI रिस्टोरेशन और GUI ऑटोमेशन, जिसमें कई मुख्य एजेंट्स के साथ सहज एकीकरण का विकल्प है
★ 1,136 - #3
[dsh] सादे पाठ मॉडल के लिए अधिक शक्तिशाली विजुअल टूलबॉक्स: एक-लाइन इंस्टॉलेशन, सीधे इमेज पेस्ट करके पहचान, एकाधिक इमेज प्रश्नोत्तर, स्क्रीनशॉट से फ्रंटएंड UI बहाلی आदि।
★ 856 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
[NeurIPS'23 Oral] GPT-4V स्तर की क्षमताओं और उससे आगे की ओर निर्मित Visual Instruction Tuning (LLaVA)।
★ 25,014+9पिछले 7 दिनों में स्टार का बदलाव - #2
X-AnyLabeling: टेक्स्ट, इमेज, वीडियो और मल्टीमोडल डेटा को एनोटेट करने के लिए एक हल्का, कुशल और एकीकृत क्रॉस-प्लेटफॉर्म डेस्कटॉप एप्लिकेशन, जो अत्याधुनिक AI मॉडल और लचीले मल्टी-फॉर्मेट एक्सपोर्ट के साथ बहुमुखी अंतर्निहित टूल को जोड़ता है।
★ 10,313+59पिछले 7 दिनों में स्टार का बदलाव - #3
[CVPR 2024 Oral] InternVL Family: GPT-4o का एक अग्रणी ओपन-सोर्स विकल्प। GPT-4o जैसा प्रदर्शन देने वाला ओपन-सोर्स मल्टीमॉडल वार्ता मॉडल
★ 10,150+3पिछले 7 दिनों में स्टार का बदलाव - #4
👀 सिर्फ़ 2 घंटे में शुरुआत से 65M-पैरामीटर VLM ट्रेन करें!
★ 8,535+40पिछले 7 दिनों में स्टार का बदलाव - #5
Alibaba Cloud द्वारा प्रस्तावित Qwen-VL (通义千问-VL) चैट और प्रीट्रेन्ड लार्ज विज़न लैंग्वेज मॉडल का आधिकारिक रेपो।
★ 6,727+1पिछले 7 दिनों में स्टार का बदलाव - #6
MineContext आपका सक्रिय संदर्भ-जागरूक AI पार्टनर है (Context-Engineering+ChatGPT Pulse)
★ 5,497+1पिछले 7 दिनों में स्टार का बदलाव - #7
MLX-VLM MLX का उपयोग करके आपके Mac पर विजन लैंग्वेज मॉडल (VLMs) के अनुमान और फ़ाइन-ट्यूनिंग के लिए एक पैकेज है।
★ 5,462+25पिछले 7 दिनों में स्टार का बदलाव - #8
Align Anything: फीडबैक के साथ ऑल-मोडैलिटी मॉडल को प्रशिक्षित करना
★ 4,671+3पिछले 7 दिनों में स्टार का बदलाव - #9
टेक्स्ट, इमेज, वीडियो और ऑडियो कार्यों के लिए वन-फॉर-ऑल मल्टीमॉडल मूल्यांकन टूलकिट।
★ 4,390+7पिछले 7 दिनों में स्टार का बदलाव - #10
DeepSeek-VL: वास्तविक दुनिया की विज़न-लैंग्वेज समझ की ओर।
★ 4,177+2पिछले 7 दिनों में स्टार का बदलाव - #11
Linear Attention पर आधारित लार्ज-लैंग्वेज-मॉडल और विजन-लैंग्वेज-मॉडल, MiniMax-Text-01 और MiniMax-VL-01 की आधिकारिक रिपॉजिटरी
★ 3,467+0पिछले 7 दिनों में स्टार का बदलाव - #12
"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models" का आधिकारिक रिपॉजिटरी
★ 3,327+0पिछले 7 दिनों में स्टार का बदलाव - #13
विज़न कार्यों के लिए बेहतरीन vision-language मॉडल्स का संग्रह
★ 3,126+0पिछले 7 दिनों में स्टार का बदलाव - #14
ऑफ़लाइन AI का स्विस आर्मी नाइफ। अपने फ़ोन या Mac पर चैट करें, देखें, बोलें और इमेज जनरेट करें — GGUF LLMs, विजन, Whisper स्पीच-टू-टेक्स्ट, Stable Diffusion, टूल कॉलिंग और लोकल-नेटवर्क सर्वर। आपके CPU, GPU या NPU पर चलता है। कोई खाता नहीं, कोई API की नहीं, शून्य डेटा आपके डिवाइस से बाहर जाता है।
★ 3,038+17पिछले 7 दिनों में स्टार का बदलाव - #15
InternLM-XComposer2.5-OmniLive: लॉन्ग-टर्म स्ट्रीमिंग वीडियो और ऑडियो इंटरैक्शन के लिए एक व्यापक मल्टीमॉडल सिस्टम
★ 2,925-1पिछले 7 दिनों में स्टार का बदलाव - #16
ColVision मॉडल (जैसे ColPali, ColQwen2, और ColSmol) के साथ ट्रेनिंग और इन्फ्रेंस चलाने के लिए इस्तेमाल किया जाने वाला कोड।
★ 2,809+7पिछले 7 दिनों में स्टार का बदलाव - #17
Cradle फ़्रेमवर्क General Computer Control (GCC) का पहला प्रयास है। Cradle न्यूनतम आवश्यकताओं के साथ एक मानकीकृत सामान्य वातावरण में मजबूत तर्क क्षमताओं, स्व-सुधार और कौशल क्यूरेशन को सक्षम करके एजेंटों को किसी भी कंप्यूटर कार्य में उत्कृष्टता प्राप्त करने का समर्थन करता है।
★ 2,578+2पिछले 7 दिनों में स्टार का बदलाव - #18
Alibaba Cloud द्वारा Qwen-VL सीरीज़ को फाइन-ट्यून करने के लिए एक ओपन-सोर्स कार्यान्वयन।
★ 1,961+1पिछले 7 दिनों में स्टार का बदलाव - #19
[CVPR 2025] GUI एजेंट और कंप्यूटर उपयोग के लिए ओपन-सोर्स, एंड-टू-एंड, विजन-लैंग्वेज-एक्शन मॉडल।
★ 1,896+2पिछले 7 दिनों में स्टार का बदलाव - #20
स्वायत्त ड्राइविंग (LLM4AD) संसाधनों के लिए भयानक LLM/VLM/VLA/वर्ल्ड मॉडल की एक क्यूरेटेड सूची (लगातार अपडेट की जाती है)
★ 1,890-2पिछले 7 दिनों में स्टार का बदलाव - #21
वीडियो सर्च और समरीकरण (VSS) के लिए NVIDIA AI ब्लूप्रिंट, वास्तविक समय के सत्यापित अलर्ट, विजुअल Q&A और स्वचालित रिपोर्टिंग के साथ वीडियो एनालिटिक्स एजेंट बनाने के लिए एक GPU-त्वरित संदर्भ वास्तुकला है। VSS ब्लूप्रिंट NVIDIA Cosmos जैसे विजन लैंग्वेज मॉडल (VLM), NVIDIA Nemotron जैसे LLM, RAG और NVIDIA NIMs का उपयोग करता है।
★ 1,840+10पिछले 7 दिनों में स्टार का बदलाव - #22
Advanced Literate Machinery की दिशा में मूल, नवीन विचारों और एल्गोरिदम का एक संग्रह। इस प्रोजेक्ट का रखरखाव Alibaba Group के Tongyi Lab की OCR टीम द्वारा किया जाता है।
★ 1,835+1पिछले 7 दिनों में स्टार का बदलाव - #23
Seed1.5-VL, एक विजन-लैंग्वेज फाउंडेशन मॉडल है जिसे सामान्य-उद्देश्य मल्टीमॉडल समझ और तर्क को आगे बढ़ाने के लिए डिज़ाइन किया गया है, जो 60 में से 38 सार्वजनिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है
★ 1,586+0पिछले 7 दिनों में स्टार का बदलाव - #24
Apple Silicon के लिए हाई-परफॉरमेंस OpenAI और Anthropic संगत LLM इन्फेरेंस सर्वर। नेटिव MLX, निरंतर बैचिंग, मल्टीमॉडल मॉडल, MCP टूल कॉलिंग, और Claude Code समर्थन।
★ 1,557+6पिछले 7 दिनों में स्टार का बदलाव - #25★ 1,524+0पिछले 7 दिनों में स्टार का बदलाव
- #26
[ICCV 2025] Describe Anything के लिए इम्प्लीमेंटेशन: विस्तृत स्थानीयकृत इमेज और वीडियो कैप्शनिंग
★ 1,517+3पिछले 7 दिनों में स्टार का बदलाव - #27
एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) आर्किटेक्चर, जिसे दृश्य और पाठ्य एम्बेडिंग को संरचनात्मक रूप से संरेखित करने के लिए डिज़ाइन किया गया है।
★ 1,514+2पिछले 7 दिनों में स्टार का बदलाव - #28
जापानी LLM सारांश - जापानी LLM का अवलोकन
★ 1,428+1पिछले 7 दिनों में स्टार का बदलाव - #29
Apple Silicon वाले Mac पर LLM को फाइन-ट्यून करें। SFT, DPO, GRPO, Vision, TTS, STT, Embedding और OCR फाइन-ट्यूनिंग — MLX पर नेटिव रूप से। Unsloth-compatible API।
★ 1,398+8पिछले 7 दिनों में स्टार का बदलाव - #30
शानदार Unified Multimodal Models की सूची
★ 1,314+1पिछले 7 दिनों में स्टार का बदलाव