multimodal-large-language-models
multimodal-large-language-models टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर multimodal-large-language-models के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और multimodal-large-language-models टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स पर नवीनतम प्रगति।
★ 17,996+2पिछले 7 दिनों में स्टार का बदलाव - #2
Mobile-Agent: 강력한 GUI Agent 패밀리
★ 9,157+9पिछले 7 दिनों में स्टार का बदलाव - #3
StarVector SVG जनरेशन के लिए एक फाउंडेशन मॉडल है जो वैक्टराइजेशन को कोड जनरेशन टास्क में बदलता है। विजन-लैंग्वेज मॉडलिंग आर्किटेक्चर का उपयोग करते हुए, StarVector असाधारण सटीकता के साथ उच्च गुणवत्ता वाला SVG कोड बनाने के लिए विजुअल और टेक्स्टुअल दोनों इनपुट को प्रोसेस करता है।
★ 4,567+6पिछले 7 दिनों में स्टार का बदलाव - #4
LLaMA-Omni, Llama-3.1-8B-Instruct पर आधारित एक कम-विलंबता और उच्च-गुणवत्ता वाला एंड-टू-एंड स्पीच इंटरेक्शन मॉडल है, जिसका उद्देश्य GPT-4o स्तर की स्पीच क्षमताएं प्राप्त करना है।
★ 3,147+1पिछले 7 दिनों में स्टार का बदलाव - #5
CV मॉडल और mLLM पर आधारित एक क्रॉस-प्लेटफ़ॉर्म वीडियो स्ट्रक्चरिंग (वीडियो विश्लेषण) फ्रेमवर्क।
★ 2,933+0पिछले 7 दिनों में स्टार का बदलाव - #6★ 2,532-1पिछले 7 दिनों में स्टार का बदलाव
- #7
mPLUG-DocOwl: दस्तावेज़ को समझने के लिए मॉड्यूलर मल्टीमॉडल लार्ज लैंग्वेज मॉडल
★ 2,411+0पिछले 7 दिनों में स्टार का बदलाव - #8★ 2,014+1पिछले 7 दिनों में स्टार का बदलाव
- #9
[ICML 2024] टेक्स्ट-टू-इमेज डिफ्यूजन में महारत: मल्टीमॉडल LLM (RPG) के साथ रीकैप्शनिंग, प्लानिंग और जेनरेशन
★ 1,844+0पिछले 7 दिनों में स्टार का बदलाव - #10
Seed1.5-VL, एक विजन-लैंग्वेज फाउंडेशन मॉडल है जिसे सामान्य-उद्देश्य मल्टीमॉडल समझ और तर्क को आगे बढ़ाने के लिए डिज़ाइन किया गया है, जो 60 में से 38 सार्वजनिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है
★ 1,586+0पिछले 7 दिनों में स्टार का बदलाव - #11
एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) आर्किटेक्चर, जिसे दृश्य और पाठ्य एम्बेडिंग को संरचनात्मक रूप से संरेखित करने के लिए डिज़ाइन किया गया है।
★ 1,514+2पिछले 7 दिनों में स्टार का बदलाव - #12
शानदार Unified Multimodal Models की सूची
★ 1,314+1पिछले 7 दिनों में स्टार का बदलाव - #13
रीयल-टाइम वॉयस इंटरैक्टिव डिजिटल ह्यूमन, कस्टमाइज़ करने योग्य रूप और आवाज़, वॉयस क्लोनिंग का समर्थन करता है, जिसमें प्रारंभिक पैकेज विलंबता 3s जितनी कम है।
★ 1,303-1पिछले 7 दिनों में स्टार का बदलाव - #14
Audio Flamingo का PyTorch कार्यान्वयन: उन्नत ऑडियो समझ भाषा मॉडल की श्रृंखला
★ 1,184+2पिछले 7 दिनों में स्टार का बदलाव - #15
लार्ज लैंग्वेज मॉडल के साथ स्पीच, लैंग्वेज, ऑडियो और म्यूजिक प्रोसेसिंग के लिए एक फ्रेमवर्क।
★ 1,058+2पिछले 7 दिनों में स्टार का बदलाव - #16★ 1,053+0पिछले 7 दिनों में स्टार का बदलाव
- #17
मल्टीमोडल चेन-ऑफ-थॉट रीजनिंग: एक व्यापक सर्वेक्षण
★ 1,025+2पिछले 7 दिनों में स्टार का बदलाव - #18
मेडिकल इमेजिंग में मल्टी-मोडल लर्निंग के अनुप्रयोगों पर संसाधनों का एक संग्रह
★ 975+1पिछले 7 दिनों में स्टार का बदलाव - #19★ 889+0पिछले 7 दिनों में स्टार का बदलाव
- #20
✨✨[CVPR 2025] Video-MME: वीडियो विश्लेषण में मल्टी-मॉडल LLMs का पहला व्यापक मूल्यांकन बेंचमार्क
★ 791+2पिछले 7 दिनों में स्टार का बदलाव - #21
LLaVA-Plus: बड़े भाषा और विजन सहायक जो कौशल का उपयोग करना प्लग और सीख सकते हैं
★ 770+0पिछले 7 दिनों में स्टार का बदलाव - #22★ 706+0पिछले 7 दिनों में स्टार का बदलाव
- #23★ 702+0पिछले 7 दिनों में स्टार का बदलाव
- #24
पर्सनल प्रोजेक्ट: MPP-Qwen14B और MPP-Qwen-Next (Qwen-LM पर आधारित मल्टीमॉडल पाइपलाइन पैरेलल)। [वीडियो/इमेज/मल्टी-इमेज] {sft/conversations} का समर्थन करता है। अपनी कल्पना को सीमित न होने दें! RTX3090/4090 24GB पर अपना खुद का 8B/14B LLaVA-ट्रेनिंग जैसा MLLM ट्रेन करें।
★ 687+0पिछले 7 दिनों में स्टार का बदलाव - #25★ 678+0पिछले 7 दिनों में स्टार का बदलाव
- #26
Woodpecker: मल्टीमॉडल लार्ज लैंग्वेज मॉडल के लिए हेलुसिनेशन करेक्शन
★ 650+1पिछले 7 दिनों में स्टार का बदलाव - #27
(IJCV द्वारा स्वीकृत) Liquid: भाषा मॉडल स्केलेबल और एकीकृत मल्टी-मोडल जेनरेटर हैं
★ 640+0पिछले 7 दिनों में स्टार का बदलाव - #28
NeurIPS 2024 पेपर: अंडरस्टैंडिंग, जनरेटिंग, सेगमेंटिंग और एडिटिंग के लिए एक यूनिफाइड पिक्सेल-लेवल विजन LLM
★ 577+1पिछले 7 दिनों में स्टार का बदलाव - #29
LLaVA-Mini एक एकीकृत बड़ा मल्टीмодальный मॉडल (LMM) है जो छवियों, उच्च-रिज़ॉल्यूशन छवियों और वीडियो की समझ को कुशलता से समर्थन कर सकता है।
★ 577+0पिछले 7 दिनों में स्टार का बदलाव - #30
Cambrian-S: वीडियो में स्थानिक सुपरसेंसिंग की दिशा में
★ 567-1पिछले 7 दिनों में स्टार का बदलाव