मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · multimodal-large-language-models

multimodal-large-language-models

multimodal-large-language-models टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
32
कुल स्टार
66,902
औसत स्टार
2,091
हिस्सा
0.00%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर multimodal-large-language-models के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और multimodal-large-language-models टैग वाली रिपॉजिटरी।

पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।

  • मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स पर नवीनतम प्रगति।

    17,996+2पिछले 7 दिनों में स्टार का बदलाव
  • MobileAgent@X-PLUG

    Mobile-Agent: 강력한 GUI Agent 패밀리

    9,157+9पिछले 7 दिनों में स्टार का बदलाव
  • star-vector@joanrod

    StarVector SVG जनरेशन के लिए एक फाउंडेशन मॉडल है जो वैक्टराइजेशन को कोड जनरेशन टास्क में बदलता है। विजन-लैंग्वेज मॉडलिंग आर्किटेक्चर का उपयोग करते हुए, StarVector असाधारण सटीकता के साथ उच्च गुणवत्ता वाला SVG कोड बनाने के लिए विजुअल और टेक्स्टुअल दोनों इनपुट को प्रोसेस करता है।

    4,567+6पिछले 7 दिनों में स्टार का बदलाव
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni, Llama-3.1-8B-Instruct पर आधारित एक कम-विलंबता और उच्च-गुणवत्ता वाला एंड-टू-एंड स्पीच इंटरेक्शन मॉडल है, जिसका उद्देश्य GPT-4o स्तर की स्पीच क्षमताएं प्राप्त करना है।

    3,147+1पिछले 7 दिनों में स्टार का बदलाव
  • VideoPipe@sherlockchou86

    CV मॉडल और mLLM पर आधारित एक क्रॉस-प्लेटफ़ॉर्म वीडियो स्ट्रक्चरिंग (वीडियो विश्लेषण) फ्रेमवर्क।

    2,933+0पिछले 7 दिनों में स्टार का बदलाव
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5: GPT-4o स्तर के रीयल-टाइम विजन और स्पीच इंटरैक्शन की ओर

    2,532-1पिछले 7 दिनों में स्टार का बदलाव
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: दस्तावेज़ को समझने के लिए मॉड्यूलर मल्टीमॉडल लार्ज लैंग्वेज मॉडल

    2,411+0पिछले 7 दिनों में स्टार का बदलाव
  • cambrian@cambrian-mllm

    Cambrian-1 विजन-सेंट्रिक डिज़ाइन वाले मल्टीमॉडल LLM का एक परिवार है।

    2,014+1पिछले 7 दिनों में स्टार का बदलाव
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] टेक्स्ट-टू-इमेज डिफ्यूजन में महारत: मल्टीमॉडल LLM (RPG) के साथ रीकैप्शनिंग, प्लानिंग और जेनरेशन

    1,844+0पिछले 7 दिनों में स्टार का बदलाव
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, एक विजन-लैंग्वेज फाउंडेशन मॉडल है जिसे सामान्य-उद्देश्य मल्टीमॉडल समझ और तर्क को आगे बढ़ाने के लिए डिज़ाइन किया गया है, जो 60 में से 38 सार्वजनिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है

    1,586+0पिछले 7 दिनों में स्टार का बदलाव
  • Ovis@ATH-MaaS

    एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) आर्किटेक्चर, जिसे दृश्य और पाठ्य एम्बेडिंग को संरचनात्मक रूप से संरेखित करने के लिए डिज़ाइन किया गया है।

    1,514+2पिछले 7 दिनों में स्टार का बदलाव
  • शानदार Unified Multimodal Models की सूची

    1,314+1पिछले 7 दिनों में स्टार का बदलाव
  • VideoChat@Henry-23

    रीयल-टाइम वॉयस इंटरैक्टिव डिजिटल ह्यूमन, कस्टमाइज़ करने योग्य रूप और आवाज़, वॉयस क्लोनिंग का समर्थन करता है, जिसमें प्रारंभिक पैकेज विलंबता 3s जितनी कम है।

    1,303-1पिछले 7 दिनों में स्टार का बदलाव
  • Audio Flamingo का PyTorch कार्यान्वयन: उन्नत ऑडियो समझ भाषा मॉडल की श्रृंखला

    1,184+2पिछले 7 दिनों में स्टार का बदलाव
  • SLAM-LLM@X-LANCE

    लार्ज लैंग्वेज मॉडल के साथ स्पीच, लैंग्वेज, ऑडियो और म्यूजिक प्रोसेसिंग के लिए एक फ्रेमवर्क।

    1,058+2पिछले 7 दिनों में स्टार का बदलाव
  • Bunny@BAAI-DCAI

    हल्के मल्टीमॉडल मॉडलों का एक परिवार।

    1,053+0पिछले 7 दिनों में स्टार का बदलाव
  • Awesome-MCoT@yaotingwangofficial

    मल्टीमोडल चेन-ऑफ-थॉट रीजनिंग: एक व्यापक सर्वेक्षण

    1,025+2पिछले 7 दिनों में स्टार का बदलाव
  • मेडिकल इमेजिंग में मल्टी-मोडल लर्निंग के अनुप्रयोगों पर संसाधनों का एक संग्रह

    975+1पिछले 7 दिनों में स्टार का बदलाव
  • NEO@EvolvingLMMs-Lab

    NEO सीरीज: फर्स्ट प्रिंसिपल्स से नेटिव विज़न-लैंग्वेज मॉडल्स

    889+0पिछले 7 दिनों में स्टार का बदलाव
  • Video-MME@MME-Benchmarks

    ✨✨[CVPR 2025] Video-MME: वीडियो विश्लेषण में मल्टी-मॉडल LLMs का पहला व्यापक मूल्यांकन बेंचमार्क

    791+2पिछले 7 दिनों में स्टार का बदलाव
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: बड़े भाषा और विजन सहायक जो कौशल का उपयोग करना प्लग और सीख सकते हैं

    770+0पिछले 7 दिनों में स्टार का बदलाव
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat: लंबे वीडियो को समझने के लिए डेंस टोकन से स्पार्स मेमोरी

    706+0पिछले 7 दिनों में स्टार का बदलाव
  • unicom@deepglint

    लार्ज-स्केल विज़ुअल रिप्रेजेंटेशन मॉडल।

    702+0पिछले 7 दिनों में स्टार का बदलाव
  • MPP-LLaVA@Coobiw

    पर्सनल प्रोजेक्ट: MPP-Qwen14B और MPP-Qwen-Next (Qwen-LM पर आधारित मल्टीमॉडल पाइपलाइन पैरेलल)। [वीडियो/इमेज/मल्टी-इमेज] {sft/conversations} का समर्थन करता है। अपनी कल्पना को सीमित न होने दें! RTX3090/4090 24GB पर अपना खुद का 8B/14B LLaVA-ट्रेनिंग जैसा MLLM ट्रेन करें।

    687+0पिछले 7 दिनों में स्टार का बदलाव
  • OmniVinci@NVlabs

    OmniVinci दृष्टि, ऑडियो और भाषा की संयुक्त समझ के लिए एक सर्व-मोडल LLM है।

    678+0पिछले 7 दिनों में स्टार का बदलाव
  • Woodpecker@VITA-MLLM

    Woodpecker: मल्टीमॉडल लार्ज लैंग्वेज मॉडल के लिए हेलुसिनेशन करेक्शन

    650+1पिछले 7 दिनों में स्टार का बदलाव
  • Liquid@FoundationVision

    (IJCV द्वारा स्वीकृत) Liquid: भाषा मॉडल स्केलेबल और एकीकृत मल्टी-मोडल जेनरेटर हैं

    640+0पिछले 7 दिनों में स्टार का बदलाव
  • Vitron@SkyworkAI

    NeurIPS 2024 पेपर: अंडरस्टैंडिंग, जनरेटिंग, सेगमेंटिंग और एडिटिंग के लिए एक यूनिफाइड पिक्सेल-लेवल विजन LLM

    577+1पिछले 7 दिनों में स्टार का बदलाव
  • LLaVA-Mini@ictnlp

    LLaVA-Mini एक एकीकृत बड़ा मल्टीмодальный मॉडल (LMM) है जो छवियों, उच्च-रिज़ॉल्यूशन छवियों और वीडियो की समझ को कुशलता से समर्थन कर सकता है।

    577+0पिछले 7 दिनों में स्टार का बदलाव
  • cambrian-s@cambrian-mllm

    Cambrian-S: वीडियो में स्थानिक सुपरसेंसिंग की दिशा में

    567-1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस