मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · mllm

mllm

mllm टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
36
कुल स्टार
92,155
औसत स्टार
2,560
हिस्सा
0.00%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर mllm के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और mllm टैग वाली रिपॉजिटरी।

  • SenseNova-Vision@OpenSenseNova

    यूनिफाइड मल्टीमॉडल जनरेशन के रूप में विज़न

    682
  • unilm@microsoft

    टास्क, भाषाओं और मोडैलिटीज में बड़े पैमाने पर सेल्फ-सुपरवाइज्ड प्री-ट्रेनिंग

    22,203+7पिछले 7 दिनों में स्टार का बदलाव
  • Agent-S@simular-ai

    Agent S: एक ओपन एजेंटिक फ्रेमवर्क जो कंप्यूटर का उपयोग इंसानों की तरह करता है

    12,219+17पिछले 7 दिनों में स्टार का बदलाव
  • MobileAgent@X-PLUG

    Mobile-Agent: 강력한 GUI Agent 패밀리

    9,157+9पिछले 7 दिनों में स्टार का बदलाव
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM: संरचित इनडोर मॉडलिंग के लिए लार्ज लैंग्वेज मॉडल का प्रशिक्षण

    4,726+3पिछले 7 दिनों में स्टार का बदलाव
  • MagicQuill@robbyant-research

    [CVPR'25] पेपर के लिए आधिकारिक कार्यान्वयन - MagicQuill: एक बुद्धिमान इंटरैक्टिव इमेज एडिटिंग सिस्टम

    3,691+2पिछले 7 दिनों में स्टार का बदलाव
  • चेन-ऑफ़-थॉट प्रॉम्प्टिंग से लेकर OpenAI o1 और DeepSeek-R1 🍓 तक

    3,681+3पिछले 7 दिनों में स्टार का बदलाव
  • NExT-GPT@NExT-GPT

    ICML 2024 पेपर के लिए कोड और मॉडल, NExT-GPT: एनी-टू-एनी मल्टीमॉडल लार्ज लैंग्वेज मॉडल

    3,634-2पिछले 7 दिनों में स्टार का बदलाव
  • Eagle@NVlabs

    Eagle: डेटा-केंद्रित रणनीतियों के साथ फ्रंटियर विजन-लैंग्वेज मॉडल

    3,511+32पिछले 7 दिनों में स्टार का बदलाव
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: लॉन्ग-टर्म स्ट्रीमिंग वीडियो और ऑडियो इंटरैक्शन के लिए एक व्यापक मल्टीमॉडल सिस्टम

    2,925-1पिछले 7 दिनों में स्टार का बदलाव
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: दस्तावेज़ को समझने के लिए मॉड्यूलर मल्टीमॉडल लार्ज लैंग्वेज मॉडल

    2,411+0पिछले 7 दिनों में स्टार का बदलाव
  • cambrian@cambrian-mllm

    Cambrian-1 विजन-सेंट्रिक डिज़ाइन वाले मल्टीमॉडल LLM का एक परिवार है।

    2,014+1पिछले 7 दिनों में स्टार का बदलाव
  • 🚀🚀🚀 कुछ बेहतरीन public YOLO object detection series प्रोजेक्ट्स और संबंधित object detection datasets का संग्रह।

    1,783-2पिछले 7 दिनों में स्टार का बदलाव
  • Sa2VA@bytedance

    Pixel-LLM कोडबेस के लिए आधिकारिक रेपो: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (LSVOS के लिए पहला समाधान)

    1,666+0पिछले 7 दिनों में स्टार का बदलाव
  • Rex-Omni@IDEA-Research

    [CVPR2026] नेक्स्ट पॉइंट प्रेडिक्शन के माध्यम से कुछ भी डिटेक्ट करें

    1,570+8पिछले 7 दिनों में स्टार का बदलाव
  • 155+ विजन-लैंग्वेज मॉडल (VLM/MLLM) आर्किटेक्चर की क्यूरेटेड विजुअल कैटलॉग: पेपर, आरेख, ट्रेनिंग रेसिपी, डेटासेट, और मल्टीमॉडल AI एजेंटों के लिए रिलीज़ टाइमलाइन।

    1,310+2पिछले 7 दिनों में स्टार का बदलाव
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    लोकतांत्रिक मल्टीमॉडल प्रशिक्षण के लिए पूर्ण रूप से ओपन फ्रेमवर्क

    1,195+1पिछले 7 दिनों में स्टार का बदलाव
  • Bunny@BAAI-DCAI

    हल्के मल्टीमॉडल मॉडलों का एक परिवार।

    1,053+0पिछले 7 दिनों में स्टार का बदलाव
  • OpenEMMA@taco-group

    OpenEMMA, Waymo के EMMA मॉडल का एक परमीसिव लाइसेंस प्राप्त ओपन सोर्स "रीप्रोडक्शन"।

    951+0पिछले 7 दिनों में स्टार का बदलाव
  • NEO@EvolvingLMMs-Lab

    NEO सीरीज: फर्स्ट प्रिंसिपल्स से नेटिव विज़न-लैंग्वेज मॉडल्स

    888+0पिछले 7 दिनों में स्टार का बदलाव
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: एक बुद्धिमान फोटो रीटचिंग एजेंट के माध्यम से मानवीय कलात्मक रचनात्मकता को स्वतंत्र करना

    862+1पिछले 7 दिनों में स्टार का बदलाव
  • Osprey@CircleRadon

    [CVPR2024] "Osprey: Pixel Understanding with Visual Instruction Tuning" के लिए कोड

    843+0पिछले 7 दिनों में स्टार का बदलाव
  • FSDrive@MIV-XJTU

    [NeurIPS 2025 स्पॉटलाइट] "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving" का आधिकारिक कार्यान्वयन।

    831+9पिछले 7 दिनों में स्टार का बदलाव
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent: एजेंटिक एनी इमेज टू 4K सुपर-रिज़ॉल्यूशन। एक बुद्धिमान कंप्यूटर विजन एजेंट जो किसी भी इमेज को जादुई रूप से परफेक्ट 4K में रिस्टोर कर सकता है।

    822+2पिछले 7 दिनों में स्टार का बदलाव
  • 🚀🚀🚀 लार्ज लैंग्वेज मॉडल (LLM), विज़न लैंग्वेज मॉडल (VLM), विज़न लैंग्वेज एक्शन (VLA), AI जेनरेटेड कंटेंट (AIGC), और संबंधित डेटासेट व एप्लिकेशन के बारे में कुछ बेहतरीन सार्वजनिक प्रोजेक्ट्स का संग्रह।

    815+1पिछले 7 दिनों में स्टार का बदलाव
  • यह सीन ग्राफ जनरेशन और एप्लिकेशन पर शोध पत्रों को सूचीबद्ध करने के लिए एक रिपॉजिटरी है।

    724+5पिछले 7 दिनों में स्टार का बदलाव
  • MPP-LLaVA@Coobiw

    पर्सनल प्रोजेक्ट: MPP-Qwen14B और MPP-Qwen-Next (Qwen-LM पर आधारित मल्टीमॉडल पाइपलाइन पैरेलल)। [वीडियो/इमेज/मल्टी-इमेज] {sft/conversations} का समर्थन करता है। अपनी कल्पना को सीमित न होने दें! RTX3090/4090 24GB पर अपना खुद का 8B/14B LLaVA-ट्रेनिंग जैसा MLLM ट्रेन करें।

    686+0पिछले 7 दिनों में स्टार का बदलाव
  • SenseNova-Vision@OpenSenseNova

    यूनिफाइड मल्टीमॉडल जनरेशन के रूप में विज़न

    682+25पिछले 7 दिनों में स्टार का बदलाव
  • Woodpecker@VITA-MLLM

    Woodpecker: मल्टीमॉडल लार्ज लैंग्वेज मॉडल के लिए हेलुसिनेशन करेक्शन

    650+1पिछले 7 दिनों में स्टार का बदलाव
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield: मल्टी-मोडल लार्ज लैंग्वेज मॉडल्स के माध्यम से व्याख्या योग्य इमेज फोर्जरी डिटेक्शन और लोकलाइजेशन।

    623+2पिछले 7 दिनों में स्टार का बदलाव
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA: इंस्ट्रक्शन ट्यूनिंग के साथ मल्टीमॉडल इमोशन रिकग्निशन और रीजनिंग

    617+0पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस