मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · multimodal

multimodal

multimodal टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

148 रिपॉजिटरी
  • फाउंडेशन मॉडल्स के साथ रीजनिंग में नवीनतम पेपर्स और बेंचमार्क।

    657+1पिछले 7 दिनों में स्टार का बदलाव
  • MOSS-Audio@OpenMOSS

    MOSS-Audio एकीकृत ऑडियो समझ के लिए एक ओपन-सोर्स फाउंडेशन मॉडल है, जो वास्तविक दुनिया के परिदृश्यों में भाषण, ध्वनि, संगीत, कैप्शनिंग, QA और तर्क को सक्षम बनाता है।

    657+5पिछले 7 दिनों में स्टार का बदलाव
  • SEED@AILab-CVC

    SEED-LLaMA (ICLR 2024) का आधिकारिक कार्यान्वयन।

    641-1पिछले 7 दिनों में स्टार का बदलाव
  • Seg-Zero@JIA-Lab-research

    "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement" के लिए प्रोजेक्ट पेज।

    640+0पिछले 7 दिनों में स्टार का बदलाव
  • 👁️ + 💬 + 🎧 = 🤖 शीर्ष फाउंडेशन और मल्टीमॉडल मॉडलों की क्यूरेटेड सूची! [पेपर + कोड + उदाहरण + ट्यूटोरियल]

    637+0पिछले 7 दिनों में स्टार का बदलाव
  • blended-latent-diffusion@omriav

    Blended Latent Diffusion [SIGGRAPH 2023] के लिए आधिकारिक कार्यान्वयन।

    632+0पिछले 7 दिनों में स्टार का बदलाव
  • second-brain@henrydaum

    Second Brain एक एजेंटिक फ्रेमवर्क है जो कार्यों को पूरा करने और कई तौर-तरीकों पर संवाद करने के लिए ऑपरेटिंग सिस्टम के रूप में कार्य करता है।

    632+13पिछले 7 दिनों में स्टार का बदलाव
  • RAG-Driven-Generative-AI@Denis2054

    यह रिपॉजिटरी LlamaIndex, Deep Lake और Pinecone के साथ Generative AI के लिए Retrieval Augmented Generation (RAG) कोड बनाने के लिए प्रोग्राम प्रदान करती है, जो जनरेशन और इवैल्यूएशन के लिए OpenAI और Hugging Face मॉडल की शक्ति का लाभ उठाती है।

    624+2पिछले 7 दिनों में स्टार का बदलाव
  • VisualThinker-R1-Zero@turningpoint-ai

    2B Model पर मल्टीमॉडल “आहा मोमेंट” का पता लगाएं

    623+0पिछले 7 दिनों में स्टार का बदलाव
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni: 3D एसेट्स के नियंत्रित जनरेशन के लिए एक एकीकृत फ्रेमवर्क।

    618+5पिछले 7 दिनों में स्टार का बदलाव
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    613पिछले 7 दिनों में स्टार का बदलाव
  • tokenize-anything@baaivision

    [ECCV 2024] प्रॉम्प्टिंग के माध्यम से किसी भी चीज़ को टोकनाइज़ करें

    600+0पिछले 7 दिनों में स्टार का बदलाव
  • Relax@redai-studio

    बड़े पैमाने पर ऑम्नी-मोडल पोस्ट-ट्रेनिंग के लिए एक एसिंक्रोनस रिइंफोर्समेंट लर्निंग इंजन।

    597+12पिछले 7 दिनों में स्टार का बदलाव
  • MMMU@MMMU-Benchmark

    यह रिपॉजिटरी "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI" पेपर के लिए मूल्यांकन कोड प्रदान करती है।

    594+2पिछले 7 दिनों में स्टार का बदलाव
  • blended-diffusion@omriav

    "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022] के लिए आधिकारिक कार्यान्वयन

    588+0पिछले 7 दिनों में स्टार का बदलाव
  • AI-Employe@vignshwarar

    GPT-4 Vision का उपयोग करके ब्राउज़र ऑटोमेशन बनाएं जैसे कि आप किसी इंसान को सिखा रहे हों।

    586+1पिछले 7 दिनों में स्टार का बदलाव
  • Groma@FoundationVision

    [ECCV2024] स्थानीयकृत विजुअल टोकराइजेशन के साथ ग्राउंडेड मल्टीमॉडल लार्ज लैंग्वेज मॉडल

    586+0पिछले 7 दिनों में स्टार का बदलाव
  • rai@RobotecAI

    RAI फिजिकल AI रोबोटिक्स के लिए एक वेंडर-अज्ञेयवादी एजेंटिक फ्रेमवर्क है, जो जटिल कार्यों, परिभाषित परिदृश्यों, फ्री इंटरफ़ेस निष्पादन, लॉग सारांश, वॉयस इंटरैक्शन आदि को करने के लिए ROS 2 टूल्स का उपयोग करता है।

    585+7पिछले 7 दिनों में स्टार का बदलाव
  • motis@motis-project

    मल्टीमॉडल रूटिंग, जियोकोडिंग और मैप टाइल्स

    579+13पिछले 7 दिनों में स्टार का बदलाव
  • LLaVA-Mini@ictnlp

    LLaVA-Mini एक एकीकृत बड़ा मल्टीмодальный मॉडल (LMM) है जो छवियों, उच्च-रिज़ॉल्यूशन छवियों और वीडियो की समझ को कुशलता से समर्थन कर सकता है।

    577+0पिछले 7 दिनों में स्टार का बदलाव
  • आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — React Native के लिए Alan AI SDK।

    575+0पिछले 7 दिनों में स्टार का बदलाव
  • multimodal-agents-course@the-ai-merge

    आंखों और कानों वाला एक MCP मल्टीमॉडल AI एजेंट!

    575-1पिछले 7 दिनों में स्टार का बदलाव
  • psi@microsoft

    सिचुएटेड इंटेलिजेंस के लिए प्लेटफॉर्म

    572+1पिछले 7 दिनों में स्टार का बदलाव
  • clip.cpp@monatis

    बिना किसी अतिरिक्त निर्भरता के सादे C/C++ में CLIP इन्फरेंस

    568+0पिछले 7 दिनों में स्टार का बदलाव
  • Flame-Code-VLM@Flame-Code-VLM

    Flame एक ओपन-सोर्स मल्टीमॉडल AI सिस्टम है जिसे UI डिज़ाइन मॉकअप को उच्च-गुणवत्ता वाले React कोड में बदलने के लिए डिज़ाइन किया गया है। यह डिज़ाइन और फ्रंट-एंड डेवलपमेंट के बीच की खाई को पाटने के लिए विजन-लैंग्वेज मॉडलिंग, स्वचालित डेटा संश्लेषण और संरचित प्रशिक्षण वर्कफ़्लो का लाभ उठाता है।

    562+0पिछले 7 दिनों में स्टार का बदलाव
  • vlmrun-hub@vlm-run

    VLM के साथ उपयोग किए जाने वाले विभिन्न उद्योग-विशिष्ट स्कीमा के लिए एक हब।

    556+0पिछले 7 दिनों में स्टार का बदलाव
  • शानदार मल्टीमॉडल मॉडलिंग [MLLM, UMM, और NMM शामिल हैं]।

    543+2पिछले 7 दिनों में स्टार का बदलाव
  • EVF-SAM@hustvl

    "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model" का आधिकारिक कोड

    508+1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस