मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · multimodal

multimodal

multimodal टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

148 रिपॉजिटरी
  • टेक्स्ट-ओनली LLMs के लिए डिज़ाइन किया गया एक विज़न टूलकिट - इमेज Q&A, लॉन्ग-स्क्रीनशॉट OCR, फ्रंटएंड UI रिस्टोरेशन और GUI ऑटोमेशन, जिसमें कई मुख्य एजेंट्स के साथ सहज एकीकरण का विकल्प है

    1,136+18पिछले 7 दिनों में स्टार का बदलाव
  • आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Cordova के लिए Alan AI SDK

    1,132+0पिछले 7 दिनों में स्टार का बदलाव
  • sglang-omni@sgl-project

    SGLang-Omni, TTS, ASR, स्पीच और ओम्नी मॉडल के लिए उच्च-प्रदर्शन सर्विंग को सक्षम बनाता है।

    1,118+143पिछले 7 दिनों में स्टार का बदलाव
  • MOVA@OpenMOSS

    MOVA: स्केलेबल और सिंक्रोनाइज़्ड वीडियो-ऑडियो जनरेशन की दिशा में

    1,110+5पिछले 7 दिनों में स्टार का बदलाव
  • dsh-vision-router@ysr666

    टेक्स्ट-ओनली DeepSeek Harness एजेंटों के लिए विज़न: इन-बिल्ट फ्री विज़न चेन (बिना की के) + पिक्सेल-लेवल विज़न टूल्स (Q&A, ग्राउंडिंग, क्रॉप, पिक्सेल डिफ, कलर्स, OCR, SVG ट्रेस, कटआउट, स्क्रीनशॉट)। वन-कमांड इंस्टॉलेशन, कोई Python नहीं, इमेज टर्न सामान्य टूल-कॉलिंग टर्न की तरह काम करते हैं।

    1,088+68पिछले 7 दिनों में स्टार का बदलाव
  • Aria@rhymes-ai

    Aria के लिए कोडबेस - एक ओपन मल्टीमॉडल नेटिव MoE

    1,088+1पिछले 7 दिनों में स्टार का बदलाव
  • XrayGLM@WangRongsheng

    चेस्ट एक्स-रे पढ़ने वाला पहला चीनी मल्टीमॉडल मेडिकल मॉडल।

    1,084+2पिछले 7 दिनों में स्टार का बदलाव
  • VisCPM@OpenBMB

    [ICLR'24 स्पॉटलाइट] चीनी और अंग्रेजी मल्टीमॉडल लार्ज मॉडल सीरीज़ (चैट और पेंट) | CPM बेस मॉडल पर आधारित चीनी-अंग्रेजी द्विभाषी मल्टीमॉडल लार्ज मॉडल सीरीज़

    1,061-1पिछले 7 दिनों में स्टार का बदलाव
  • ONE-PEACE@OFA-Sys

    विज़न, ऑडियो और भाषा मोडैलिटीज़ के लिए एक सामान्य प्रतिनिधित्व मॉडल। पेपर: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0पिछले 7 दिनों में स्टार का बदलाव
  • PointLLM@InternRobotics

    [ECCV 2024 बेस्ट पेपर कैंडिडेट और TPAMI 2025] PointLLM: लार्ज लैंग्वेज मॉडल को पॉइंट क्लाउड को समझने में सक्षम बनाना

    1,054+3पिछले 7 दिनों में स्टार का बदलाव
  • CLIP4Clip@ArrowLuo

    "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval" के लिए आधिकारिक कार्यान्वयन

    1,032+1पिछले 7 दिनों में स्टार का बदलाव
  • Awesome-MCoT@yaotingwangofficial

    मल्टीमोडल चेन-ऑफ-थॉट रीजनिंग: एक व्यापक सर्वेक्षण

    1,025+2पिछले 7 दिनों में स्टार का बदलाव
  • tongflow@tong-io

    TongFlow — मल्टीमॉडल GenAI स्टूडियो।

    1,017+38पिछले 7 दिनों में स्टार का बदलाव
  • vectordb-recipes@lancedb

    वेक्टर सर्च और LLMs का उपयोग करके मल्टीमॉडल AI, RAG और एजेंट्स के लिए संसाधन, उदाहरण और ट्यूटोरियल

    973-1पिछले 7 दिनों में स्टार का बदलाव
  • verl-omni@verl-project

    डिफ्यूजन और ओम्नी मॉडल के लिए मल्टीमॉडल RL प्रशिक्षण फ्रेमवर्क

    968+73पिछले 7 दिनों में स्टार का बदलाव
  • rag-time@microsoft

    RAG Time: RAG में महारत हासिल करने के लिए 5-सप्ताह की सीखने की यात्रा।

    902+3पिछले 7 दिनों में स्टार का बदलाव
  • यह रिपॉजिटरी सबसे रोमांचक और प्रभावशाली CVPR 2025 पेपरों का एक क्यूरेटेड संग्रह है। 🔥 [पेपर + कोड + डेमो]

    895+1पिछले 7 दिनों में स्टार का बदलाव
  • NEO@EvolvingLMMs-Lab

    NEO सीरीज: फर्स्ट प्रिंसिपल्स से नेटिव विज़न-लैंग्वेज मॉडल्स

    889+1पिछले 7 दिनों में स्टार का बदलाव
  • AnyGPT@OpenMOSS

    AnyGPT: डिस्क्रीट सीक्वेंस मॉडलिंग के साथ यूनिफाइड मल्टीमॉडल LLM के लिए कोड

    881-1पिछले 7 दिनों में स्टार का बदलाव
  • ohmycaptcha@shenhao-stu

    ⚡ FastAPI, Playwright, और OpenAI-संगत मल्टीмодаल मॉडल के साथ निर्मित सेल्फ-होस्ट करने योग्य YesCaptcha-संगत कैप्चा सॉल्वर।

    869+4पिछले 7 दिनों में स्टार का बदलाव
  • lmms-engine@EvolvingLMMs-Lab

    एक सरल, एकीकृत मल्टीमॉडल मॉडल ट्रेनिंग इंजन। लीन, फ्लेक्सिबल और बड़े पैमाने पर हैकिंग के लिए बनाया गया।

    825+1पिछले 7 दिनों में स्टार का बदलाव
  • [TMLR 2025🔥] विजन में ऑटोरिग्रेसिव मॉडल के लिए एक सर्वेक्षण।

    808+1पिछले 7 दिनों में स्टार का बदलाव
  • papermage@allenai

    वैज्ञानिक पत्रों पर NLP और CV अनुसंधान का समर्थन करने वाली लाइब्रेरी

    803+0पिछले 7 दिनों में स्टार का बदलाव
  • contrastors@nomic-ai

    Pytorch में कंट्रास्टिव रूप से मॉडल को ट्रेन करें

    802+0पिछले 7 दिनों में स्टार का बदलाव
  • लोकल मॉनिटरिंग + AI विज़न — डेटा अधिग्रहण और विश्लेषण के लिए संरचित इवेंट आउटपुट के साथ LAN-आधारित स्मार्टफोन-संचालित AI मॉनिटरिंग फ्रेमवर्क।

    772+12पिछले 7 दिनों में स्टार का बदलाव
  • मल्टीमोडल और बड़े भाषा मॉडल के बारे में पेपर सूची, जिसका उपयोग केवल व्यक्तिगत आवश्यकताओं के लिए दैनिक arxiv में पढ़े गए कागजात को रिकॉर्ड करने के लिए किया जाता है।

    761+1पिछले 7 दिनों में स्टार का बदलाव
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR: मानव निर्देशों के बाद उच्च-गुणवत्ता वाली छवि पुनर्स्थापना https://huggingface.co/spaces/marcosv/InstructIR

    742+0पिछले 7 दिनों में स्टार का बदलाव
  • PaddleMIX@PaddlePaddle

    Paddle मल्टीमॉडल इंटीग्रेशन और एक्सप्लोरेशन, जो मुख्यधारा के मल्टी-मॉडल कार्यों का समर्थन करता है, जिसमें एंड-टू-एंड लार्ज-स्केल मल्टी-मॉडल प्रीट्रेन मॉडल और डिफ्यूजन मॉडल टूलबॉक्स शामिल हैं। उच्च प्रदर्शन और लचीलेपन से लैस।

    723-1पिछले 7 दिनों में स्टार का बदलाव
  • MMRec@enoche

    मल्टीमॉडल रिकमेंडेशन के लिए एक टूलबॉक्स। 10+ मॉडल्स को एकीकृत करता है...

    689+1पिछले 7 दिनों में स्टार का बदलाव
  • VLM2Vec@TIGER-AI-Lab

    इस रिपॉजिटरी में "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], और "MMEB-V3" [COLM 2026] के लिए कोड शामिल है

    682+2पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस