मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · multimodal

multimodal

multimodal टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

148 रिपॉजिटरी
  • stability-sdk@Stability-AI

    stability.ai API के साथ इंटरैक्ट करने के लिए SDK (उदा. stable diffusion इन्फॉरेंस)

    2,435-1पिछले 7 दिनों में स्टार का बदलाव
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: दस्तावेज़ को समझने के लिए मॉड्यूलर मल्टीमॉडल लार्ज लैंग्वेज मॉडल

    2,411+0पिछले 7 दिनों में स्टार का बदलाव
  • InternVideo@OpenGVLab

    [ECCV2024] मल्टीमॉडल समझ के लिए वीडियो फाउंडेशन मॉडल और डेटा

    2,374+5पिछले 7 दिनों में स्टार का बदलाव
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer: शुरुआत से या सीड डेटा से उच्च गुणवत्ता वाला सिंथेटिक डेटा जनरेट करें।

    2,197+7पिछले 7 दिनों में स्टार का बदलाव
  • genai-processors@google-gemini

    GenAI Processors एक हल्की Python लाइब्रेरी है जो कुशल, समानांतर सामग्री प्रसंस्करण को सक्षम बनाती है।

    2,120+0पिछले 7 दिनों में स्टार का बदलाव
  • claude-real-video@HUANGCHIHHUNGLeo

    Claude (या किसी भी LLM) को वास्तव में वीडियो देखने दें — सीन-अवेयर, डिडुप्लीकेटेड फ़्रेम + ट्रांसक्रिप्ट, URL या स्थानीय फ़ाइल से। स्थानीय रूप से चलता है, MIT।

    2,109+20पिछले 7 दिनों में स्टार का बदलाव
  • parlor@fikrikarim

    GPT-Live के समान सुविधाओं के साथ ऑन-डिवाइस, रीयल-टाइम मल्टीмоdal AI

    2,048+7पिछले 7 दिनों में स्टार का बदलाव
  • Show-o@showlab

    [ICLR & NeurIPS 2025] Show-o श्रृंखला के लिए रिपॉजिटरी, मल्टीमॉडल समझ और पीढ़ी को एकजुट करने के लिए एक सिंगल ट्रांसफॉर्मर।

    1,975+1पिछले 7 दिनों में स्टार का बदलाव
  • Alibaba Cloud द्वारा Qwen-VL सीरीज़ को फाइन-ट्यून करने के लिए एक ओपन-सोर्स कार्यान्वयन।

    1,961+1पिछले 7 दिनों में स्टार का बदलाव
  • BitNet@kyegomez

    pytorch में "BitNet: Scaling 1-bit Transformers for Large Language Models" का कार्यान्वयन

    1,946+0पिछले 7 दिनों में स्टार का बदलाव
  • AdvancedLiterateMachinery@AlibabaResearch

    Advanced Literate Machinery की दिशा में मूल, नवीन विचारों और एल्गोरिदम का एक संग्रह। इस प्रोजेक्ट का रखरखाव Alibaba Group के Tongyi Lab की OCR टीम द्वारा किया जाता है।

    1,835+1पिछले 7 दिनों में स्टार का बदलाव
  • DeTikZify@potamides

    TikZ के साथ वैज्ञानिक आकृतियों और रेखाचित्रों के लिए ग्राफ़िक्स प्रोग्राम्स का संश्लेषण।

    1,818+1पिछले 7 दिनों में स्टार का बदलाव
  • आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Android के लिए Alan AI SDK

    1,807-1पिछले 7 दिनों में स्टार का बदलाव
  • आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Flutter के लिए Alan AI SDK

    1,756-1पिछले 7 दिनों में स्टार का बदलाव
  • alan-sdk-ionic@alan-ai

    आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Ionic के लिए Alan AI SDK

    1,649-1पिछले 7 दिनों में स्टार का बदलाव
  • pixeltable@pixeltable

    AI डेटा ऐप्स के लिए एकीकृत मल्टीमॉडल बैकएंड

    1,619+5पिछले 7 दिनों में स्टार का बदलाव
  • mllm@UbiquitousLearning

    : मोबाइल उपकरणों पर तेज़ मल्टीमॉडल LLM

    1,602+3पिछले 7 दिनों में स्टार का बदलाव
  • thepipe@emcf

    विज़न-लैंग्वेज मॉडल द्वारा संचालित, पेचीदा दस्तावेजों से साफ डेटा प्राप्त करें ⚡

    1,524+0पिछले 7 दिनों में स्टार का बदलाव
  • Ovis@ATH-MaaS

    एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) आर्किटेक्चर, जिसे दृश्य और पाठ्य एम्बेडिंग को संरचनात्मक रूप से संरेखित करने के लिए डिज़ाइन किया गया है।

    1,514+2पिछले 7 दिनों में स्टार का बदलाव
  • ha-llmvision@valentinfrlch

    आपके घर के लिए विजुअल इंटेलिजेंस।

    1,454+10पिछले 7 दिनों में स्टार का बदलाव
  • awesome-japanese-llm@llm-jp

    जापानी LLM सारांश - जापानी LLM का अवलोकन

    1,428+1पिछले 7 दिनों में स्टार का बदलाव
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1,422+462पिछले 7 दिनों में स्टार का बदलाव
  • SDT@dailenson

    यह रिपॉजिटरी Handwriting Generation (CVPR 2023) के लिए Disentangling Writer and Character Styles का आधिकारिक कार्यान्वयन है

    1,406-1पिछले 7 दिनों में स्टार का बदलाव
  • airunner@Capsize-Games

    कला, वास्तविक समय की आवाज़ बातचीत, LLM-संचालित चैटबॉट्स और स्वचालित वर्कफ़्लो के लिए ऑफ़लाइन अनुमान इंजन

    1,314+0पिछले 7 दिनों में स्टार का बदलाव
  • 155+ विजन-लैंग्वेज मॉडल (VLM/MLLM) आर्किटेक्चर की क्यूरेटेड विजुअल कैटलॉग: पेपर, आरेख, ट्रेनिंग रेसिपी, डेटासेट, और मल्टीमॉडल AI एजेंटों के लिए रिलीज़ टाइमलाइन।

    1,310+2पिछले 7 दिनों में स्टार का बदलाव
  • claude-video-vision@jordanrendric

    Claude को वीडियो देखने और समझने की क्षमता दें — फ्रेम निष्कर्षण और मल्टीमॉडल ऑडियो विश्लेषण के साथ Claude Code प्लगइन

    1,281+6पिछले 7 दिनों में स्टार का बदलाव
  • UForm@unum-cloud

    बहुभाषी टेक्स्ट, इमेज और 🔜 वीडियो में कंटेंट को समझने और जनरेट करने के लिए पॉकेट-साइज़ मल्टीमॉडल AI, जो OpenAI CLIP और LLaVA से 5 गुना तक तेज़ है 🖼️ & 🖋️

    1,247+1पिछले 7 दिनों में स्टार का बदलाव
  • xtreme1@xtreme1-io

    Xtreme1 मल्टीमॉडल डेटा ट्रेनिंग के लिए एक ऑल-इन-वन डेटा लेबलिंग और एनोटेशन प्लेटफॉर्म है और यह 3D LiDAR पॉइंट क्लाउड, इमेज और LLM को सपोर्ट करता है।

    1,239+2पिछले 7 दिनों में स्टार का बदलाव
  • LLaMA-Mesh@nv-tlabs

    Language Models के साथ 3D Mesh Generation का एकीकरण।

    1,167+0पिछले 7 दिनों में स्टार का बदलाव
  • doc7@magicrew

    시각적 이해를 바탕으로 문서를 AI 준비 완료된 Markdown으로 변환

    1,153-25पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस