मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · vision-language-model

vision-language-model

vision-language-model टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

59 रिपॉजिटरी
  • prismer@NVlabs

    "Prismer: A Vision-Language Model with Multi-Task Experts" का कार्यान्वयन।

    1,309+0पिछले 7 दिनों में स्टार का बदलाव
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    लोकतांत्रिक मल्टीमॉडल प्रशिक्षण के लिए पूर्ण रूप से ओपन फ्रेमवर्क

    1,195+1पिछले 7 दिनों में स्टार का बदलाव
  • vlms-zero-to-hero@SkalskiP

    यह श्रृंखला आपको NLP और Computer Vision की बुनियादी बातों से लेकर Vision-Language Models के अत्याधुनिक स्तर तक की यात्रा पर ले जाएगी।

    1,179+0पिछले 7 दिनों में स्टार का बदलाव
  • doc7@magicrew

    시각적 이해를 바탕으로 문서를 AI 준비 완료된 Markdown으로 변환

    1,153-25पिछले 7 दिनों में स्टार का बदलाव
  • टेक्स्ट-ओनली LLMs के लिए डिज़ाइन किया गया एक विज़न टूलकिट - इमेज Q&A, लॉन्ग-स्क्रीनशॉट OCR, फ्रंटएंड UI रिस्टोरेशन और GUI ऑटोमेशन, जिसमें कई मुख्य एजेंट्स के साथ सहज एकीकरण का विकल्प है

    1,136+18पिछले 7 दिनों में स्टार का बदलाव
  • VisRAG@OpenBMB

    VLM द्वारा समर्थित पार्सिंग-मुक्त RAG।

    979-1पिछले 7 दिनों में स्टार का बदलाव
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), अपनी तरह का पहला मॉडल जो ऑब्जेक्ट सेगमेंटेशन मास्क के साथ सहजता से एकीकृत प्राकृतिक भाषा प्रतिक्रियाएं उत्पन्न करने में सक्षम है।

    967+0पिछले 7 दिनों में स्टार का बदलाव
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: यूनिफाइड विजुअल रिप्रेजेंटेशन लार्ज लैंग्वेज मॉडल्स को इमेज और वीडियो समझ के साथ सशक्त बनाता है

    941+0पिछले 7 दिनों में स्टार का बदलाव
  • यह रिपॉजिटरी सबसे रोमांचक और प्रभावशाली CVPR 2025 पेपरों का एक क्यूरेटेड संग्रह है। 🔥 [पेपर + कोड + डेमो]

    895+1पिछले 7 दिनों में स्टार का बदलाव
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: एक CLIP मॉडल जो आपकी इच्छानुसार कहीं भी ध्यान केंद्रित करता है।

    875+1पिछले 7 दिनों में स्टार का बदलाव
  • dsh-vision-toolkit@Anionex

    [dsh] सादे पाठ मॉडल के लिए अधिक शक्तिशाली विजुअल टूलबॉक्स: एक-लाइन इंस्टॉलेशन, सीधे इमेज पेस्ट करके पहचान, एकाधिक इमेज प्रश्नोत्तर, स्क्रीनशॉट से फ्रंटएंड UI बहाلی आदि।

    859+20पिछले 7 दिनों में स्टार का बदलाव
  • VoxPoser@huangwl18

    VoxPoser: भाषा मॉडल के साथ रोबोटिक हेरफेर के लिए कंपोज़ेबल 3D वैल्यू मैप्स

    834+1पिछले 7 दिनों में स्टार का बदलाव
  • OpenCUA@xlang-ai

    [NeurIPS 2025 स्पॉटलाइट] OpenCUA: कंप्यूटर-उपयोग एजेंटों के लिए ओपन फाउंडेशन।

    833+4पिछले 7 दिनों में स्टार का बदलाव
  • MINT-1T@mlfoundations

    🍃 MINT-1T: एक ट्रिलियन टोकन वाला मल्टीमॉडल इंटरलीव्ड डेटासेट।

    832+0पिछले 7 दिनों में स्टार का बदलाव
  • लार्ज मॉडल्स (LLMs/VLMs) के युग में रोबोटिक्स डोमेन से संबंधित 3D विजन पेपर्स की एक क्यूरेटेड सूची, जिसमें पेपर्स, कोड और संबंधित वेबसाइटें शामिल हैं।

    822+3पिछले 7 दिनों में स्टार का बदलाव
  • CLIP जैसे विजन-लैंग्वेज मॉडल के लिए बेहतरीन प्रॉम्प्ट/एडेप्टर लर्निंग विधियों की एक क्यूरेटेड सूची।

    797+1पिछले 7 दिनों में स्टार का बदलाव
  • X-VLA@2toinf

    [ICLR 2026] "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model" का आधिकारिक कार्यान्वयन

    726+6पिछले 7 दिनों में स्टार का बदलाव
  • OmniVinci@NVlabs

    OmniVinci दृष्टि, ऑडियो और भाषा की संयुक्त समझ के लिए एक सर्व-मोडल LLM है।

    678+1पिछले 7 दिनों में स्टार का बदलाव
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    641-1पिछले 7 दिनों में स्टार का बदलाव
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606पिछले 7 दिनों में स्टार का बदलाव
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT: प्री-ट्रेंड मॉडल-आधारित निरंतर शिक्षण (Continual Learning) टूलबॉक्स।

    601+4पिछले 7 दिनों में स्टार का बदलाव
  • t2v_metrics@linzhiqiu

    VQAScore के साथ टेक्स्ट-टू-इमेज/वीडियो/3D मॉडल का मूल्यांकन

    600+0पिछले 7 दिनों में स्टार का बदलाव
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID: स्थानिक एनोटेशन के साथ एक बड़े पैमाने का वीडियो डेटासेट

    600+1पिछले 7 दिनों में स्टार का बदलाव
  • Groma@FoundationVision

    [ECCV2024] स्थानीयकृत विजुअल टोकराइजेशन के साथ ग्राउंडेड मल्टीमॉडल लार्ज लैंग्वेज मॉडल

    586+0पिछले 7 दिनों में स्टार का बदलाव
  • LLaVA-Mini@ictnlp

    LLaVA-Mini एक एकीकृत बड़ा मल्टीмодальный मॉडल (LMM) है जो छवियों, उच्च-रिज़ॉल्यूशन छवियों और वीडियो की समझ को कुशलता से समर्थन कर सकता है।

    577+0पिछले 7 दिनों में स्टार का बदलाव
  • cambrian-s@cambrian-mllm

    Cambrian-S: वीडियो में स्थानिक सुपरसेंसिंग की दिशा में

    567-1पिछले 7 दिनों में स्टार का बदलाव
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena अब मल्टी-मोडैलिटी के साथ! Multi-Modality Arena आपको इनपुट के रूप में इमेज प्रदान करते हुए विज़न-लैंग्वेज मॉडल की तुलना करने की सुविधा देता है। यह MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 और कई अन्य का समर्थन करता है।

    566+0पिछले 7 दिनों में स्टार का बदलाव
  • Flame-Code-VLM@Flame-Code-VLM

    Flame एक ओपन-सोर्स मल्टीमॉडल AI सिस्टम है जिसे UI डिज़ाइन मॉकअप को उच्च-गुणवत्ता वाले React कोड में बदलने के लिए डिज़ाइन किया गया है। यह डिज़ाइन और फ्रंट-एंड डेवलपमेंट के बीच की खाई को पाटने के लिए विजन-लैंग्वेज मॉडलिंग, स्वचालित डेटा संश्लेषण और संरचित प्रशिक्षण वर्कफ़्लो का लाभ उठाता है।

    562+0पिछले 7 दिनों में स्टार का बदलाव
  • count-anything@Mengqi-Lei

    ✨Counting Anything पेपर के लिए कोड और कार्यान्वयन दिशानिर्देश। प्रोजेक्ट पेज: https://mengqi-lei.github.io/count-anything-projectpage/

    540+3पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस