मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · vision-language

vision-language

vision-language टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
18
कुल स्टार
35,353
औसत स्टार
1,964
हिस्सा
0.00%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर vision-language के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और vision-language टैग वाली रिपॉजिटरी।

पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।

  • GroundingDINO@IDEA-Research

    [ECCV 2024] पेपर का आधिकारिक कार्यान्वयन "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"

    10,536+14पिछले 7 दिनों में स्टार का बदलाव
  • Chinese-CLIP@OFA-Sys

    CLIP का चीनी संस्करण जो चीनी क्रॉस-मोडल पुनर्प्राप्ति और प्रतिनिधित्व पीढ़ी को प्राप्त करता है।

    6,001+1पिछले 7 दिनों में स्टार का बदलाव
  • OFA@OFA-Sys

    OFA (ICML 2022) की आधिकारिक रिपॉजिटरी। पेपर: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2,557+0पिछले 7 दिनों में स्टार का बदलाव
  • Alibaba Cloud द्वारा Qwen-VL सीरीज़ को फाइन-ट्यून करने के लिए एक ओपन-सोर्स कार्यान्वयन।

    1,961+1पिछले 7 दिनों में स्टार का बदलाव
  • AdvancedLiterateMachinery@AlibabaResearch

    Advanced Literate Machinery की दिशा में मूल, नवीन विचारों और एल्गोरिदम का एक संग्रह। इस प्रोजेक्ट का रखरखाव Alibaba Group के Tongyi Lab की OCR टीम द्वारा किया जाता है।

    1,835+1पिछले 7 दिनों में स्टार का बदलाव
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT एक वीडियो वार्तालाप मॉडल है जो वीडियो के बारे में सार्थक बातचीत उत्पन्न करने में सक्षम है। यह स्थानिक-अस्थायी वीडियो प्रतिनिधित्व के लिए अनुकूलित एक प्री-ट्रेनेड विजुअल एनकोडर के साथ LLM की क्षमताओं को जोड़ता है। हम वीडियो-आधारित संवादात्मक मॉडल के लिए एक कठोर 'मात्रात्मक मूल्यांकन बेंचमार्किंग' भी पेश करते हैं।

    1,507+1पिछले 7 दिनों में स्टार का बदलाव
  • awesome-japanese-llm@llm-jp

    जापानी LLM सारांश - जापानी LLM का अवलोकन

    1,428+1पिछले 7 दिनों में स्टार का बदलाव
  • DriveLM@OpenDriveLab

    [ECCV 2024 Oral] DriveLM: ग्राफ विजुअल क्वेश्चन एनसरिंग के साथ ड्राइविंग

    1,340+1पिछले 7 दिनों में स्टार का बदलाव
  • ONE-PEACE@OFA-Sys

    विज़न, ऑडियो और भाषा मोडैलिटीज़ के लिए एक सामान्य प्रतिनिधित्व मॉडल। पेपर: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0पिछले 7 दिनों में स्टार का बदलाव
  • TinyLLaVA_Factory@TinyLLaVA

    छोटे पैमाने के लार्ज मल्टीमॉडल मॉडल्स का एक फ्रेमवर्क

    1,004+1पिछले 7 दिनों में स्टार का बदलाव
  • calvin@mees

    CALVIN - लॉन्ग-होरिजोन रोबोट मैनिपुलेशन कार्यों के लिए लैंग्वेज-कंडीशंड पॉलिसी लर्निंग हेतु एक बेंचमार्क।

    983+8पिछले 7 दिनों में स्टार का बदलाव
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: एक CLIP मॉडल जो आपकी इच्छानुसार कहीं भी ध्यान केंद्रित करता है।

    874+0पिछले 7 दिनों में स्टार का बदलाव
  • Open-GroundingDino@longzw1997

    यह Grounding DINO पेपर का थर्ड-पार्टी कार्यान्वयन है: ओपन-सेट ऑब्जेक्ट डिटेक्शन के लिए DINO को ग्राउंडेड प्री-ट्रेनिंग के साथ जोड़ना।

    846+2पिछले 7 दिनों में स्टार का बदलाव
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++: Phi-3 और LLaMA-3 के साथ LLaVA का विस्तार (LLaVA LLaMA-3, LLaVA Phi-3)

    842+0पिछले 7 दिनों में स्टार का बदलाव
  • daclip-uir@Algolzw

    [ICLR 2024] यूनिवर्सल इमेज रिस्टोरेशन के लिए विजन-लैंग्वेज मॉडल को नियंत्रित करना। NTIRE 2024 रिस्टोर एनी इमेज मॉडल इन द वाइल्ड चैलेंज में 5वां स्थान।

    817+1पिछले 7 दिनों में स्टार का बदलाव
  • SEED@AILab-CVC

    SEED-LLaMA (ICLR 2024) का आधिकारिक कार्यान्वयन।

    641-1पिछले 7 दिनों में स्टार का बदलाव
  • RemoteCLIP@ChenDelong1999

    🛰️ पेपर "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS) की आधिकारिक रिपॉजिटरी

    591+4पिछले 7 दिनों में स्टार का बदलाव
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    588पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस