मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · vision-language-model

vision-language-model

vision-language-model टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
59
कुल स्टार
1,50,825
औसत स्टार
2,556
हिस्सा
0.01%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर vision-language-model के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और vision-language-model टैग वाली रिपॉजिटरी।

  • doc7@magicrew

    시각적 이해를 바탕으로 문서를 AI 준비 완료된 Markdown으로 변환

    1,153
  • टेक्स्ट-ओनली LLMs के लिए डिज़ाइन किया गया एक विज़न टूलकिट - इमेज Q&A, लॉन्ग-स्क्रीनशॉट OCR, फ्रंटएंड UI रिस्टोरेशन और GUI ऑटोमेशन, जिसमें कई मुख्य एजेंट्स के साथ सहज एकीकरण का विकल्प है

    1,136
  • dsh-vision-toolkit@Anionex

    [dsh] सादे पाठ मॉडल के लिए अधिक शक्तिशाली विजुअल टूलबॉक्स: एक-लाइन इंस्टॉलेशन, सीधे इमेज पेस्ट करके पहचान, एकाधिक इमेज प्रश्नोत्तर, स्क्रीनशॉट से फ्रंटएंड UI बहाلی आदि।

    856
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] GPT-4V स्तर की क्षमताओं और उससे आगे की ओर निर्मित Visual Instruction Tuning (LLaVA)।

    25,014+9पिछले 7 दिनों में स्टार का बदलाव
  • X-AnyLabeling@CVHub520

    X-AnyLabeling: टेक्स्ट, इमेज, वीडियो और मल्टीमोडल डेटा को एनोटेट करने के लिए एक हल्का, कुशल और एकीकृत क्रॉस-प्लेटफॉर्म डेस्कटॉप एप्लिकेशन, जो अत्याधुनिक AI मॉडल और लचीले मल्टी-फॉर्मेट एक्सपोर्ट के साथ बहुमुखी अंतर्निहित टूल को जोड़ता है।

    10,313+59पिछले 7 दिनों में स्टार का बदलाव
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] InternVL Family: GPT-4o का एक अग्रणी ओपन-सोर्स विकल्प। GPT-4o जैसा प्रदर्शन देने वाला ओपन-सोर्स मल्टीमॉडल वार्ता मॉडल

    10,150+3पिछले 7 दिनों में स्टार का बदलाव
  • minimind-v@jingyaogong

    👀 सिर्फ़ 2 घंटे में शुरुआत से 65M-पैरामीटर VLM ट्रेन करें!

    8,535+40पिछले 7 दिनों में स्टार का बदलाव
  • Qwen-VL@QwenLM

    Alibaba Cloud द्वारा प्रस्तावित Qwen-VL (通义千问-VL) चैट और प्रीट्रेन्ड लार्ज विज़न लैंग्वेज मॉडल का आधिकारिक रेपो।

    6,727+1पिछले 7 दिनों में स्टार का बदलाव
  • MineContext@volcengine

    MineContext आपका सक्रिय संदर्भ-जागरूक AI पार्टनर है (Context-Engineering+ChatGPT Pulse)

    5,497+1पिछले 7 दिनों में स्टार का बदलाव
  • mlx-vlm@Blaizzy

    MLX-VLM MLX का उपयोग करके आपके Mac पर विजन लैंग्वेज मॉडल (VLMs) के अनुमान और फ़ाइन-ट्यूनिंग के लिए एक पैकेज है।

    5,462+25पिछले 7 दिनों में स्टार का बदलाव
  • align-anything@PKU-Alignment

    Align Anything: फीडबैक के साथ ऑल-मोडैलिटी मॉडल को प्रशिक्षित करना

    4,671+3पिछले 7 दिनों में स्टार का बदलाव
  • lmms-eval@EvolvingLMMs-Lab

    टेक्स्ट, इमेज, वीडियो और ऑडियो कार्यों के लिए वन-फॉर-ऑल मल्टीमॉडल मूल्यांकन टूलकिट।

    4,390+7पिछले 7 दिनों में स्टार का बदलाव
  • DeepSeek-VL@deepseek-ai

    DeepSeek-VL: वास्तविक दुनिया की विज़न-लैंग्वेज समझ की ओर।

    4,177+2पिछले 7 दिनों में स्टार का बदलाव
  • MiniMax-01@MiniMax-AI

    Linear Attention पर आधारित लार्ज-लैंग्वेज-मॉडल और विजन-लैंग्वेज-मॉडल, MiniMax-Text-01 और MiniMax-VL-01 की आधिकारिक रिपॉजिटरी

    3,467+0पिछले 7 दिनों में स्टार का बदलाव
  • MGM@JIA-Lab-research

    "Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models" का आधिकारिक रिपॉजिटरी

    3,327+0पिछले 7 दिनों में स्टार का बदलाव
  • VLM_survey@jingyi0000

    विज़न कार्यों के लिए बेहतरीन vision-language मॉडल्स का संग्रह

    3,126+0पिछले 7 दिनों में स्टार का बदलाव
  • OGAM@off-grid-ai

    ऑफ़लाइन AI का स्विस आर्मी नाइफ। अपने फ़ोन या Mac पर चैट करें, देखें, बोलें और इमेज जनरेट करें — GGUF LLMs, विजन, Whisper स्पीच-टू-टेक्स्ट, Stable Diffusion, टूल कॉलिंग और लोकल-नेटवर्क सर्वर। आपके CPU, GPU या NPU पर चलता है। कोई खाता नहीं, कोई API की नहीं, शून्य डेटा आपके डिवाइस से बाहर जाता है।

    3,038+17पिछले 7 दिनों में स्टार का बदलाव
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: लॉन्ग-टर्म स्ट्रीमिंग वीडियो और ऑडियो इंटरैक्शन के लिए एक व्यापक मल्टीमॉडल सिस्टम

    2,925-1पिछले 7 दिनों में स्टार का बदलाव
  • colpali@illuin-tech

    ColVision मॉडल (जैसे ColPali, ColQwen2, और ColSmol) के साथ ट्रेनिंग और इन्फ्रेंस चलाने के लिए इस्तेमाल किया जाने वाला कोड।

    2,809+7पिछले 7 दिनों में स्टार का बदलाव
  • Cradle@BAAI-Agents

    Cradle फ़्रेमवर्क General Computer Control (GCC) का पहला प्रयास है। Cradle न्यूनतम आवश्यकताओं के साथ एक मानकीकृत सामान्य वातावरण में मजबूत तर्क क्षमताओं, स्व-सुधार और कौशल क्यूरेशन को सक्षम करके एजेंटों को किसी भी कंप्यूटर कार्य में उत्कृष्टता प्राप्त करने का समर्थन करता है।

    2,578+2पिछले 7 दिनों में स्टार का बदलाव
  • Alibaba Cloud द्वारा Qwen-VL सीरीज़ को फाइन-ट्यून करने के लिए एक ओपन-सोर्स कार्यान्वयन।

    1,961+1पिछले 7 दिनों में स्टार का बदलाव
  • ShowUI@showlab

    [CVPR 2025] GUI एजेंट और कंप्यूटर उपयोग के लिए ओपन-सोर्स, एंड-टू-एंड, विजन-लैंग्वेज-एक्शन मॉडल।

    1,896+2पिछले 7 दिनों में स्टार का बदलाव
  • Awesome-LLM4AD@Thinklab-SJTU

    स्वायत्त ड्राइविंग (LLM4AD) संसाधनों के लिए भयानक LLM/VLM/VLA/वर्ल्ड मॉडल की एक क्यूरेटेड सूची (लगातार अपडेट की जाती है)

    1,890-2पिछले 7 दिनों में स्टार का बदलाव
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    वीडियो सर्च और समरीकरण (VSS) के लिए NVIDIA AI ब्लूप्रिंट, वास्तविक समय के सत्यापित अलर्ट, विजुअल Q&A और स्वचालित रिपोर्टिंग के साथ वीडियो एनालिटिक्स एजेंट बनाने के लिए एक GPU-त्वरित संदर्भ वास्तुकला है। VSS ब्लूप्रिंट NVIDIA Cosmos जैसे विजन लैंग्वेज मॉडल (VLM), NVIDIA Nemotron जैसे LLM, RAG और NVIDIA NIMs का उपयोग करता है।

    1,840+10पिछले 7 दिनों में स्टार का बदलाव
  • AdvancedLiterateMachinery@AlibabaResearch

    Advanced Literate Machinery की दिशा में मूल, नवीन विचारों और एल्गोरिदम का एक संग्रह। इस प्रोजेक्ट का रखरखाव Alibaba Group के Tongyi Lab की OCR टीम द्वारा किया जाता है।

    1,835+1पिछले 7 दिनों में स्टार का बदलाव
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, एक विजन-लैंग्वेज फाउंडेशन मॉडल है जिसे सामान्य-उद्देश्य मल्टीमॉडल समझ और तर्क को आगे बढ़ाने के लिए डिज़ाइन किया गया है, जो 60 में से 38 सार्वजनिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है

    1,586+0पिछले 7 दिनों में स्टार का बदलाव
  • vllm-mlx@waybarrios

    Apple Silicon के लिए हाई-परफॉरमेंस OpenAI और Anthropic संगत LLM इन्फेरेंस सर्वर। नेटिव MLX, निरंतर बैचिंग, मल्टीमॉडल मॉडल, MCP टूल कॉलिंग, और Claude Code समर्थन।

    1,557+6पिछले 7 दिनों में स्टार का बदलाव
  • thepipe@emcf

    विज़न-लैंग्वेज मॉडल द्वारा संचालित, पेचीदा दस्तावेजों से साफ डेटा प्राप्त करें ⚡

    1,524+0पिछले 7 दिनों में स्टार का बदलाव
  • [ICCV 2025] Describe Anything के लिए इम्प्लीमेंटेशन: विस्तृत स्थानीयकृत इमेज और वीडियो कैप्शनिंग

    1,517+3पिछले 7 दिनों में स्टार का बदलाव
  • Ovis@ATH-MaaS

    एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) आर्किटेक्चर, जिसे दृश्य और पाठ्य एम्बेडिंग को संरचनात्मक रूप से संरेखित करने के लिए डिज़ाइन किया गया है।

    1,514+2पिछले 7 दिनों में स्टार का बदलाव
  • awesome-japanese-llm@llm-jp

    जापानी LLM सारांश - जापानी LLM का अवलोकन

    1,428+1पिछले 7 दिनों में स्टार का बदलाव
  • mlx-tune@ARahim3

    Apple Silicon वाले Mac पर LLM को फाइन-ट्यून करें। SFT, DPO, GRPO, Vision, TTS, STT, Embedding और OCR फाइन-ट्यूनिंग — MLX पर नेटिव रूप से। Unsloth-compatible API।

    1,398+8पिछले 7 दिनों में स्टार का बदलाव
  • शानदार Unified Multimodal Models की सूची

    1,314+1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस