multimodal
multimodal टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #91
टेक्स्ट-ओनली LLMs के लिए डिज़ाइन किया गया एक विज़न टूलकिट - इमेज Q&A, लॉन्ग-स्क्रीनशॉट OCR, फ्रंटएंड UI रिस्टोरेशन और GUI ऑटोमेशन, जिसमें कई मुख्य एजेंट्स के साथ सहज एकीकरण का विकल्प है
★ 1,136+18पिछले 7 दिनों में स्टार का बदलाव - #92
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Cordova के लिए Alan AI SDK
★ 1,132+0पिछले 7 दिनों में स्टार का बदलाव - #93
SGLang-Omni, TTS, ASR, स्पीच और ओम्नी मॉडल के लिए उच्च-प्रदर्शन सर्विंग को सक्षम बनाता है।
★ 1,118+143पिछले 7 दिनों में स्टार का बदलाव - #94★ 1,110+5पिछले 7 दिनों में स्टार का बदलाव
- #95
टेक्स्ट-ओनली DeepSeek Harness एजेंटों के लिए विज़न: इन-बिल्ट फ्री विज़न चेन (बिना की के) + पिक्सेल-लेवल विज़न टूल्स (Q&A, ग्राउंडिंग, क्रॉप, पिक्सेल डिफ, कलर्स, OCR, SVG ट्रेस, कटआउट, स्क्रीनशॉट)। वन-कमांड इंस्टॉलेशन, कोई Python नहीं, इमेज टर्न सामान्य टूल-कॉलिंग टर्न की तरह काम करते हैं।
★ 1,088+68पिछले 7 दिनों में स्टार का बदलाव - #96★ 1,088+1पिछले 7 दिनों में स्टार का बदलाव
- #97★ 1,084+2पिछले 7 दिनों में स्टार का बदलाव
- #98
[ICLR'24 स्पॉटलाइट] चीनी और अंग्रेजी मल्टीमॉडल लार्ज मॉडल सीरीज़ (चैट और पेंट) | CPM बेस मॉडल पर आधारित चीनी-अंग्रेजी द्विभाषी मल्टीमॉडल लार्ज मॉडल सीरीज़
★ 1,061-1पिछले 7 दिनों में स्टार का बदलाव - #99
विज़न, ऑडियो और भाषा मोडैलिटीज़ के लिए एक सामान्य प्रतिनिधित्व मॉडल। पेपर: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0पिछले 7 दिनों में स्टार का बदलाव - #100
[ECCV 2024 बेस्ट पेपर कैंडिडेट और TPAMI 2025] PointLLM: लार्ज लैंग्वेज मॉडल को पॉइंट क्लाउड को समझने में सक्षम बनाना
★ 1,054+3पिछले 7 दिनों में स्टार का बदलाव - #101
"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval" के लिए आधिकारिक कार्यान्वयन
★ 1,032+1पिछले 7 दिनों में स्टार का बदलाव - #102
मल्टीमोडल चेन-ऑफ-थॉट रीजनिंग: एक व्यापक सर्वेक्षण
★ 1,025+2पिछले 7 दिनों में स्टार का बदलाव - #103★ 1,017+38पिछले 7 दिनों में स्टार का बदलाव
- #104
वेक्टर सर्च और LLMs का उपयोग करके मल्टीमॉडल AI, RAG और एजेंट्स के लिए संसाधन, उदाहरण और ट्यूटोरियल
★ 973-1पिछले 7 दिनों में स्टार का बदलाव - #105★ 968+73पिछले 7 दिनों में स्टार का बदलाव
- #106★ 902+3पिछले 7 दिनों में स्टार का बदलाव
- #107
यह रिपॉजिटरी सबसे रोमांचक और प्रभावशाली CVPR 2025 पेपरों का एक क्यूरेटेड संग्रह है। 🔥 [पेपर + कोड + डेमो]
★ 895+1पिछले 7 दिनों में स्टार का बदलाव - #108★ 889+1पिछले 7 दिनों में स्टार का बदलाव
- #109★ 881-1पिछले 7 दिनों में स्टार का बदलाव
- #110
⚡ FastAPI, Playwright, और OpenAI-संगत मल्टीмодаल मॉडल के साथ निर्मित सेल्फ-होस्ट करने योग्य YesCaptcha-संगत कैप्चा सॉल्वर।
★ 869+4पिछले 7 दिनों में स्टार का बदलाव - #111
एक सरल, एकीकृत मल्टीमॉडल मॉडल ट्रेनिंग इंजन। लीन, फ्लेक्सिबल और बड़े पैमाने पर हैकिंग के लिए बनाया गया।
★ 825+1पिछले 7 दिनों में स्टार का बदलाव - #112
[TMLR 2025🔥] विजन में ऑटोरिग्रेसिव मॉडल के लिए एक सर्वेक्षण।
★ 808+1पिछले 7 दिनों में स्टार का बदलाव - #113★ 803+0पिछले 7 दिनों में स्टार का बदलाव
- #114
Pytorch में कंट्रास्टिव रूप से मॉडल को ट्रेन करें
★ 802+0पिछले 7 दिनों में स्टार का बदलाव - #115
लोकल मॉनिटरिंग + AI विज़न — डेटा अधिग्रहण और विश्लेषण के लिए संरचित इवेंट आउटपुट के साथ LAN-आधारित स्मार्टफोन-संचालित AI मॉनिटरिंग फ्रेमवर्क।
★ 772+12पिछले 7 दिनों में स्टार का बदलाव - #116
मल्टीमोडल और बड़े भाषा मॉडल के बारे में पेपर सूची, जिसका उपयोग केवल व्यक्तिगत आवश्यकताओं के लिए दैनिक arxiv में पढ़े गए कागजात को रिकॉर्ड करने के लिए किया जाता है।
★ 761+1पिछले 7 दिनों में स्टार का बदलाव - #117
[ECCV 2024] InstructIR: मानव निर्देशों के बाद उच्च-गुणवत्ता वाली छवि पुनर्स्थापना https://huggingface.co/spaces/marcosv/InstructIR
★ 742+0पिछले 7 दिनों में स्टार का बदलाव - #118
Paddle मल्टीमॉडल इंटीग्रेशन और एक्सप्लोरेशन, जो मुख्यधारा के मल्टी-मॉडल कार्यों का समर्थन करता है, जिसमें एंड-टू-एंड लार्ज-स्केल मल्टी-मॉडल प्रीट्रेन मॉडल और डिफ्यूजन मॉडल टूलबॉक्स शामिल हैं। उच्च प्रदर्शन और लचीलेपन से लैस।
★ 723-1पिछले 7 दिनों में स्टार का बदलाव - #119★ 689+1पिछले 7 दिनों में स्टार का बदलाव
- #120
इस रिपॉजिटरी में "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], और "MMEB-V3" [COLM 2026] के लिए कोड शामिल है
★ 682+2पिछले 7 दिनों में स्टार का बदलाव