multimodal
multimodal टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #121
फाउंडेशन मॉडल्स के साथ रीजनिंग में नवीनतम पेपर्स और बेंचमार्क।
★ 657+1पिछले 7 दिनों में स्टार का बदलाव - #122
MOSS-Audio एकीकृत ऑडियो समझ के लिए एक ओपन-सोर्स फाउंडेशन मॉडल है, जो वास्तविक दुनिया के परिदृश्यों में भाषण, ध्वनि, संगीत, कैप्शनिंग, QA और तर्क को सक्षम बनाता है।
★ 657+5पिछले 7 दिनों में स्टार का बदलाव - #123★ 641-1पिछले 7 दिनों में स्टार का बदलाव
- #124
"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement" के लिए प्रोजेक्ट पेज।
★ 640+0पिछले 7 दिनों में स्टार का बदलाव - #125
👁️ + 💬 + 🎧 = 🤖 शीर्ष फाउंडेशन और मल्टीमॉडल मॉडलों की क्यूरेटेड सूची! [पेपर + कोड + उदाहरण + ट्यूटोरियल]
★ 637+0पिछले 7 दिनों में स्टार का बदलाव - #126
Blended Latent Diffusion [SIGGRAPH 2023] के लिए आधिकारिक कार्यान्वयन।
★ 632+0पिछले 7 दिनों में स्टार का बदलाव - #127
Second Brain एक एजेंटिक फ्रेमवर्क है जो कार्यों को पूरा करने और कई तौर-तरीकों पर संवाद करने के लिए ऑपरेटिंग सिस्टम के रूप में कार्य करता है।
★ 632+13पिछले 7 दिनों में स्टार का बदलाव - #128
यह रिपॉजिटरी LlamaIndex, Deep Lake और Pinecone के साथ Generative AI के लिए Retrieval Augmented Generation (RAG) कोड बनाने के लिए प्रोग्राम प्रदान करती है, जो जनरेशन और इवैल्यूएशन के लिए OpenAI और Hugging Face मॉडल की शक्ति का लाभ उठाती है।
★ 624+2पिछले 7 दिनों में स्टार का बदलाव - #129
2B Model पर मल्टीमॉडल “आहा मोमेंट” का पता लगाएं
★ 623+0पिछले 7 दिनों में स्टार का बदलाव - #130
Hunyuan3D-Omni: 3D एसेट्स के नियंत्रित जनरेशन के लिए एक एकीकृत फ्रेमवर्क।
★ 618+5पिछले 7 दिनों में स्टार का बदलाव - #131★ 613—पिछले 7 दिनों में स्टार का बदलाव
- #132
[ECCV 2024] प्रॉम्प्टिंग के माध्यम से किसी भी चीज़ को टोकनाइज़ करें
★ 600+0पिछले 7 दिनों में स्टार का बदलाव - #133
बड़े पैमाने पर ऑम्नी-मोडल पोस्ट-ट्रेनिंग के लिए एक एसिंक्रोनस रिइंफोर्समेंट लर्निंग इंजन।
★ 597+12पिछले 7 दिनों में स्टार का बदलाव - #134
यह रिपॉजिटरी "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI" पेपर के लिए मूल्यांकन कोड प्रदान करती है।
★ 594+2पिछले 7 दिनों में स्टार का बदलाव - #135
"Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022] के लिए आधिकारिक कार्यान्वयन
★ 588+0पिछले 7 दिनों में स्टार का बदलाव - #136
GPT-4 Vision का उपयोग करके ब्राउज़र ऑटोमेशन बनाएं जैसे कि आप किसी इंसान को सिखा रहे हों।
★ 586+1पिछले 7 दिनों में स्टार का बदलाव - #137
[ECCV2024] स्थानीयकृत विजुअल टोकराइजेशन के साथ ग्राउंडेड मल्टीमॉडल लार्ज लैंग्वेज मॉडल
★ 586+0पिछले 7 दिनों में स्टार का बदलाव - #138
RAI फिजिकल AI रोबोटिक्स के लिए एक वेंडर-अज्ञेयवादी एजेंटिक फ्रेमवर्क है, जो जटिल कार्यों, परिभाषित परिदृश्यों, फ्री इंटरफ़ेस निष्पादन, लॉग सारांश, वॉयस इंटरैक्शन आदि को करने के लिए ROS 2 टूल्स का उपयोग करता है।
★ 585+7पिछले 7 दिनों में स्टार का बदलाव - #139★ 579+13पिछले 7 दिनों में स्टार का बदलाव
- #140
LLaVA-Mini एक एकीकृत बड़ा मल्टीмодальный मॉडल (LMM) है जो छवियों, उच्च-रिज़ॉल्यूशन छवियों और वीडियो की समझ को कुशलता से समर्थन कर सकता है।
★ 577+0पिछले 7 दिनों में स्टार का बदलाव - #141
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — React Native के लिए Alan AI SDK।
★ 575+0पिछले 7 दिनों में स्टार का बदलाव - #142
आंखों और कानों वाला एक MCP मल्टीमॉडल AI एजेंट!
★ 575-1पिछले 7 दिनों में स्टार का बदलाव - #143★ 572+1पिछले 7 दिनों में स्टार का बदलाव
- #144★ 568+0पिछले 7 दिनों में स्टार का बदलाव
- #145
Flame एक ओपन-सोर्स मल्टीमॉडल AI सिस्टम है जिसे UI डिज़ाइन मॉकअप को उच्च-गुणवत्ता वाले React कोड में बदलने के लिए डिज़ाइन किया गया है। यह डिज़ाइन और फ्रंट-एंड डेवलपमेंट के बीच की खाई को पाटने के लिए विजन-लैंग्वेज मॉडलिंग, स्वचालित डेटा संश्लेषण और संरचित प्रशिक्षण वर्कफ़्लो का लाभ उठाता है।
★ 562+0पिछले 7 दिनों में स्टार का बदलाव - #146
VLM के साथ उपयोग किए जाने वाले विभिन्न उद्योग-विशिष्ट स्कीमा के लिए एक हब।
★ 556+0पिछले 7 दिनों में स्टार का बदलाव - #147
शानदार मल्टीमॉडल मॉडलिंग [MLLM, UMM, और NMM शामिल हैं]।
★ 543+2पिछले 7 दिनों में स्टार का बदलाव - #148
"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model" का आधिकारिक कोड
★ 508+1पिछले 7 दिनों में स्टार का बदलाव