multimodal-llm
multimodal-llm टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर multimodal-llm के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और multimodal-llm टैग वाली रिपॉजिटरी।
- #1
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,350 - #2
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
मंदारिन, चीनी बोलियों और अंग्रेजी का समर्थन करने वाले ओपन-सोर्स इंडस्ट्रियल-ग्रेड ASR मॉडल, सार्वजनिक मंदारिन ASR बेंचमार्क पर एक नया SOTA हासिल करते हैं, साथ ही उत्कृष्ट गायन गीत पहचान क्षमता भी प्रदान करते हैं।
★ 1,975+2पिछले 7 दिनों में स्टार का बदलाव - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,350+426पिछले 7 दिनों में स्टार का बदलाव - #3
155+ विजन-लैंग्वेज मॉडल (VLM/MLLM) आर्किटेक्चर की क्यूरेटेड विजुअल कैटलॉग: पेपर, आरेख, ट्रेनिंग रेसिपी, डेटासेट, और मल्टीमॉडल AI एजेंटों के लिए रिलीज़ टाइमलाइन।
★ 1,310+2पिछले 7 दिनों में स्टार का बदलाव - #4
"MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens" पेपर का आधिकारिक कार्यान्वयन
★ 869+0पिछले 7 दिनों में स्टार का बदलाव - #5
ASR, VAD, LID और Punc मॉड्यूल के साथ एक अत्याधुनिक औद्योगिक-ग्रेड ऑल-इन-वन ASR सिस्टम। FireRedASR2 चीनी (मंदारिन, 20+ बोलियों/उच्चारणों), अंग्रेजी, कोड-स्विचिंग, और भाषण और गायन दोनों ASR का समर्थन करता है। FireRedVAD 100+ भाषाओं में भाषण/गायन/संगीत का समर्थन करता है। FireRedLID 100+ भाषाओं और 20+ चीनी बोलियों का समर्थन करता है। FireRedPunc चीनी और अंग्रेजी का समर्थन करता है।
★ 670+12पिछले 7 दिनों में स्टार का बदलाव