QwenAudio
QwenAudio की ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #1
बहु-भाषी बड़ा वॉइस जनरेशन मॉडल, जो इन्फेरेंस, ट्रेनिंग और डिप्लॉयमेंट की फुल-स्टैक क्षमता प्रदान करता है।
★ 23,426+359पिछले 7 दिनों में स्टार का बदलाव - #2
मंदारिन, कैंटोनीज़, अंग्रेजी, जापानी और कोरियाई ASR, भाषा पहचान, भावना पहचान और ऑडियो इवेंट डिटेक्शन के लिए ओपन-सोर्स SenseVoiceSmall मॉडल।
★ 9,209+37पिछले 7 दिनों में स्टार का बदलाव - #3
एक रीयल-टाइम वॉयस रनटाइम जो एजेंट्स को बात करते, काम करते और मौजूद रखते हुए रखता है। AI एजेंट्स के लिए रीयल-टाइम वॉयस रनटाइम
★ 2,358+68पिछले 7 दिनों में स्टार का बदलाव - #4
चीनी, बोलियों, लहजों और बहुभाषी भाषण के लिए ओपन-सोर्स LLM-आधारित ASR मॉडल परिवार, FunASR, vLLM, स्ट्रीमिंग और llama.cpp रनटाइम के साथ।
★ 1,512+10पिछले 7 दिनों में स्टार का बदलाव - #5
[NeurIPS 2025] [ThinkSound] का PyTorch कार्यान्वयन, चेन-ऑफ-थॉट (CoT) तर्क द्वारा निर्देशित, किसी भी तौर-तरीके से ऑडियो जनरेट करने के लिए एक एकीकृत फ्रेमवर्क।
★ 1,378+0पिछले 7 दिनों में स्टार का बदलाव - #6
Fun-Audio-Chat एक लार्ज ऑडियो लैंग्वेज मॉडल है जिसे प्राकृतिक, कम-विलंबता वाले वॉयस इंटरैक्शन के लिए बनाया गया है
★ 1,002+3पिछले 7 दिनों में स्टार का बदलाव