funasr
funasr टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर funasr के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और funasr टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
ट्रेनिंग, इन्फरेंस, स्ट्रीमिंग ASR, VAD, पंक्चुएशन, स्पीकर डायराइजेशन पाइपलाइन्स और OpenAI-संगत/MCP सर्विंग के लिए ओपन-सोर्स स्पीच रिकग्निशन टूलकिट।
★ 20,136+64पिछले 7 दिनों में स्टार का बदलाव - #2
मंदारिन, कैंटोनीज़, अंग्रेजी, जापानी और कोरियाई ASR, भाषा पहचान, भावना पहचान और ऑडियो इवेंट डिटेक्शन के लिए ओपन-सोर्स SenseVoiceSmall मॉडल।
★ 9,209+37पिछले 7 दिनों में स्टार का बदलाव - #3
लोकल Gradio UI के साथ FunASR-संचालित वीडियो ट्रांसक्रिप्शन, सबटाइटल जनरेशन, और LLM-सहायता प्राप्त क्लिपिंग टूल।
★ 6,210+13पिछले 7 दिनों में स्टार का बदलाव - #4
वीडियो सबटाइटल जनरेशन, अनुवाद, AI डबिंग, वॉयस क्लोनिंग और सबटाइटल बर्निंग के लिए मुफ्त और ओपन-सोर्स डेस्कटॉप टूल। यह Whisper/FunASR जैसे स्थानीय मॉडल्स का उपयोग करता है और GPU एक्सेलेरेशन के साथ विंडोज, मैकओएस और लिनक्स पर काम करता है।
★ 4,863+48पिछले 7 दिनों में स्टार का बदलाव - #5
ऑडियो और वीडियो सामग्री को तेज़ी से निकालें और इसे एक संरचित markdown नोट्स में व्यवस्थित करें
★ 2,483+7पिछले 7 दिनों में स्टार का बदलाव - #6
ओपन-सोर्स और मुफ़्त Wispr Flow विकल्प | FunASR स्थानीय मॉडल और कॉन्फ़िगर करने योग्य LLM को एकीकृत करने वाला अगली पीढ़ी का चीनी डेस्कटॉप वॉइस वर्कफ़्लो
★ 2,278+5पिछले 7 दिनों में स्टार का बदलाव - #7
Bailing GPT-4o जैसा एक语音对话机器人 है, जो ASR+LLM+TTS के माध्यम से महसूस किया जाता है, DeepSeek R1 जैसे उत्कृष्ट बड़े मॉडल को एकीकृत करता है, openClaw तक पहुंचता है, एक सच्चा व्यक्तिगत语音 सहायक है, विलंबता 800ms जितनी कम है, Mac जैसे कम-कॉन्फ़िगरेशन वाले डिवाइस भी चल सकते हैं, और रुकावट का समर्थन करता है।
★ 1,759+2पिछले 7 दिनों में स्टार का बदलाव - #8
चीनी, बोलियों, लहजों और बहुभाषी भाषण के लिए ओपन-सोर्स LLM-आधारित ASR मॉडल परिवार, FunASR, vLLM, स्ट्रीमिंग और llama.cpp रनटाइम के साथ।
★ 1,512+10पिछले 7 दिनों में स्टार का बदलाव - #9
MTools एक शक्तिशाली बहु-कार्यात्मक डेस्कटॉप एप्लिकेशन है, जो ऑडियो-वीडियो प्रोसेसिंग, इमेज एडिटिंग, टेक्स्ट ऑपरेशन और कोडिंग टूल को एकीकृत करता है, जिसमें अंतर्निहित AI संवर्द्धन विशेषताएं हैं। इसका उद्देश्य आपके वर्कफ़्लो को सरल बनाना और उत्पादकता बढ़ाना है।
★ 1,305+5पिछले 7 दिनों में स्टार का बदलाव - #10
VocoType स्थानीय स्तर पर चलने वाला एक गोपनीयता-सुरक्षित वॉयस इनपुट टूल है, जो हॉटकी के माध्यम से आवाज को वास्तविक समय में टेक्स्ट में बदलता है और इसे वर्तमान एप्लिकेशन में स्वचालित रूप से इनपुट करता है। यह वॉयस-टू-टेक्स्ट MCP, AI टेक्स्ट ऑप्टिमाइज़ेशन, कस्टम रिप्लेसमेंट डिक्शनरी और रिकॉर्डिंग/वीडियो-टू-टेक्स्ट जैसे कार्यों का समर्थन करता है, जिससे वॉयस इनपुट अधिक कुशल और सुरक्षित हो जाता है।
★ 928+9पिछले 7 दिनों में स्टार का बदलाव - #11
रीयल-टाइम ऑडियो अनुवाद, सिस्टम ऑडियो + माइक कैप्चर करता है, ASR (Whisper/SenseVoice) चलाता है, और स्ट्रीमिंग डिस्प्ले के साथ LLM API के माध्यम से अनुवाद करता है। VTubers, लाइवस्ट्रीमर्स और विदेशी सामग्री देखने के लिए उपयुक्त।
★ 625+38पिछले 7 दिनों में स्टार का बदलाव