मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · speech

speech

speech टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

74 रिपॉजिटरी
  • MARS5-TTS@Camb-ai

    CAMB.AI से MARS5 स्पीच मॉडल (TTS)

    2,818+1पिछले 7 दिनों में स्टार का बदलाव
  • speechgpt@hahahumble

    💬 SpeechGPT एक वेब एप्लिकेशन है जो आपको ChatGPT के साथ बातचीत करने की अनुमति देता है।

    2,750-1पिछले 7 दिनों में स्टार का बदलाव
  • gTTS@pndurette

    Google Translate की टेक्स्ट-टू-स्पीच API के साथ इंटरफेस करने के लिए Python लाइब्रेरी और CLI टूल।

    2,628+0पिछले 7 दिनों में स्टार का बदलाव
  • ten-vad@TEN-framework

    वॉयस एक्टिविटी डिटेक्टर (VAD): कम-विलंबता, उच्च-प्रदर्शन और हल्का

    2,256+7पिछले 7 दिनों में स्टार का बदलाव
  • IMS-Toucan@DigitalPhonetics

    7000 से अधिक भाषाओं के लिए नियंत्रणीय और तेज़ Text-to-Speech!

    2,207-1पिछले 7 दिनों में स्टार का बदलाव
  • soloud@jarikomppa

    गेम के लिए स्वतंत्र, आसान और पोर्टेबल ऑडियो इंजन।

    2,170+3पिछले 7 दिनों में स्टार का बदलाव
  • openai-edge-tts@travisvn

    OpenAI, Azure, या ElevenLabs को बदलने के लिए मुफ़्त, उच्च-गुणवत्ता वाला text-to-speech API एंडपॉइंट

    2,075+5पिछले 7 दिनों में स्टार का बदलाव
  • Praat: कंप्यूटर द्वारा ध्वन्यात्मकता (Phonetics) करना

    1,970+1पिछले 7 दिनों में स्टार का बदलाव
  • julius@julius-speech

    ओपन-सोर्स लार्ज वोकैबुलरी कंटीन्यूअस स्पीच रिकग्निशन इंजन

    1,935+1पिछले 7 दिनों में स्टार का बदलाव
  • ऑडियो और संगीत तकनीक में AI के साथ काम करने वाले स्टार्टअप्स की कम्युनिटी सूची

    1,769+1पिछले 7 दिनों में स्टार का बदलाव
  • SALMONN@bytedance

    SALMONN परिवार: उन्नत मल्टी-मोडल LLMs का एक सूट

    1,521+3पिछले 7 दिनों में स्टार का बदलाव
  • voicefixer@haoheliu

    सामान्य भाषण बहाली

    1,375+0पिछले 7 दिनों में स्टार का बदलाव
  • CrisperWhisper@nyrahealth

    नियंत्रित ट्रांसक्रिप्शन। शब्द-स्तर के टाइमस्टैम्प के साथ सटीक (प्रत्येक फिलर, विराम, हकलाना, स्वर ध्वनि) या इच्छित (वक्ता क्या कहना चाहता था, पठनीयता के लिए अनुकूलित)।

    1,371+13पिछले 7 दिनों में स्टार का बदलाव
  • nlp-paper@DengBoCong

    प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में संबंधित शोध पत्र (पढ़ने के नोट्स के साथ), मॉडल पुनरुत्पादन और डेटा प्रसंस्करण आदि (कोड में TensorFlow और PyTorch दोनों संस्करण शामिल हैं)

    1,333+1पिछले 7 दिनों में स्टार का बदलाव
  • MTools@HG-ha

    MTools एक शक्तिशाली बहु-कार्यात्मक डेस्कटॉप एप्लिकेशन है, जो ऑडियो-वीडियो प्रोसेसिंग, इमेज एडिटिंग, टेक्स्ट ऑपरेशन और कोडिंग टूल को एकीकृत करता है, जिसमें अंतर्निहित AI संवर्द्धन विशेषताएं हैं। इसका उद्देश्य आपके वर्कफ़्लो को सरल बनाना और उत्पादकता बढ़ाना है।

    1,305+5पिछले 7 दिनों में स्टार का बदलाव
  • StreamSpeech@ictnlp

    StreamSpeech ऑफ़लाइन और एक साथ स्पीच रिकग्निशन, स्पीच ट्रांसलेशन और स्पीच सिंथेसिस के लिए एक "ऑल इन वन" सीमलेस मॉडल है।

    1,288+0पिछले 7 दिनों में स्टार का बदलाव
  • Deep-Learning-Experiments@roatienza

    डीप लर्निंग को समझने के लिए वीडियो, नोट्स और प्रयोग

    1,198+0पिछले 7 दिनों में स्टार का बदलाव
  • lhotse@lhotse-speech

    मशीन लर्निंग प्रोजेक्ट्स में मल्टीमॉडल डेटा को संभालने के लिए उपकरण।

    1,149-1पिछले 7 दिनों में स्टार का बदलाव
  • conformer@sooftware

    "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020) का [अनौपचारिक] PyTorch कार्यान्वयन

    1,132+1पिछले 7 दिनों में स्टार का बदलाव
  • pykaldi@pykaldi

    Kaldi के लिए एक Python रैपर।

    1,040+1पिछले 7 दिनों में स्टार का बदलाव
  • FireRedTTS@FireRedTeam

    एक ओपन-सोर्स LLM-सक्षम फाउंडेशन TTS सिस्टम

    920+1पिछले 7 दिनों में स्टार का बदलाव
  • inaSpeechSegmenter@ina-foss

    CNN-आधारित ऑडियो सेगमेंटेशन टूलकिट। यह स्पीच, म्यूजिक, नॉइज़ और स्पीकर के जेंडर का पता लगाने की अनुमति देता है। इसे प्रति जेंडर स्पीच समय के आधार पर बड़े पैमाने पर जेंडर समानता अध्ययन के लिए डिज़ाइन किया गया है।

    910+1पिछले 7 दिनों में स्टार का बदलाव
  • diffwave@lmnt-com

    DiffWave एक तेज़, उच्च-गुणवत्ता वाला न्यूरल वोकोडर और वेवफॉर्म सिंथेसाइज़र है।

    885+0पिछले 7 दिनों में स्टार का बदलाव
  • AnyGPT@OpenMOSS

    AnyGPT: डिस्क्रीट सीक्वेंस मॉडलिंग के साथ यूनिफाइड मल्टीमॉडल LLM के लिए कोड

    881-1पिछले 7 दिनों में स्टार का बदलाव
  • PPASR@yeyupiaoling

    PaddlePaddle पर आधारित एंड-टू-एंड चीनी वॉयस रिकग्निशन, शुरुआती से लेकर व्यावहारिक प्रोजेक्ट्स तक। DeepSpeech2, Conformer और Squeezeformer मॉडल्स का समर्थन करता है।

    870-1पिछले 7 दिनों में स्टार का बदलाव
  • Voxtral ASR और TTS जो नेटिव और ब्राउज़र में चलते हैं। Burn ML फ्रेमवर्क का उपयोग करके Mistral के Voxtral mini रीयल-टाइम ASR / TTS का एक Rust कार्यान्वयन।

    819+2पिछले 7 दिनों में स्टार का बदलाव
  • AlphaAvatar@AlphaAvatar

    LiveKit पर बनाया गया एक रियल-टाइम इंटरैक्टिव Omni Avatar, जो आपको किसी भी ओपन सोर्स अवतार घटकों (रियल-टाइम मॉडल, विजुअल, वॉयस, मेमोरी, सर्च, आदि) के साथ सहजता से एकीकृत करने की अनुमति देता है।

    813+4पिछले 7 दिनों में स्टार का बदलाव
  • XR3Player@goxr3plus

    🎧 🎼 सबसे उन्नत JavaFX मीडिया प्लेयर।

    771+0पिछले 7 दिनों में स्टार का बदलाव
  • cboard@cboard-org

    ब्राउज़र के लिए टेक्स्ट-टू-स्पीच के साथ ऑगमेंटेटिव और अल्टरनेटिव कम्युनिकेशन (AAC) सिस्टम

    755+9पिछले 7 दिनों में स्टार का बदलाव
  • allosaurus@xinjli

    Allosaurus 2000 से अधिक भाषाओं के लिए एक प्रीट्रेन्ड यूनिवर्सल फोन रिकॉग्नाइज़र है

    746+4पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस