asr
asr टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #61★ 854+3पिछले 7 दिनों में स्टार का बदलाव
- #62
Voxtral ASR और TTS जो नेटिव और ब्राउज़र में चलते हैं। Burn ML फ्रेमवर्क का उपयोग करके Mistral के Voxtral mini रीयल-टाइम ASR / TTS का एक Rust कार्यान्वयन।
★ 819+2पिछले 7 दिनों में स्टार का बदलाव - #63
🎙️ एक इंटेलिजेंट वॉयस प्रोडक्टिविटी असिस्टेंट जो स्पीच को साफ टेक्स्ट, उपयोगी कार्यों और संरचित ज्ञान में बदलता है। यह उपयोगकर्ताओं को विचारों को कैप्चर करने, स्वाभाविक रूप से संवाद करने, दोहराव वाले कार्यों को स्वचालित करने और विभिन्न ऐप्स और वर्कफ़्लो में उत्पादक बने रहने में मदद करता है।
★ 809+6पिछले 7 दिनों में स्टार का बदलाव - #64
AI VTuber जो LLM, ASR, TTS, OCR, CV और अन्य तकनीकों के साथ लाइव स्ट्रीम करने या आपके साथ Minecraft खेलने में सक्षम है।
★ 803+5पिछले 7 दिनों में स्टार का बदलाव - #65
BiBi Keyboard: Kotlin पर आधारित Android प्लेटफॉर्म के लिए एक LLM और ASR वॉयस इनपुट मेथड कीबोर्ड एप्लिकेशन।
★ 774+21पिछले 7 दिनों में स्टार का बदलाव - #66
चीनी अंकों और अरबी अंकों के बीच त्वरित रूपांतरण (नवीनतम सुविधाएँ: भिन्न, दिनांक, तापमान आदि का रूपांतरण)।
★ 767+0पिछले 7 दिनों में स्टार का बदलाव - #67
PaddlePaddle पर आधारित वाक् पहचान (Speech Recognition), चीनी वाक् पहचान। परियोजना परिपक्व है और पहचान प्रभाव अच्छा है। Windows और Linux के तहत प्रशिक्षण और पूर्वानुमान का समर्थन करता है, और Nvidia Jetson विकास बोर्ड पूर्वानुमान का समर्थन करता है।
★ 763+1पिछले 7 दिनों में स्टार का बदलाव - #68
Unity3d में स्थानीय मशीन पर स्पीच-टू-टेक्स्ट मॉडल (whisper.cpp) चलाना।
★ 751+1पिछले 7 दिनों में स्टार का बदलाव - #69
Pytorch में कार्यान्वित स्ट्रीमिंग और नॉन-स्ट्रीमिंग ऑटोमैटिक स्पीच रिकग्निशन फ्रेमवर्क, जो ऑनलाइन और ऑफलाइन रिकग्निशन के साथ संगत है, वर्तमान में Conformer, Squeezeformer, और DeepSpeech2 मॉडल का समर्थन करता है और विभिन्न डेटा ऑगमेंटेशन विधियों के साथ आता है।
★ 727+0पिछले 7 दिनों में स्टार का बदलाव - #70
PyTorch-Lightning और Hydra का लाभ उठाने वाला एंड-टू-एंड स्पीच रिकग्निशन के लिए ओपन-सोर्स टूलकिट।
★ 714+0पिछले 7 दिनों में स्टार का बदलाव - #71
Android के लिए OpenAI Whisper और TensorFlow Lite के साथ ऑफ़लाइन वाक् पहचान (Speech Recognition)
★ 688+0पिछले 7 दिनों में स्टार का बदलाव - #72
INTERSPEECH 2023-2024 पेपर्स: INTERSPEECH 2023-24 सम्मेलन से प्रभावशाली और रोमांचक शोध पत्रों का एक संपूर्ण संग्रह। स्पीच और लैंग्वेज प्रोसेसिंग में नवीनतम प्रगति का अन्वेषण करें। कोड शामिल है।
★ 684+0पिछले 7 दिनों में स्टार का बदलाव - #73★ 677+0पिछले 7 दिनों में स्टार का बदलाव
- #74
ASR, VAD, LID और Punc मॉड्यूल के साथ एक अत्याधुनिक औद्योगिक-ग्रेड ऑल-इन-वन ASR सिस्टम। FireRedASR2 चीनी (मंदारिन, 20+ बोलियों/उच्चारणों), अंग्रेजी, कोड-स्विचिंग, और भाषण और गायन दोनों ASR का समर्थन करता है। FireRedVAD 100+ भाषाओं में भाषण/गायन/संगीत का समर्थन करता है। FireRedLID 100+ भाषाओं और 20+ चीनी बोलियों का समर्थन करता है। FireRedPunc चीनी और अंग्रेजी का समर्थन करता है।
★ 673+15पिछले 7 दिनों में स्टार का बदलाव - #75★ 671+0पिछले 7 दिनों में स्टार का बदलाव
- #76
रीयल-टाइम ऑडियो अनुवाद, सिस्टम ऑडियो + माइक कैप्चर करता है, ASR (Whisper/SenseVoice) चलाता है, और स्ट्रीमिंग डिस्प्ले के साथ LLM API के माध्यम से अनुवाद करता है। VTubers, लाइवस्ट्रीमर्स और विदेशी सामग्री देखने के लिए उपयुक्त।
★ 634+39पिछले 7 दिनों में स्टार का बदलाव - #77
🤗 Optimum Intel: Intel अनुकूलन टूल के साथ इन्फेरेंस को गति दें
★ 618+1पिछले 7 दिनों में स्टार का बदलाव - #78
स्पीच रिकग्निशन सिद्धांत, शोध पत्र और PPT
★ 618+0पिछले 7 दिनों में स्टार का बदलाव - #79
व्यावसायिक-ग्रेड ओपन-सोर्स स्पीच रिकग्निशन लाइब्रेरी, जो आउट-ऑफ-द-बॉक्स काम करती है और चीनी-अंग्रेजी मिश्रित पहचान का समर्थन करती है। यह ONNXRuntime और FunASR पर आधारित ASR इन्फरेंस का क्रॉस-प्लेटफ़ॉर्म कार्यान्वयन है।
★ 610+0पिछले 7 दिनों में स्टार का बदलाव - #80
ओपन सोर्स वॉयस एजेंट प्लेटफॉर्म।
★ 592+2पिछले 7 दिनों में स्टार का बदलाव - #81
एक क्रॉस-प्लेटफ़ॉर्म रीयल-टाइम सबटाइटल डिस्प्ले सॉफ़्टवेयर।
★ 579+4पिछले 7 दिनों में स्टार का बदलाव - #82
Whisper Model के लिए एक अनुकूलित Speech-to-Text Pipeline जो कई Inference Engine का समर्थन करती है
★ 578+1पिछले 7 दिनों में स्टार का बदलाव - #83
SpeechIO लीडरबोर्ड: ऑटोमैटिक स्पीच रिकग्निशन के लिए एक बड़ा, मजबूत और व्यापक बेंचमार्किंग प्लेटफ़ॉर्म।
★ 553+3पिछले 7 दिनों में स्टार का बदलाव - #84
Vosk के WebAssembly बिल्ड की मदद से ब्राउज़र में चलने वाली एक स्पीच रिकग्निशन लाइब्रेरी।
★ 529+1पिछले 7 दिनों में स्टार का बदलाव - #85
ICASSP 2023-2024 पेपर्स: ICASSP 2023-24 सम्मेलनों से प्रभावशाली और रोमांचक शोध पत्रों का एक संपूर्ण संग्रह। ध्वनिकी, भाषण और सिग्नल प्रोसेसिंग में नवीनतम प्रगति का पता लगाएं। कोड शामिल है। ऑडियो और सिग्नल प्रोसेसिंग की प्रगति का समर्थन करने के लिए रिपॉजिटरी को स्टार दें!
★ 526+1पिछले 7 दिनों में स्टार का बदलाव - #86
RPI Zero 2w / 5 का उपयोग करके बनाया गया पॉकेट-साइज़ AI चैटबॉट
★ 513+10पिछले 7 दिनों में स्टार का बदलाव - #87
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 502+8पिछले 7 दिनों में स्टार का बदलाव - #88
Clip any video into a narration recap with claude code skill|用 claude code skill 把任何视频剪辑成中文解说视频,支持剪映导出
★ 501—पिछले 7 दिनों में स्टार का बदलाव