मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · asr

asr

asr टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

88 रिपॉजिटरी
  • GLM-ASR@zai-org

    GLM-ASR-Nano: 1.5B पैरामीटर्स वाला एक मजबूत, ओपन-सोर्स स्पीच रिकग्निशन मॉडल

    854+3पिछले 7 दिनों में स्टार का बदलाव
  • Voxtral ASR और TTS जो नेटिव और ब्राउज़र में चलते हैं। Burn ML फ्रेमवर्क का उपयोग करके Mistral के Voxtral mini रीयल-टाइम ASR / TTS का एक Rust कार्यान्वयन।

    819+2पिछले 7 दिनों में स्टार का बदलाव
  • voxt@hehehai

    🎙️ एक इंटेलिजेंट वॉयस प्रोडक्टिविटी असिस्टेंट जो स्पीच को साफ टेक्स्ट, उपयोगी कार्यों और संरचित ज्ञान में बदलता है। यह उपयोगकर्ताओं को विचारों को कैप्चर करने, स्वाभाविक रूप से संवाद करने, दोहराव वाले कार्यों को स्वचालित करने और विभिन्न ऐप्स और वर्कफ़्लो में उत्पादक बने रहने में मदद करता है।

    809+6पिछले 7 दिनों में स्टार का बदलाव
  • ZerolanLiveRobot@AkagawaTsurunaki

    AI VTuber जो LLM, ASR, TTS, OCR, CV और अन्य तकनीकों के साथ लाइव स्ट्रीम करने या आपके साथ Minecraft खेलने में सक्षम है।

    803+5पिछले 7 दिनों में स्टार का बदलाव
  • BiBi-Keyboard@BryceWG

    BiBi Keyboard: Kotlin पर आधारित Android प्लेटफॉर्म के लिए एक LLM और ASR वॉयस इनपुट मेथड कीबोर्ड एप्लिकेशन।

    774+21पिछले 7 दिनों में स्टार का बदलाव
  • cn2an@Ailln

    चीनी अंकों और अरबी अंकों के बीच त्वरित रूपांतरण (नवीनतम सुविधाएँ: भिन्न, दिनांक, तापमान आदि का रूपांतरण)।

    767+0पिछले 7 दिनों में स्टार का बदलाव
  • PaddlePaddle-DeepSpeech@yeyupiaoling

    PaddlePaddle पर आधारित वाक् पहचान (Speech Recognition), चीनी वाक् पहचान। परियोजना परिपक्व है और पहचान प्रभाव अच्छा है। Windows और Linux के तहत प्रशिक्षण और पूर्वानुमान का समर्थन करता है, और Nvidia Jetson विकास बोर्ड पूर्वानुमान का समर्थन करता है।

    763+1पिछले 7 दिनों में स्टार का बदलाव
  • Unity3d में स्थानीय मशीन पर स्पीच-टू-टेक्स्ट मॉडल (whisper.cpp) चलाना।

    751+1पिछले 7 दिनों में स्टार का बदलाव
  • MASR@yeyupiaoling

    Pytorch में कार्यान्वित स्ट्रीमिंग और नॉन-स्ट्रीमिंग ऑटोमैटिक स्पीच रिकग्निशन फ्रेमवर्क, जो ऑनलाइन और ऑफलाइन रिकग्निशन के साथ संगत है, वर्तमान में Conformer, Squeezeformer, और DeepSpeech2 मॉडल का समर्थन करता है और विभिन्न डेटा ऑगमेंटेशन विधियों के साथ आता है।

    727+0पिछले 7 दिनों में स्टार का बदलाव
  • openspeech@openspeech-team

    PyTorch-Lightning और Hydra का लाभ उठाने वाला एंड-टू-एंड स्पीच रिकग्निशन के लिए ओपन-सोर्स टूलकिट।

    714+0पिछले 7 दिनों में स्टार का बदलाव
  • Android के लिए OpenAI Whisper और TensorFlow Lite के साथ ऑफ़लाइन वाक् पहचान (Speech Recognition)

    688+0पिछले 7 दिनों में स्टार का बदलाव
  • INTERSPEECH 2023-2024 पेपर्स: INTERSPEECH 2023-24 सम्मेलन से प्रभावशाली और रोमांचक शोध पत्रों का एक संपूर्ण संग्रह। स्पीच और लैंग्वेज प्रोसेसिंग में नवीनतम प्रगति का अन्वेषण करें। कोड शामिल है।

    684+0पिछले 7 दिनों में स्टार का बदलाव
  • pyannote-whisper@yinruiqing
    677+0पिछले 7 दिनों में स्टार का बदलाव
  • FireRedASR2S@FireRedTeam

    ASR, VAD, LID और Punc मॉड्यूल के साथ एक अत्याधुनिक औद्योगिक-ग्रेड ऑल-इन-वन ASR सिस्टम। FireRedASR2 चीनी (मंदारिन, 20+ बोलियों/उच्चारणों), अंग्रेजी, कोड-स्विचिंग, और भाषण और गायन दोनों ASR का समर्थन करता है। FireRedVAD 100+ भाषाओं में भाषण/गायन/संगीत का समर्थन करता है। FireRedLID 100+ भाषाओं और 20+ चीनी बोलियों का समर्थन करता है। FireRedPunc चीनी और अंग्रेजी का समर्थन करता है।

    673+15पिछले 7 दिनों में स्टार का बदलाव
  • cheetah@Picovoice

    डीप लर्निंग द्वारा संचालित ऑन-डिफ़ाइस स्ट्रीमिंग स्पीच-टू-टेक्स्ट इंजन

    671+0पिछले 7 दिनों में स्टार का बदलाव
  • LiveTranslate@TheDeathDragon

    रीयल-टाइम ऑडियो अनुवाद, सिस्टम ऑडियो + माइक कैप्चर करता है, ASR (Whisper/SenseVoice) चलाता है, और स्ट्रीमिंग डिस्प्ले के साथ LLM API के माध्यम से अनुवाद करता है। VTubers, लाइवस्ट्रीमर्स और विदेशी सामग्री देखने के लिए उपयुक्त।

    634+39पिछले 7 दिनों में स्टार का बदलाव
  • optimum-intel@huggingface

    🤗 Optimum Intel: Intel अनुकूलन टूल के साथ इन्फेरेंस को गति दें

    618+1पिछले 7 दिनों में स्टार का बदलाव
  • ASR_Theory@zw76859420

    स्पीच रिकग्निशन सिद्धांत, शोध पत्र और PPT

    618+0पिछले 7 दिनों में स्टार का बदलाव
  • RapidASR@RapidAI

    व्यावसायिक-ग्रेड ओपन-सोर्स स्पीच रिकग्निशन लाइब्रेरी, जो आउट-ऑफ-द-बॉक्स काम करती है और चीनी-अंग्रेजी मिश्रित पहचान का समर्थन करती है। यह ONNXRuntime और FunASR पर आधारित ASR इन्फरेंस का क्रॉस-प्लेटफ़ॉर्म कार्यान्वयन है।

    610+0पिछले 7 दिनों में स्टार का बदलाव
  • echokit_server@second-state

    ओपन सोर्स वॉयस एजेंट प्लेटफॉर्म।

    592+2पिछले 7 दिनों में स्टार का बदलाव
  • auto-caption@HiMeditator

    एक क्रॉस-प्लेटफ़ॉर्म रीयल-टाइम सबटाइटल डिस्प्ले सॉफ़्टवेयर।

    579+4पिछले 7 दिनों में स्टार का बदलाव
  • WhisperS2T@shashikg

    Whisper Model के लिए एक अनुकूलित Speech-to-Text Pipeline जो कई Inference Engine का समर्थन करती है

    578+1पिछले 7 दिनों में स्टार का बदलाव
  • Leaderboard@SpeechColab

    SpeechIO लीडरबोर्ड: ऑटोमैटिक स्पीच रिकग्निशन के लिए एक बड़ा, मजबूत और व्यापक बेंचमार्किंग प्लेटफ़ॉर्म।

    553+3पिछले 7 दिनों में स्टार का बदलाव
  • vosk-browser@ccoreilly

    Vosk के WebAssembly बिल्ड की मदद से ब्राउज़र में चलने वाली एक स्पीच रिकग्निशन लाइब्रेरी।

    529+1पिछले 7 दिनों में स्टार का बदलाव
  • ICASSP-2023-24-Papers@DmitryRyumin

    ICASSP 2023-2024 पेपर्स: ICASSP 2023-24 सम्मेलनों से प्रभावशाली और रोमांचक शोध पत्रों का एक संपूर्ण संग्रह। ध्वनिकी, भाषण और सिग्नल प्रोसेसिंग में नवीनतम प्रगति का पता लगाएं। कोड शामिल है। ऑडियो और सिग्नल प्रोसेसिंग की प्रगति का समर्थन करने के लिए रिपॉजिटरी को स्टार दें!

    526+1पिछले 7 दिनों में स्टार का बदलाव
  • whisplay-ai-chatbot@PiSugar

    RPI Zero 2w / 5 का उपयोग करके बनाया गया पॉकेट-साइज़ AI चैटबॉट

    513+10पिछले 7 दिनों में स्टार का बदलाव
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    502+8पिछले 7 दिनों में स्टार का बदलाव
  • video-recap-skills@zenstory-ai

    Clip any video into a narration recap with claude code skill|用 claude code skill 把任何视频剪辑成中文解说视频,支持剪映导出

    501पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस