asr
Dépôts open source suivis étiquetés asr, triés par étoiles.
- #61
Voxtral ASR & TTS fonctionnant nativement et dans le navigateur. Une implémentation en Rust du modèle Voxtral mini de Mistral pour l'ASR/TTS en temps réel, utilisant le framework Burn ML.
★ 819+2Évolution des étoiles sur les 7 derniers jours - #62
🎙️ Un assistant vocal intelligent qui transforme la parole en texte propre, en actions utiles et en connaissances structurées. Il aide les utilisateurs à capturer des idées, communiquer naturellement, automatiser les tâches répétitives et rester productifs à travers différentes applications et flux de travail.
★ 804+1Évolution des étoiles sur les 7 derniers jours - #63
VTuber IA utilisant LLM, ASR, TTS, OCR, CV et d'autres technologies pour diffuser en direct ou jouer à Minecraft avec vous.
★ 801+3Évolution des étoiles sur les 7 derniers jours - #64
BiBi Keyboard : une application de clavier de saisie vocale LLM et ASR pour la plateforme Android, basée sur Kotlin
★ 767+10Évolution des étoiles sur les 7 derniers jours - #65
Conversion rapide entre chiffres chinois et chiffres arabes (dernières fonctionnalités : fractions, dates, températures, etc.)
★ 766+0Évolution des étoiles sur les 7 derniers jours - #66
Reconnaissance vocale chinoise basée sur PaddlePaddle. Projet complet avec d'excellentes performances. Supporte l'entraînement et l'inférence sur Windows et Linux, ainsi que sur les cartes de développement Nvidia Jetson.
★ 762+0Évolution des étoiles sur les 7 derniers jours - #67
Exécution du modèle de reconnaissance vocale whisper.cpp dans Unity3d en local
★ 751+0Évolution des étoiles sur les 7 derniers jours - #68
Framework de reconnaissance vocale automatique (ASR) en PyTorch, compatible avec les modes streaming et non-streaming, supportant les modèles Conformer, Squeezeformer et DeepSpeech2, ainsi que diverses méthodes d'augmentation de données.
★ 727+0Évolution des étoiles sur les 7 derniers jours - #69
Boîte à outils open source pour la reconnaissance vocale de bout en bout utilisant PyTorch-Lightning et Hydra.
★ 714-1Évolution des étoiles sur les 7 derniers jours - #70
Reconnaissance vocale hors ligne avec OpenAI Whisper et TensorFlow Lite pour Android
★ 688-1Évolution des étoiles sur les 7 derniers jours - #71
Papers INTERSPEECH 2023-2024 : une collection complète de papiers influents et passionnants de la conférence INTERSPEECH 2023-24. Découvrez les dernières avancées dans le traitement du discours et du langage. Code inclus. Étoinez le dépôt pour soutenir l'avancement de la technologie vocale !
★ 684-1Évolution des étoiles sur les 7 derniers jours - #72★ 677+0Évolution des étoiles sur les 7 derniers jours
- #73
Moteur de diffusion de reconnaissance vocale à la volée exécuté sur appareil, alimenté par l'apprentissage profond.
★ 671+0Évolution des étoiles sur les 7 derniers jours - #74
Système ASR industriel tout-en-un de pointe incluant des modules ASR, VAD, LID et de ponctuation. FireRedASR2 prend en charge le chinois, l'anglais, le code-switching ainsi que la reconnaissance de la parole et du chant.
★ 669+10Évolution des étoiles sur les 7 derniers jours - #75
Traduction audio en temps réel, capture l'audio système et le micro, exécute ASR (Whisper/SenseVoice), traduit via l'API LLM avec affichage en streaming. Idéal pour les VTubers, les streamers et le visionnage de contenus étrangers.
★ 621+18Évolution des étoiles sur les 7 derniers jours - #76
Théorie, articles et présentations sur la reconnaissance vocale
★ 618+0Évolution des étoiles sur les 7 derniers jours - #77
🤗 Optimum Intel : Accélérez l'inférence avec les outils d'optimisation Intel
★ 617+1Évolution des étoiles sur les 7 derniers jours - #78
📣 Bibliothèque open source de reconnaissance automatique de la parole de niveau commercial, prête à l'emploi, multiplateforme, avec reconnaissance mixte chinois-anglais. Implémentation multiplateforme d'inférence ASR basée sur ONNXRuntime et FunASR, fournissant des API simplifiées pour appeler les modèles ASR.
★ 611-1Évolution des étoiles sur les 7 derniers jours - #79
Plateforme d'agent vocal open source
★ 591+0Évolution des étoiles sur les 7 derniers jours - #80
Un logiciel d'affichage de sous-titres en temps réel et multiplateforme.
★ 578+3Évolution des étoiles sur les 7 derniers jours - #81
Un pipeline de transcription (Speech-to-Text) optimisé pour le modèle Whisper prenant en charge plusieurs moteurs d'inférence
★ 578+1Évolution des étoiles sur les 7 derniers jours - #82
SpeechIO Leaderboard : une plateforme de benchmarking vaste, robuste et complète pour la reconnaissance automatique de la parole.
★ 553+3Évolution des étoiles sur les 7 derniers jours - #83
Une bibliothèque de reconnaissance vocale fonctionnant dans le navigateur grâce à une compilation WebAssembly de Vosk
★ 529+0Évolution des étoiles sur les 7 derniers jours - #84
Articles ICASSP 2023-2024 : Une collection complète de recherches influentes issues des conférences ICASSP 2023-24. Explorez les dernières avancées en acoustique, parole et traitement du signal. Code inclus.
★ 526+0Évolution des étoiles sur les 7 derniers jours - #85
Pocket-sized AI chatbot built using a RPI Zero 2w / 5
★ 511+4Évolution des étoiles sur les 7 derniers jours