speech-recognition
Dépôts open source suivis étiquetés speech-recognition, triés par étoiles.
- #121★ 719+0Évolution des étoiles sur les 7 derniers jours
- #122
Transcription de la parole en texte et saisie de sous-titres via KB pour OBS, VRChat, le chat Twitch et Discord.
★ 718+0Évolution des étoiles sur les 7 derniers jours - #123
Boîte à outils open source pour la reconnaissance vocale de bout en bout utilisant PyTorch-Lightning et Hydra.
★ 714+0Évolution des étoiles sur les 7 derniers jours - #124
Moteur de conversion de la parole en intention sur l'appareil propulsé par l'apprentissage profond
★ 712+3Évolution des étoiles sur les 7 derniers jours - #125
Exemple d'API vocale
★ 708+0Évolution des étoiles sur les 7 derniers jours - #126
Framework de benchmark pour la reconnaissance vocale (speech-to-text)
★ 697+0Évolution des étoiles sur les 7 derniers jours - #127
Reconnaissance vocale hors ligne avec OpenAI Whisper et TensorFlow Lite pour Android
★ 688+0Évolution des étoiles sur les 7 derniers jours - #128
Papers INTERSPEECH 2023-2024 : une collection complète de papiers influents et passionnants de la conférence INTERSPEECH 2023-24. Découvrez les dernières avancées dans le traitement du discours et du langage. Code inclus. Étoinez le dépôt pour soutenir l'avancement de la technologie vocale !
★ 684+0Évolution des étoiles sur les 7 derniers jours - #129
Un jeu de données audio gratuit de chiffres prononcés. Version audio de MNIST.
★ 678+0Évolution des étoiles sur les 7 derniers jours - #130
Reconnaissance vocale pour les projets React Native Expo
★ 678+6Évolution des étoiles sur les 7 derniers jours - #131
Système ASR industriel tout-en-un de pointe incluant des modules ASR, VAD, LID et de ponctuation. FireRedASR2 prend en charge le chinois, l'anglais, le code-switching ainsi que la reconnaissance de la parole et du chant.
★ 672+13Évolution des étoiles sur les 7 derniers jours - #132
Moteur de diffusion de reconnaissance vocale à la volée exécuté sur appareil, alimenté par l'apprentissage profond.
★ 671+0Évolution des étoiles sur les 7 derniers jours - #133
Interface en ligne de commande pour les fonctionnalités intégrées de reconnaissance vocale et de transcription de macOS.
★ 669+0Évolution des étoiles sur les 7 derniers jours - #134
ChatGPT à la maison ! Une meilleure alternative aux assistants domotiques commerciaux, construite sur Raspberry Pi avec LiteLLM et LangGraph.
★ 648+1Évolution des étoiles sur les 7 derniers jours - #135
:speech_balloon: /so.nus/ STT (speech to text) pour Node avec détection de mots-clés hors ligne
★ 638+0Évolution des étoiles sur les 7 derniers jours - #136
Éditeur de méthodes d’entrée Android (IME) basé sur Whisper
★ 633+6Évolution des étoiles sur les 7 derniers jours - #137
Traduction audio en temps réel, capture l'audio système et le micro, exécute ASR (Whisper/SenseVoice), traduit via l'API LLM avec affichage en streaming. Idéal pour les VTubers, les streamers et le visionnage de contenus étrangers.
★ 626+38Évolution des étoiles sur les 7 derniers jours - #138
Transcription en temps réel utilisant faster-whisper
★ 614+0Évolution des étoiles sur les 7 derniers jours - #139
Hub d'exécution ggml en C++ pour les modèles ASR et TTS multilingues : Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., plus alignement forcé universel, et plus encore
★ 611+20Évolution des étoiles sur les 7 derniers jours - #140
Décodeur CTC (Connectionist Temporal Classification) avec dictionnaire et modèle de langage.
★ 580+1Évolution des étoiles sur les 7 derniers jours - #141
Un pipeline de transcription (Speech-to-Text) optimisé pour le modèle Whisper prenant en charge plusieurs moteurs d'inférence
★ 578+1Évolution des étoiles sur les 7 derniers jours - #142
Le système d'autocodage pour votre application — Alan AI SDK pour React Native
★ 575+0Évolution des étoiles sur les 7 derniers jours - #143
Un langage de programmation par nœuds modulaire, un créateur de programmes, un système d'animation, une boîte à outils, un routeur et un débogueur conçus pour VRChat
★ 562-1Évolution des étoiles sur les 7 derniers jours - #144
🗣 Un overlay qui obtient la permission vocale et la saisie de l'utilisateur sous forme de texte dans une interface personnalisable
★ 557+1Évolution des étoiles sur les 7 derniers jours - #145
SpeechIO Leaderboard : une plateforme de benchmarking vaste, robuste et complète pour la reconnaissance automatique de la parole.
★ 553+3Évolution des étoiles sur les 7 derniers jours - #146
Liste d'API de reconnaissance vocale (STT) en coréen avec benchmarks de performance.
★ 547+1Évolution des étoiles sur les 7 derniers jours - #147
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541+14Évolution des étoiles sur les 7 derniers jours - #148
Agent interactif Speech-to-Speech haute qualité et en streaming implémenté dans un seul fichier.
★ 540+0Évolution des étoiles sur les 7 derniers jours - #149
Moteur de reconnaissance vocale (ASR) et de synthèse vocale (TTS). Reconnaissance vocale chinois-anglais, synthèse vocale multi-rôles, support multilingue et haute précision.
★ 530+1Évolution des étoiles sur les 7 derniers jours - #150
Une bibliothèque de reconnaissance vocale fonctionnant dans le navigateur grâce à une compilation WebAssembly de Vosk
★ 529+1Évolution des étoiles sur les 7 derniers jours