speech-recognition
Dépôts open source suivis étiquetés speech-recognition, triés par étoiles.
- #91
Le hub pour la recherche en IA audio : articles, modèles ouverts, benchmarks et jeux de données pour les LLM audio, la reconnaissance vocale, la synthèse vocale (TTS), ainsi que la génération de musique et d'audio.
★ 953+3Évolution des étoiles sur les 7 derniers jours - #92
Service de transcription et de diarisation hors ligne, auto-hébergé et clé en main, avec résumé par LLM
★ 948+2Évolution des étoiles sur les 7 derniers jours - #93
Whisper.net. La conversion parole-texte simplifiée grâce aux modèles Whisper.
★ 941+1Évolution des étoiles sur les 7 derniers jours - #94
Espresso : une boîte à outils de reconnaissance vocale neuronale rapide de bout en bout
★ 939+0Évolution des étoiles sur les 7 derniers jours - #95
Un assistant vocal de bureau basé sur Python capable d'exécuter des commandes système, intégrant la reconnaissance vocale et la synthèse vocale, et gérant les interactions utilisateur asynchrones.
★ 919+13Évolution des étoiles sur les 7 derniers jours - #96
Modèles Whisper optimisés pour le streaming et l'utilisation sur appareil
★ 897+0Évolution des étoiles sur les 7 derniers jours - #97
Un LLM vocal qui s'exécute localement sur votre ordinateur sans nécessiter de connexion internet.
★ 891+2Évolution des étoiles sur les 7 derniers jours - #98
SpeechPy - Une bibliothèque pour le traitement et la reconnaissance vocale : http://speechpy.readthedocs.io/en/latest/
★ 883+0Évolution des étoiles sur les 7 derniers jours - #99
Reconnaissance vocale chinoise de bout en bout basée sur PaddlePaddle, de l'initiation à la pratique, avec des cas d'étude simples et des projets d'entreprise concrets. Prend en charge les modèles DeepSpeech2, Conformer et Squeezeformer les plus populaires.
★ 870-1Évolution des étoiles sur les 7 derniers jours - #100
💬 Reconnaissance vocale pour votre application React.
★ 842+1Évolution des étoiles sur les 7 derniers jours - #101
Algorithmes de décodage Connectionist Temporal Classification (CTC) : best path, beam search, lexicon search, prefix search et token passing. Implémentés en Python.
★ 836-1Évolution des étoiles sur les 7 derniers jours - #102
Créez des applications web de transcription vocale en temps réel en utilisant Whisper d'OpenAI
★ 835+0Évolution des étoiles sur les 7 derniers jours - #103★ 823-1Évolution des étoiles sur les 7 derniers jours
- #104
Dictée vocale gratuite, open-source et 100% hors ligne pour Linux. Parlez et tapez n'importe où via whisper.cpp, les moteurs Whisper et VOSK, accéléré par GPU, fonctionne sur X11 + Wayland !
★ 806+21Évolution des étoiles sur les 7 derniers jours - #105
🎤 Lobe TTS - Une bibliothèque TTS/STT fiable et de haute qualité pour serveur et navigateur.
★ 805+1Évolution des étoiles sur les 7 derniers jours - #106
Speech to Text to Speech. Chanson en cours de lecture. Envoie du texte sous forme de messages OSC vers VRChat pour affichage sur l'avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 803+4Évolution des étoiles sur les 7 derniers jours - #107
Binding React Native pour whisper.cpp.
★ 800-1Évolution des étoiles sur les 7 derniers jours - #108
Chatbot vocal local pour des conversations engageantes, propulsé par Ollama, Hugging Face Transformers et Coqui TTS Toolkit
★ 788+1Évolution des étoiles sur les 7 derniers jours - #109
Projet permettant d'utiliser un microphone avec OpenAI Whisper.
★ 787+0Évolution des étoiles sur les 7 derniers jours - #110★ 786+17Évolution des étoiles sur les 7 derniers jours
- #111
Le moyen le plus simple de transcrire de l'audio en Swift
★ 785-1Évolution des étoiles sur les 7 derniers jours - #112
Application de transcription vocale par IA 100 % privée convertissant la parole en texte dans plus de 100 langues. Développée avec Compose Multiplatform pour Android et iOS en utilisant Whisper AI ; aucun transfert vers le cloud, tout le traitement est effectué localement pour une confidentialité totale.
★ 777+1Évolution des étoiles sur les 7 derniers jours - #113
Conversion rapide entre chiffres chinois et chiffres arabes (dernières fonctionnalités : fractions, dates, températures, etc.)
★ 766+0Évolution des étoiles sur les 7 derniers jours - #114★ 763+1Évolution des étoiles sur les 7 derniers jours
- #115
Reconnaissance vocale chinoise basée sur PaddlePaddle. Projet complet avec d'excellentes performances. Supporte l'entraînement et l'inférence sur Windows et Linux, ainsi que sur les cartes de développement Nvidia Jetson.
★ 762+0Évolution des étoiles sur les 7 derniers jours - #116★ 754+2Évolution des étoiles sur les 7 derniers jours
- #117
Exécution du modèle de reconnaissance vocale whisper.cpp dans Unity3d en local
★ 751+1Évolution des étoiles sur les 7 derniers jours - #118
Allosaurus est un reconnaisseur de phonèmes universel pré-entraîné pour plus de 2000 langues.
★ 746+4Évolution des étoiles sur les 7 derniers jours - #119
Clavier et service de reconnaissance vocale privés et exécutés directement sur l'appareil pour Android.
★ 745+6Évolution des étoiles sur les 7 derniers jours - #120
Framework de reconnaissance vocale automatique (ASR) en PyTorch, compatible avec les modes streaming et non-streaming, supportant les modèles Conformer, Squeezeformer et DeepSpeech2, ainsi que diverses méthodes d'augmentation de données.
★ 727+0Évolution des étoiles sur les 7 derniers jours