speech-to-text
Dépôts open source suivis étiquetés speech-to-text, triés par étoiles.
- #121
Collection de ressources sur les applications des grands modèles de langage (LLM) dans l'IA audio.
★ 738+0Évolution des étoiles sur les 7 derniers jours - #122
Framework de reconnaissance vocale automatique (ASR) en PyTorch, compatible avec les modes streaming et non-streaming, supportant les modèles Conformer, Squeezeformer et DeepSpeech2, ainsi que diverses méthodes d'augmentation de données.
★ 727+0Évolution des étoiles sur les 7 derniers jours - #123
Rapida est une plateforme d'orchestration d'IA vocale open source pour créer des agents conversationnels en temps réel avec streaming audio, STT, TTS, VAD, intégration multicanal, gestion d'état et observabilité.
★ 723+4Évolution des étoiles sur les 7 derniers jours - #124★ 720+1Évolution des étoiles sur les 7 derniers jours
- #125
Transcription de la parole en texte et saisie de sous-titres via KB pour OBS, VRChat, le chat Twitch et Discord.
★ 718-1Évolution des étoiles sur les 7 derniers jours - #126
Exemple d'API vocale
★ 707-1Évolution des étoiles sur les 7 derniers jours - #127
Framework de benchmark pour la reconnaissance vocale (speech-to-text)
★ 698+1Évolution des étoiles sur les 7 derniers jours - #128
Une application de bureau locale gratuite pour extraire des sous-titres (SRT) de vidéos et les traduire dans n'importe quelle langue — utilisation illimitée, sans inscription, sans cloud.
★ 688+19Évolution des étoiles sur les 7 derniers jours - #129
Reconnaissance vocale pour les projets React Native Expo
★ 678+4Évolution des étoiles sur les 7 derniers jours - #130
Transcription et traduction audio en fichiers LRC via Whisper et des LLM (GPT, Claude, etc.)
★ 678+3Évolution des étoiles sur les 7 derniers jours - #131
Moteur de diffusion de reconnaissance vocale à la volée exécuté sur appareil, alimenté par l'apprentissage profond.
★ 671+0Évolution des étoiles sur les 7 derniers jours - #132
:speech_balloon: /so.nus/ STT (speech to text) pour Node avec détection de mots-clés hors ligne
★ 638+0Évolution des étoiles sur les 7 derniers jours - #133
Création d'un logiciel de surveillance automatique pour la proctoring en ligne
★ 634-1Évolution des étoiles sur les 7 derniers jours - #134
Application vocale rapide, privée et locale pour les Mac Apple Silicon — dictée, transcription de fichiers/médias, enregistrement de réunions, transformations et CLI d'automatisation publique. Gratuit et open source.
★ 630+14Évolution des étoiles sur les 7 derniers jours - #135
Une application native macOS de dictée dans la barre de menus utilisant la reconnaissance vocale locale avec WhisperKit
★ 620+1Évolution des étoiles sur les 7 derniers jours - #136
Hub d'exécution ggml en C++ pour les modèles ASR et TTS multilingues : Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., plus alignement forcé universel, et plus encore
★ 614+13Évolution des étoiles sur les 7 derniers jours - #137
Transcription en temps réel utilisant faster-whisper
★ 614+0Évolution des étoiles sur les 7 derniers jours - #138
Un IME (clavier) vocal open-source sur l'appareil pour Android utilisant la bibliothèque Vosk.
★ 582+4Évolution des étoiles sur les 7 derniers jours - #139
Une bibliothèque Python pour résoudre reCAPTCHA v2 et v3 avec Playwright
★ 579+3Évolution des étoiles sur les 7 derniers jours - #140
Un pipeline de transcription (Speech-to-Text) optimisé pour le modèle Whisper prenant en charge plusieurs moteurs d'inférence
★ 578+0Évolution des étoiles sur les 7 derniers jours - #141
Un langage de programmation par nœuds modulaire, un créateur de programmes, un système d'animation, une boîte à outils, un routeur et un débogueur conçus pour VRChat
★ 563+0Évolution des étoiles sur les 7 derniers jours - #142
🗣 Un overlay qui obtient la permission vocale et la saisie de l'utilisateur sous forme de texte dans une interface personnalisable
★ 557+1Évolution des étoiles sur les 7 derniers jours - #143
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 549+25Évolution des étoiles sur les 7 derniers jours - #144
Liste d'API de reconnaissance vocale (STT) en coréen avec benchmarks de performance.
★ 547+0Évolution des étoiles sur les 7 derniers jours - #145
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 546+13Évolution des étoiles sur les 7 derniers jours - #146
Une bibliothèque de reconnaissance vocale fonctionnant dans le navigateur grâce à une compilation WebAssembly de Vosk
★ 529+1Évolution des étoiles sur les 7 derniers jours - #147
Phonetisaurus G2P.
★ 521-1Évolution des étoiles sur les 7 derniers jours - #148
Cet outil utilise l'IA pour évaluer votre prononciation
★ 518+2Évolution des étoiles sur les 7 derniers jours - #149
Open-source AI voice typing for macOS, Windows, and Linux. Press a hotkey, speak naturally, get polished text in any app.
★ 516—Évolution des étoiles sur les 7 derniers jours - #150
Logiciel open source de transcription audio et vidéo.
★ 515+0Évolution des étoiles sur les 7 derniers jours