speech-recognition
Dépôts open source suivis étiquetés speech-recognition, triés par étoiles.
- #61
Une liste de corpus vocaux accessibles pour l'ASR, le TTS et d'autres technologies vocales.
★ 1 399+0Évolution des étoiles sur les 7 derniers jours - #62
Fine-tuning de LLM sur Mac avec Apple Silicon. Support natif MLX pour SFT, DPO, GRPO, Vision, TTS, STT, Embedding et OCR. API compatible avec Unsloth.
★ 1 398+8Évolution des étoiles sur les 7 derniers jours - #63
Transcription contrôlable. Verbatim (chaque mot, remplissage, pause, bégaiement, son vocal) ou intentionnelle (ce que l'orateur voulait dire, optimisé pour la lisibilité) avec horodatage au niveau du mot.
★ 1 371+13Évolution des étoiles sur les 7 derniers jours - #64
Client en ligne de commande pour Whisper, compatible avec le client OpenAI original et basé sur CTranslate2.
★ 1 346+2Évolution des étoiles sur les 7 derniers jours - #65
Assistant personnel conçu avec des bibliothèques Python. Il effectue diverses tâches : envoi d'e-mails, reconnaissance optique de caractères (OCR), rapports d'actualités dynamiques via API, gestionnaire de tâches, ouverture de sites web par commande vocale, lecture de musique, recherche Wikipédia, dictionnaire avec correction orthographique intelligente et rapports météo (température, vent, humidité).
★ 1 341+5Évolution des étoiles sur les 7 derniers jours - #66★ 1 338+42Évolution des étoiles sur les 7 derniers jours
- #67
StreamSpeech est un modèle tout-en-un fluide pour la reconnaissance vocale, la traduction et la synthèse vocale, en mode hors ligne et simultané.
★ 1 288+0Évolution des étoiles sur les 7 derniers jours - #68
Pruna est un framework d'optimisation de modèles conçu pour les développeurs, permettant de fournir des modèles plus rapides et plus efficaces avec un minimum de surcoût.
★ 1 274+1Évolution des étoiles sur les 7 derniers jours - #69
Serveur de reconnaissance vocale WebSocket, gRPC et WebRTC basé sur les bibliothèques Vosk et Kaldi.
★ 1 262+1Évolution des étoiles sur les 7 derniers jours - #70
Fine-tuning du modèle de reconnaissance vocale Whisper pour prendre en charge l'entraînement avec ou sans données d'horodatage, ainsi que sans données vocales. Accélération de l'inférence et support du déploiement Web, Windows et Android
★ 1 222-1Évolution des étoiles sur les 7 derniers jours - #71★ 1 212-1Évolution des étoiles sur les 7 derniers jours
- #72
💁 Une collection impressionnante de modèles Transformers pour le traitement du langage naturel, incluant des articles, vidéos, blogs, dépôts officiels et notebooks Colab. 🛫☑️
★ 1 179+0Évolution des étoiles sur les 7 derniers jours - #73
Un laboratoire pratique pour construire, tester et évaluer des applications avec le framework Foundation Models d'Apple.
★ 1 178+1Évolution des étoiles sur les 7 derniers jours - #74
Un journal privé avec une équipe d'assistants IA personnels. Les agents lisent vos enregistrements et proposent des actions — vous validez les changements. Synchronisation chiffrée de bout en bout entre vos appareils — les serveurs ne voient que du texte chiffré. IA locale optionnelle.
★ 1 168+3Évolution des étoiles sur les 7 derniers jours - #75
Boîte à outils vocale IA pour Apple Silicon — ASR, TTS, speech-to-speech, VAD et diarisation propulsés par MLX et CoreML
★ 1 161+4Évolution des étoiles sur les 7 derniers jours - #76
Irina, un assistant vocal russe fonctionnant hors ligne, prenant en charge des compétences via des plugins.
★ 1 153+0Évolution des étoiles sur les 7 derniers jours - #77
Outils pour manipuler des données multimodales dans des projets d'apprentissage automatique
★ 1 149-1Évolution des étoiles sur les 7 derniers jours - #78
[Non officiel] Implémentation PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020).
★ 1 132+1Évolution des étoiles sur les 7 derniers jours - #79
Le système d'auto-codage pour votre application — SDK Alan AI pour Cordova
★ 1 132+0Évolution des étoiles sur les 7 derniers jours - #80
SGLang-Omni permet un service haute performance pour les modèles TTS, ASR, vocaux et omnimodaux.
★ 1 118+143Évolution des étoiles sur les 7 derniers jours - #81
Vtuber IA pour le streaming sur Youtube/Twitch
★ 1 115+1Évolution des étoiles sur les 7 derniers jours - #82
L'application iOS open source qui rend la transcription vocale de qualité plus accessible sur les appareils mobiles.
★ 1 102+8Évolution des étoiles sur les 7 derniers jours - #83
💬📝 Une petite application de dictée utilisant le modèle de reconnaissance vocale Whisper d'OpenAI.
★ 1 100+2Évolution des étoiles sur les 7 derniers jours - #84
Serveur de reconnaissance vocale full-duplex en temps réel, basé sur la boîte à outils Kaldi et le framework GStreamer.
★ 1 094+1Évolution des étoiles sur les 7 derniers jours - #85
Reconnaissance vocale hors ligne pour Android avec la bibliothèque Vosk.
★ 1 056+0Évolution des étoiles sur les 7 derniers jours - #86★ 1 040+1Évolution des étoiles sur les 7 derniers jours
- #87
TensorFlowASR : Reconnaissance vocale automatique quasi à l'état de l'art sous Tensorflow 2. Langues supportées utilisant des caractères ou des sous-mots.
★ 1 010+0Évolution des étoiles sur les 7 derniers jours - #88
Outil d'édition utilisant l'IA pour transcrire, comprendre le contenu et rechercher des éléments dans vos séquences, intégré avec ChatGPT et d'autres modèles d'IA
★ 1 009+2Évolution des étoiles sur les 7 derniers jours - #89
Framework de serveur de reconnaissance vocale (speech-to-text) avec Kaldi nouvelle génération.
★ 984+4Évolution des étoiles sur les 7 derniers jours - #90
Transcription audio en temps quasi réel utilisant Whisper auto-hébergé et WebSocket en Python/JS
★ 960+1Évolution des étoiles sur les 7 derniers jours