asr
Dépôts open source suivis étiquetés asr, triés par étoiles.
- #31
Reconnaissance vocale en temps réel et détection d'activité vocale (VAD) utilisant la nouvelle génération de Kaldi avec ncnn, sans connexion Internet. Supporte iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, etc.
★ 1 777-1Évolution des étoiles sur les 7 derniers jours - #32
Bailing est un assistant vocal conversationnel similaire à GPT-4o, utilisant ASR, LLM et TTS. Intègre des modèles comme DeepSeek R1 et openClaw, avec une latence réduite à 800ms, fonctionnant sur Mac et configurations légères.
★ 1 759+2Évolution des étoiles sur les 7 derniers jours - #33
Application Linux Speech Note. Prise de notes, lecture et traduction avec reconnaissance vocale, synthèse vocale et traduction automatique hors ligne.
★ 1 622+8Évolution des étoiles sur les 7 derniers jours - #34
Analyser des vidéos en utilisant des LLM, la vision par ordinateur et la reconnaissance automatique de la parole
★ 1 570+8Évolution des étoiles sur les 7 derniers jours - #35
🎙️ Application de dictée IA - Open Source et locale. ⚡ Tapez 3 fois plus vite, sans clavier. 🆓 Propulsée par des modèles open source, fonctionne hors ligne, rapide et précise.
★ 1 520+8Évolution des étoiles sur les 7 derniers jours - #36
Famille de modèles ASR open-source basés sur LLM pour le chinois, les dialectes, les accents et la parole multilingue, avec runtimes FunASR, vLLM, streaming et llama.cpp.
★ 1 512+10Évolution des étoiles sur les 7 derniers jours - #37
Speech-AI-Forge est un projet articulé autour d'un modèle de génération TTS, implémentant un serveur API et une interface Web basée sur Gradio.
★ 1 418+0Évolution des étoiles sur les 7 derniers jours - #38
Traduction synchronisée pour vidéos. Doublage vidéo.
★ 1 413+2Évolution des étoiles sur les 7 derniers jours - #39
Transcription contrôlable. Verbatim (chaque mot, remplissage, pause, bégaiement, son vocal) ou intentionnelle (ce que l'orateur voulait dire, optimisé pour la lisibilité) avec horodatage au niveau du mot.
★ 1 371+13Évolution des étoiles sur les 7 derniers jours - #40★ 1 347+6Évolution des étoiles sur les 7 derniers jours
- #41
Humain numérique interactif en temps réel, avec apparence et voix personnalisables, support du clonage vocal et latence de dialogue aussi basse que 3 secondes.
★ 1 303-1Évolution des étoiles sur les 7 derniers jours - #42
StreamSpeech est un modèle tout-en-un fluide pour la reconnaissance vocale, la traduction et la synthèse vocale, en mode hors ligne et simultané.
★ 1 288+0Évolution des étoiles sur les 7 derniers jours - #43
Serveur de reconnaissance vocale WebSocket, gRPC et WebRTC basé sur les bibliothèques Vosk et Kaldi.
★ 1 262+1Évolution des étoiles sur les 7 derniers jours - #44
Fine-tuning du modèle de reconnaissance vocale Whisper pour prendre en charge l'entraînement avec ou sans données d'horodatage, ainsi que sans données vocales. Accélération de l'inférence et support du déploiement Web, Windows et Android
★ 1 222-1Évolution des étoiles sur les 7 derniers jours - #45
Boîte à outils vocale IA pour Apple Silicon — ASR, TTS, speech-to-speech, VAD et diarisation propulsés par MLX et CoreML
★ 1 161+4Évolution des étoiles sur les 7 derniers jours - #46
Premier ASR de fondation conçu pour le monde réel - 7 conditions acoustiques atomiques, 54 scénarios composés, 2,6 millions d'échantillons et jusqu'à ~30 % de gains par rapport à l'état de l'art là où tous les autres modèles échouent.
★ 1 136+3Évolution des étoiles sur les 7 derniers jours - #47
[Non officiel] Implémentation PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020).
★ 1 132+1Évolution des étoiles sur les 7 derniers jours - #48
SGLang-Omni permet un service haute performance pour les modèles TTS, ASR, vocaux et omnimodaux.
★ 1 118+143Évolution des étoiles sur les 7 derniers jours - #49★ 1 057+8Évolution des étoiles sur les 7 derniers jours
- #50
Reconnaissance vocale hors ligne pour Android avec la bibliothèque Vosk.
★ 1 056+0Évolution des étoiles sur les 7 derniers jours - #51
Transcription parole-texte entièrement locale, privée et multiplateforme avec post-traitement par LLM
★ 1 053+15Évolution des étoiles sur les 7 derniers jours - #52★ 1 040+1Évolution des étoiles sur les 7 derniers jours
- #53
Framework de serveur de reconnaissance vocale (speech-to-text) avec Kaldi nouvelle génération.
★ 984+4Évolution des étoiles sur les 7 derniers jours - #54
Espresso : une boîte à outils de reconnaissance vocale neuronale rapide de bout en bout
★ 939+0Évolution des étoiles sur les 7 derniers jours - #55
VocoType est un outil de saisie vocale local, privé et sécurisé, permettant de convertir la parole en texte en temps réel via des raccourcis clavier. Il prend en charge le MCP de transcription, l'optimisation de texte par IA, les dictionnaires de remplacement personnalisés et la transcription d'enregistrements audio/vidéo.
★ 928+9Évolution des étoiles sur les 7 derniers jours - #56
Ce projet fournit une API avec gestion des accès utilisateurs pour transcrire la parole en texte à l'aide d'un modèle Whisper ASR affiné et traité.
★ 914+0Évolution des étoiles sur les 7 derniers jours - #57
Boîte à outils d'algorithmes d'IA hors ligne gratuite pour Java, prenant en charge la reconnaissance faciale, la détection de vivant, la reconnaissance d'expressions, la détection d'objets, la segmentation d'instances, la détection de piétons, l'OCR, la reconnaissance de plaques d'immatriculation, la reconnaissance de tableaux, ASR+TTS, la traduction automatique, etc. Utilisable via Maven. Supporte PyTorch et Tensorflow, avec intégration de modèles tels que Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR (PPOCRv5) et Whisper.
★ 908+3Évolution des étoiles sur les 7 derniers jours - #58
Une boîte à outils conviviale pour la reconnaissance, la transcription et la conversion vocale, etc.
★ 873+0Évolution des étoiles sur les 7 derniers jours - #59
Reconnaissance vocale chinoise de bout en bout basée sur PaddlePaddle, de l'initiation à la pratique, avec des cas d'étude simples et des projets d'entreprise concrets. Prend en charge les modèles DeepSpeech2, Conformer et Squeezeformer les plus populaires.
★ 870-1Évolution des étoiles sur les 7 derniers jours - #60
GLM-ASR-Nano : un modèle de reconnaissance vocale robuste et open source avec 1,5 milliard de paramètres
★ 854+3Évolution des étoiles sur les 7 derniers jours