speech
Dépôts open source suivis étiquetés speech, triés par étoiles.
- #31★ 2 818+1Évolution des étoiles sur les 7 derniers jours
- #32★ 2 750-1Évolution des étoiles sur les 7 derniers jours
- #33
Bibliothèque Python et outil CLI pour interagir avec l'API de synthèse vocale de Google Translate.
★ 2 628+0Évolution des étoiles sur les 7 derniers jours - #34
Détecteur d'activité vocale (VAD) : faible latence, haute performance et léger.
★ 2 256+7Évolution des étoiles sur les 7 derniers jours - #35
Synthèse vocale rapide et contrôlable pour plus de 7000 langues.
★ 2 207-1Évolution des étoiles sur les 7 derniers jours - #36★ 2 170+3Évolution des étoiles sur les 7 derniers jours
- #37
Point de terminaison d'API de synthèse vocale gratuit et de haute qualité pour remplacer OpenAI, Azure ou ElevenLabs.
★ 2 075+5Évolution des étoiles sur les 7 derniers jours - #38
Praat : faire de la phonétique par ordinateur
★ 1 970+1Évolution des étoiles sur les 7 derniers jours - #39★ 1 935+1Évolution des étoiles sur les 7 derniers jours
- #40
Liste communautaire de startups travaillant sur l'IA dans la technologie audio et musicale
★ 1 769+1Évolution des étoiles sur les 7 derniers jours - #41★ 1 521+3Évolution des étoiles sur les 7 derniers jours
- #42
Restauration de parole générale
★ 1 375+0Évolution des étoiles sur les 7 derniers jours - #43
Transcription contrôlable. Verbatim (chaque mot, remplissage, pause, bégaiement, son vocal) ou intentionnelle (ce que l'orateur voulait dire, optimisé pour la lisibilité) avec horodatage au niveau du mot.
★ 1 371+13Évolution des étoiles sur les 7 derniers jours - #44
Articles de recherche en traitement du langage naturel (avec notes de lecture), implémentations de modèles et traitement de données (code disponible en TensorFlow et PyTorch)
★ 1 333+1Évolution des étoiles sur les 7 derniers jours - #45
MTools est une application de bureau polyvalente intégrant le traitement audio/vidéo, l'édition d'images, la manipulation de texte et des outils de codage, avec des fonctionnalités d'IA intégrées pour simplifier votre flux de travail et améliorer votre productivité.
★ 1 305+5Évolution des étoiles sur les 7 derniers jours - #46
StreamSpeech est un modèle tout-en-un fluide pour la reconnaissance vocale, la traduction et la synthèse vocale, en mode hors ligne et simultané.
★ 1 288+0Évolution des étoiles sur les 7 derniers jours - #47
Vidéos, notes et expériences pour comprendre l'apprentissage profond
★ 1 198+0Évolution des étoiles sur les 7 derniers jours - #48
Outils pour manipuler des données multimodales dans des projets d'apprentissage automatique
★ 1 149-1Évolution des étoiles sur les 7 derniers jours - #49
[Non officiel] Implémentation PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020).
★ 1 132+1Évolution des étoiles sur les 7 derniers jours - #50★ 1 040+1Évolution des étoiles sur les 7 derniers jours
- #51
Un système de synthèse vocale (TTS) open source basé sur des LLM.
★ 920+1Évolution des étoiles sur les 7 derniers jours - #52
Boîte à outils de segmentation audio basée sur les CNN. Permet de détecter la parole, la musique, le bruit et le genre du locuteur. Conçue pour des études à grande échelle sur l'égalité des genres basées sur le temps de parole par genre.
★ 910+1Évolution des étoiles sur les 7 derniers jours - #53
DiffWave est un vocodeur neuronal et un synthétiseur de forme d'onde rapide et de haute qualité.
★ 885+0Évolution des étoiles sur les 7 derniers jours - #54★ 881-1Évolution des étoiles sur les 7 derniers jours
- #55
Reconnaissance vocale chinoise de bout en bout basée sur PaddlePaddle, de l'initiation à la pratique, avec des cas d'étude simples et des projets d'entreprise concrets. Prend en charge les modèles DeepSpeech2, Conformer et Squeezeformer les plus populaires.
★ 870-1Évolution des étoiles sur les 7 derniers jours - #56
Voxtral ASR & TTS fonctionnant nativement et dans le navigateur. Une implémentation en Rust du modèle Voxtral mini de Mistral pour l'ASR/TTS en temps réel, utilisant le framework Burn ML.
★ 819+2Évolution des étoiles sur les 7 derniers jours - #57
Un avatar omni interactif en temps réel basé sur LiveKit, permettant une intégration transparente avec tout composant d'avatar open source (modèle temps réel, visuel, voix, mémoire, recherche, etc.).
★ 813+4Évolution des étoiles sur les 7 derniers jours - #58★ 771+0Évolution des étoiles sur les 7 derniers jours
- #59
Système de communication améliorée et alternative (CAA) avec synthèse vocale pour le navigateur
★ 755+9Évolution des étoiles sur les 7 derniers jours - #60
Allosaurus est un reconnaisseur de phonèmes universel pré-entraîné pour plus de 2000 langues.
★ 746+4Évolution des étoiles sur les 7 derniers jours