text-to-speech
Dépôts open source suivis étiquetés text-to-speech, triés par étoiles.
- #31
Générer des livres audio à partir d'EPUB, PDF et texte avec des sous-titres synchronisés.
★ 5 831+0Évolution des étoiles sur les 7 derniers jours - #32
Plateforme IA vocale open source. Alternative auto-hébergée à Vapi et Retell. Déploiement sur site, BYOK pour Speech-to-Speech ou LLM/STT/TTS, avec un constructeur de workflow visuel, support natif MCP et téléphonie.
★ 5 568+0Évolution des étoiles sur les 7 derniers jours - #33
Outil open source de localisation vidéo par IA : automatise le téléchargement de vidéos YouTube/Bilibili, la reconnaissance et la traduction de sous-titres, le clonage vocal, le mixage audio et l'incrustation de sous-titres.
★ 5 404+0Évolution des étoiles sur les 7 derniers jours - #34
Wrapper compatible OpenAI conteneurisé pour la synthèse vocale Kokoro-82M, avec support multiplateforme CPU, GPU AMD et NVIDIA PyTorch ; inclut le multi-locuteur, le mixage vocal, l'assemblage automatique, les horodatages de sous-titres, SSML et une interface web de lecture.
★ 5 399+0Évolution des étoiles sur les 7 derniers jours - #35
DiffSinger : synthèse de voix chantée via un mécanisme de diffusion superficielle (SVS & TTS) ; AAAI 2022 ; code officiel.
★ 4 855+0Évolution des étoiles sur les 7 derniers jours - #36★ 4 624+0Évolution des étoiles sur les 7 derniers jours
- #37
Une implémentation quasi en temps réel de Whisper d'OpenAI.
★ 4 246+0Évolution des étoiles sur les 7 derniers jours - #38
Modèle fondamental pour une synthèse vocale (TTS) expressive et naturelle.
★ 4 203+0Évolution des étoiles sur les 7 derniers jours - #39
La famille MOSS‑TTS est une gamme de modèles open source de génération de parole et de son développée par MOSI.AI et l'équipe OpenMOSS. Conçue pour une haute fidélité et une grande expressivité dans des scénarios réels complexes, elle couvre la synthèse vocale longue durée stable, le dialogue multi-locuteur, la conception de voix et de personnages, les effets sonores environnementaux et le TTS en streaming temps réel.
★ 4 058+0Évolution des étoiles sur les 7 derniers jours - #40
Convertit le texte en parole en temps réel.
★ 4 021+0Évolution des étoiles sur les 7 derniers jours - #41
TensorFlowTTS : Synthèse vocale de pointe en temps réel pour TensorFlow 2 (supporte l'anglais, le français, le coréen, le chinois, l'allemand et est facilement adaptable à d'autres langues).
★ 3 996+0Évolution des étoiles sur les 7 derniers jours - #42
Outil de conversion vocale simple et de haute qualité, axé sur la facilité d'utilisation et la performance
★ 3 674+0Évolution des étoiles sur les 7 derniers jours - #43
Une interface web unique Gradio + React avec des extensions pour ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T et Bark !
★ 3 250+0Évolution des étoiles sur les 7 derniers jours - #44
Le SDK Python officiel pour l'API ElevenLabs.
★ 3 083+0Évolution des étoiles sur les 7 derniers jours - #45
[AutoArk] GPA (General Purpose Audio) permet la reconnaissance vocale (ASR), la synthèse vocale (TTS) et la conversion de voix avec un seul modèle compact.
★ 3 061+0Évolution des étoiles sur les 7 derniers jours - #46
aeneas est une bibliothèque Python/C et un ensemble d'outils pour synchroniser automatiquement l'audio et le texte (alignement forcé)
★ 2 862+0Évolution des étoiles sur les 7 derniers jours - #47★ 2 818+0Évolution des étoiles sur les 7 derniers jours
- #48
Bibliothèque Python et outil CLI pour interagir avec l'API de synthèse vocale de Google Translate.
★ 2 628+0Évolution des étoiles sur les 7 derniers jours - #49
Déploiement en un clic (incluant le package hors ligne) ! Basé sur ChatTTS, prend en charge la sortie en streaming, le tirage de voix, la génération audio longue et la lecture par rôle. Simple et facile à utiliser, sans installation complexe.
★ 2 593+0Évolution des étoiles sur les 7 derniers jours - #50★ 2 583+0Évolution des étoiles sur les 7 derniers jours
- #51★ 2 530+0Évolution des étoiles sur les 7 derniers jours
- #52
Synthèse vocale (TTS) en vietnamien avec clonage de voix instantané, exécution locale sur appareil, inférence CPU en temps réel et qualité audio 24kHz.
★ 2 468+0Évolution des étoiles sur les 7 derniers jours - #53
Un moteur d'exécution vocal en temps réel permettant aux agents de communiquer, de travailler et d'être présents. Moteur d'exécution vocal en temps réel pour agents IA.
★ 2 379+58Évolution des étoiles sur les 7 derniers jours - #54
HiFi-GAN : Réseaux antagonistes génératifs pour une synthèse vocale efficace et haute fidélité
★ 2 367+0Évolution des étoiles sur les 7 derniers jours - #55
Implémentation PyTorch de VALL-E (Text-To-Speech Zero-Shot), démo reproduite https://lifeiteng.github.io/valle/index.html
★ 2 215+0Évolution des étoiles sur les 7 derniers jours - #56
Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.
★ 2 214+0Évolution des étoiles sur les 7 derniers jours - #57
Synthèse vocale rapide et contrôlable pour plus de 7000 langues.
★ 2 207+0Évolution des étoiles sur les 7 derniers jours - #58
Point de terminaison d'API de synthèse vocale gratuit et de haute qualité pour remplacer OpenAI, Azure ou ElevenLabs.
★ 2 075+0Évolution des étoiles sur les 7 derniers jours - #59
IA multimodale en temps réel sur appareil, avec des fonctionnalités similaires à GPT-Live
★ 2 048+0Évolution des étoiles sur les 7 derniers jours - #60
Boîte à outils de production vidéo native pour l'IA pour Claude Code
★ 2 036+0Évolution des étoiles sur les 7 derniers jours