tts
Dépôts open source suivis étiquetés tts, triés par étoiles.
- #121
Générateur de livres audio multi-voix propulsé par l'IA : annotation de script par LLM, clonage vocal, conception de voix, entraînement LoRA, contrôle de style par ligne et exportation en MP3, M4B chapitré ou multipiste Audacity. Basé sur Qwen3-TTS.
★ 996+17Évolution des étoiles sur les 7 derniers jours - #122
🧸 Lobe Vidol - Rendre les idoles virtuelles accessibles à tous
★ 986+1Évolution des étoiles sur les 7 derniers jours - #123
Un puissant modèle d'édition audio basé sur l'apprentissage par renforcement et un LLM de 3 milliards de paramètres, spécialisé dans l'édition des émotions, du style de parole et des paralinguistiques, avec des capacités robustes de synthèse vocale zero-shot
★ 971+1Évolution des étoiles sur les 7 derniers jours - #124
NISQA - Évaluation non intrusive de la qualité de la parole et du naturel de la synthèse vocale (TTS).
★ 970+2Évolution des étoiles sur les 7 derniers jours - #125★ 955-1Évolution des étoiles sur les 7 derniers jours
- #126
Le hub pour la recherche en IA audio : articles, modèles ouverts, benchmarks et jeux de données pour les LLM audio, la reconnaissance vocale, la synthèse vocale (TTS), ainsi que la génération de musique et d'audio.
★ 953+3Évolution des étoiles sur les 7 derniers jours - #127
Rendre les voix TTS naturelles d'Azure accessibles à toute application compatible SAPI 5.
★ 933+12Évolution des étoiles sur les 7 derniers jours - #128
Un système de synthèse vocale (TTS) open source basé sur des LLM.
★ 920+1Évolution des étoiles sur les 7 derniers jours - #129
Boîte à outils d'algorithmes d'IA hors ligne gratuite pour Java, prenant en charge la reconnaissance faciale, la détection de vivant, la reconnaissance d'expressions, la détection d'objets, la segmentation d'instances, la détection de piétons, l'OCR, la reconnaissance de plaques d'immatriculation, la reconnaissance de tableaux, ASR+TTS, la traduction automatique, etc. Utilisable via Maven. Supporte PyTorch et Tensorflow, avec intégration de modèles tels que Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR (PPOCRv5) et Whisper.
★ 908+3Évolution des étoiles sur les 7 derniers jours - #130
Un framework de service de modèles ML haute performance, offrant un traitement par lots dynamique et des pipelines CPU/GPU pour exploiter pleinement votre machine de calcul.
★ 902+0Évolution des étoiles sur les 7 derniers jours - #131
Interface web pour utiliser et affiner XTTS
★ 895+0Évolution des étoiles sur les 7 derniers jours - #132
DiffWave est un vocodeur neuronal et un synthétiseur de forme d'onde rapide et de haute qualité.
★ 885+0Évolution des étoiles sur les 7 derniers jours - #133
Transformez des PDF en podcasts IA pour un contenu audio captivant à écouter partout.
★ 875+1Évolution des étoiles sur les 7 derniers jours - #134
Une boîte à outils conviviale pour la reconnaissance, la transcription et la conversion vocale, etc.
★ 873+0Évolution des étoiles sur les 7 derniers jours - #135★ 867+1Évolution des étoiles sur les 7 derniers jours
- #136★ 856+2Évolution des étoiles sur les 7 derniers jours
- #137
SumatraPDF fork: Chinese EPUB/MOBI, smart PDF dark mode, OCR, TTS, offline dictionary.
★ 828+15Évolution des étoiles sur les 7 derniers jours - #138
Voxtral ASR & TTS fonctionnant nativement et dans le navigateur. Une implémentation en Rust du modèle Voxtral mini de Mistral pour l'ASR/TTS en temps réel, utilisant le framework Burn ML.
★ 819+2Évolution des étoiles sur les 7 derniers jours - #139
Kokoro en Rust. TTS ultra-rapide en temps réel avec une qualité exceptionnelle.
★ 817+1Évolution des étoiles sur les 7 derniers jours - #140
Convertissez n'importe quel dépôt Git en un podcast captivant
★ 814-1Évolution des étoiles sur les 7 derniers jours - #141
Lecteur d'eBook en terminal avec synthèse vocale de qualité livre audio — Prend en charge EPUB, PDF, DOCX, HTML, RTF, TXT et MD.
★ 806+2Évolution des étoiles sur les 7 derniers jours - #142
🎤 Lobe TTS - Une bibliothèque TTS/STT fiable et de haute qualité pour serveur et navigateur.
★ 805+1Évolution des étoiles sur les 7 derniers jours - #143
VTuber IA utilisant LLM, ASR, TTS, OCR, CV et d'autres technologies pour diffuser en direct ou jouer à Minecraft avec vous.
★ 803+5Évolution des étoiles sur les 7 derniers jours - #144
Speech to Text to Speech. Chanson en cours de lecture. Envoie du texte sous forme de messages OSC vers VRChat pour affichage sur l'avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 803+4Évolution des étoiles sur les 7 derniers jours - #145
Moteur de synthèse vocale (TTS) Android léger et hors ligne, permettant le clonage de voix et la lecture de texte haute fidélité à l'échelle du système.
★ 801+2Évolution des étoiles sur les 7 derniers jours - #146
Confucius4-TTS : un moteur de synthèse vocale (TTS) multilingue et inter-lingue zero-shot.
★ 794+10Évolution des étoiles sur les 7 derniers jours - #147
Un SDK Swift modulaire pour le traitement audio avec MLX sur Apple Silicon
★ 772+6Évolution des étoiles sur les 7 derniers jours - #148
Traducteur d'écran Android en temps réel open-source sans root, idéal pour les jeux, visual novels et mangas. Prend en charge l'OCR sur l'appareil et dans le cloud, les LLM hors ligne, divers services de traduction et la synthèse vocale (TTS), avec affichage direct des traductions à l'écran.
★ 768+82Évolution des étoiles sur les 7 derniers jours - #149★ 763+1Évolution des étoiles sur les 7 derniers jours
- #150
Assistant vocal en temps réel — streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible avec l'API OpenAI Realtime. Clonage vocal, interruption (barge-in), ~9× temps réel sur une 4090. Licence Apache 2.0.
★ 757+10Évolution des étoiles sur les 7 derniers jours