text-to-speech
Dépôts open source suivis étiquetés text-to-speech, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de text-to-speech sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés text-to-speech.
- #1
Un moteur d'exécution vocal en temps réel permettant aux agents de communiquer, de travailler et d'être présents. Moteur d'exécution vocal en temps réel pour agents IA.
★ 2 377 - #2
Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.
★ 2 214 - #3
Éditeur vidéo open-source et local-first, permettant aux créateurs et aux agents IA d'éditer une même timeline en temps réel.
★ 792 - #4
Traducteur d'écran Android en temps réel open-source sans root, idéal pour les jeux, visual novels et mangas. Prend en charge l'OCR sur l'appareil et dans le cloud, les LLM hors ligne, divers services de traduction et la synthèse vocale (TTS), avec affichage direct des traductions à l'écran.
★ 786 - #5
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541
- #1
Générez des vidéos courtes en haute définition à partir d'un sujet ou d'un mot-clé grâce à un flux de travail automatisé basé sur des modèles d'IA.
★ 119 977+1 509Évolution des étoiles sur les 7 derniers jours - #2
Interface locale pour exécuter et entraîner des LLM et des modèles de diffusion, incluant Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX et plus encore.
★ 75 515+337Évolution des étoiles sur les 7 derniers jours - #3
1 minute de données vocales suffit pour entraîner un bon modèle TTS ! (clonage vocal en quelques exemples)
★ 61 476+138Évolution des étoiles sur les 7 derniers jours - #4
Premier système de production vidéo agentique open source au monde. 12 pipelines de production, plus de 100 outils, plus de 700 compétences d'agents et fichiers de connaissances de production. Transformez votre assistant de codage IA en un studio de production vidéo complet.
★ 55 719+1 707Évolution des étoiles sur les 7 derniers jours - #5
🐸💬 - Une boîte à outils de deep learning pour la synthèse vocale (Text-to-Speech), éprouvée en recherche et en production.
★ 45 985+18Évolution des étoiles sur les 7 derniers jours - #6★ 39 814+9Évolution des étoiles sur les 7 derniers jours
- #7★ 37 419+61Évolution des étoiles sur les 7 derniers jours
- #8
🚀 Clonez une voix en 5 secondes pour générer n'importe quel discours en temps réel.
★ 36 912+0Évolution des étoiles sur les 7 derniers jours - #9
VoxCPM2 : TTS sans tokenizer pour la génération de parole multilingue, la conception de voix créatives et le clonage vocal réaliste.
★ 36 595+345Évolution des étoiles sur les 7 derniers jours - #10
Système de synthèse vocale (TTS) Zero-Shot efficace et contrôlable de niveau industriel
★ 23 686+109Évolution des étoiles sur les 7 derniers jours - #11
Modèle multilingue de génération vocale à grande échelle, offrant des capacités complètes d'inférence, d'entraînement et de déploiement.
★ 23 426+359Évolution des étoiles sur les 7 derniers jours - #12★ 19 387+2Évolution des étoiles sur les 7 derniers jours
- #13
Traduire une vidéo d'une langue à une autre et intégrer le doublage et les sous-titres.
★ 18 871+38Évolution des étoiles sur les 7 derniers jours - #14★ 17 476+1Évolution des étoiles sur les 7 derniers jours
- #15
VoiceStudio est l'alternative open source et entièrement locale à ElevenLabs : clonage vocal, design vocal, doublage vidéo, dictée, transcription et création de livres audio en 646 langues.
★ 14 835+2 880Évolution des étoiles sur les 7 derniers jours - #16
Transcription, synthèse vocale, diarisation, amélioration de la parole, séparation de sources et VAD utilisant la nouvelle génération de Kaldi avec onnxruntime, sans connexion Internet. Supporte les systèmes embarqués, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, NPU RK, NPU Axera, NPU Ascend, serveurs x86_64, client/serveur websocket, et 12 langages de programmation.
★ 14 575+95Évolution des étoiles sur les 7 derniers jours - #17
TTS multilingue ultra-rapide fonctionnant localement sur l'appareil via ONNX.
★ 13 757+20Évolution des étoiles sur les 7 derniers jours - #18
Interface Web Gradio pour créateurs et développeurs, intégrant des fonctionnalités clés de TTS (Edge-TTS, kokoro) et de clonage vocal zero-shot (E2 & F5-TTS, CosyVoice), avec traitement audio Whisper, téléchargement YouTube, isolation vocale Demucs et traduction multilingue.
★ 12 730+54Évolution des étoiles sur les 7 derniers jours - #19
Utilisez le service de synthèse vocale en ligne de Microsoft Edge depuis Python sans avoir besoin de Microsoft Edge, de Windows ou d'une clé API.
★ 11 847+29Évolution des étoiles sur les 7 derniers jours - #20
Amphion est une boîte à outils pour la génération audio, musicale et vocale. Son objectif est de soutenir la recherche reproductible et d'aider les chercheurs et ingénieurs débutants à se lancer dans la recherche et le développement liés à la génération audio, musicale et vocale.
★ 10 276+1Évolution des étoiles sur les 7 derniers jours - #21★ 9 949+3Évolution des étoiles sur les 7 derniers jours
- #22
EmotiVoice 😊 : un moteur TTS multi-voix contrôlé par prompts
★ 8 522-1Évolution des étoiles sur les 7 derniers jours - #23
Une bibliothèque de synthèse vocale (TTS), de reconnaissance vocale (STT) et de conversion parole-à-parole (STS) basée sur le framework MLX d'Apple, offrant une analyse vocale efficace sur Apple Silicon.
★ 7 826+23Évolution des étoiles sur les 7 derniers jours - #24
Bibliothèque de synthèse vocale multilingue de haute qualité par MyShell.ai. Supporte l'anglais, l'espagnol, le français, le chinois, le japonais et le coréen.
★ 7 616+7Évolution des étoiles sur les 7 derniers jours - #25
eSpeak NG est un synthétiseur vocal open source prenant en charge plus d'une centaine de langues et d'accents.
★ 6 802+13Évolution des étoiles sur les 7 derniers jours - #26
IA vocale embarquée pour Apple Silicon
★ 6 353+8Évolution des étoiles sur les 7 derniers jours - #27
StyleTTS 2 : Vers une synthèse vocale de niveau humain grâce à la diffusion de style et à l'entraînement antagoniste avec de grands modèles de langage vocal
★ 6 342+3Évolution des étoiles sur les 7 derniers jours - #28
Ce dépôt contient des ressources sélectionnées sur le Prompt Engineering, avec un accent sur Generative Pre-trained Transformer (GPT), ChatGPT, PaLM, etc.
★ 6 306+7Évolution des étoiles sur les 7 derniers jours - #29
Silero Models : modèles de synthèse vocale pré-entraînés rendus extrêmement simples.
★ 6 084-1Évolution des étoiles sur les 7 derniers jours - #30
Transformez votre PC, Mac ou machine Linux en serveur d'IA. Inférence LLM, interface de chat, voix, agents, workflows, RAG et génération d'images.
★ 5 931+1 108Évolution des étoiles sur les 7 derniers jours