text-to-speech
Dépôts open source suivis étiquetés text-to-speech, triés par étoiles.
- #61★ 1 836+0Évolution des étoiles sur les 7 derniers jours
- #62
Le système d'auto-codage pour votre application — SDK Alan AI pour Android
★ 1 807+0Évolution des étoiles sur les 7 derniers jours - #63★ 1 760+0Évolution des étoiles sur les 7 derniers jours
- #64
Le système d'auto-codage pour votre application — SDK Alan AI pour Flutter
★ 1 756+0Évolution des étoiles sur les 7 derniers jours - #65
Traduit automatiquement le texte d'une vidéo à partir d'un fichier de sous-titres, puis utilise des services vocaux IA pour créer une nouvelle piste audio doublée et traduite, synchronisée avec les timings des sous-titres.
★ 1 746+0Évolution des étoiles sur les 7 derniers jours - #66
Une extension de navigateur pratique qui lit à haute voix le contenu des pages web en un clic.
★ 1 737+0Évolution des étoiles sur les 7 derniers jours - #67
Méthode déclarative pour exécuter des modèles d'IA sur appareil dans React Native, propulsée par ExecuTorch.
★ 1 707+0Évolution des étoiles sur les 7 derniers jours - #68
Le système d'auto-codage pour votre application — SDK Alan AI pour Ionic.
★ 1 649+0Évolution des étoiles sur les 7 derniers jours - #69
Implémentation non officielle de Parallel WaveGAN (incluant MelGAN, Multi-band MelGAN, HiFi-GAN et StyleMelGAN) avec PyTorch.
★ 1 646+0Évolution des étoiles sur les 7 derniers jours - #70
Application Linux Speech Note. Prise de notes, lecture et traduction avec reconnaissance vocale, synthèse vocale et traduction automatique hors ligne.
★ 1 622+0Évolution des étoiles sur les 7 derniers jours - #71
Sujet → Vidéo 4K commentée pour agents de codage. v4.0 : TTS complet via le moteur ttsCN (11 plateformes dont le clonage vocal MiniMax, synchronisation native des sous-titres au niveau du mot), moteur d'actifs basé sur manifeste, composition Remotion, génération IA limitée par les coûts.
★ 1 599+0Évolution des étoiles sur les 7 derniers jours - #72
Serveur officiel MiniMax Model Context Protocol (MCP) permettant d'interagir avec des API puissantes de synthèse vocale, de génération d'images et de génération de vidéos.
★ 1 573+0Évolution des étoiles sur les 7 derniers jours - #73
Serveur d'inférence LLM haute performance compatible OpenAI et Anthropic pour Apple Silicon. Support natif MLX, traitement par lots continu, modèles multimodaux, appel d'outils MCP et support de Claude Code.
★ 1 557+0Évolution des étoiles sur les 7 derniers jours - #74
Une intégration complète de ComfyUI pour le modèle de synthèse vocale VibeVoice de Microsoft, permettant une synthèse vocale de haute qualité pour un ou plusieurs locuteurs directement dans vos flux de travail ComfyUI.
★ 1 555+0Évolution des étoiles sur les 7 derniers jours - #75★ 1 548+0Évolution des étoiles sur les 7 derniers jours
- #76
Interagissez avec votre Mac et interrogez vos documents sans cloud. IA vocale locale et RAG sur appareil.
★ 1 542+0Évolution des étoiles sur les 7 derniers jours - #77
Talking Head (3D) : Une classe JavaScript pour la synchronisation labiale en temps réel utilisant des avatars 3D complets.
★ 1 522+0Évolution des étoiles sur les 7 derniers jours - #78
Une application Python/Pytorch pour synthétiser facilement des voix humaines
★ 1 440+0Évolution des étoiles sur les 7 derniers jours - #79★ 1 437+0Évolution des étoiles sur les 7 derniers jours
- #80
Auto-hébergez le puissant modèle TTS Chatterbox. Ce serveur propose une interface Web conviviale, des points de terminaison API flexibles (compatibles OpenAI), des voix prédéfinies, le clonage vocal et le traitement de texte à grande échelle pour les livres audio. Fonctionne en mode accéléré sur NVIDIA (CUDA), AMD (ROCm) et CPU.
★ 1 427+0Évolution des étoiles sur les 7 derniers jours - #81
Speech-AI-Forge est un projet articulé autour d'un modèle de génération TTS, implémentant un serveur API et une interface Web basée sur Gradio.
★ 1 418+0Évolution des étoiles sur les 7 derniers jours - #82
Traduction synchronisée pour vidéos. Doublage vidéo.
★ 1 413+0Évolution des étoiles sur les 7 derniers jours - #83
Une liste de corpus vocaux accessibles pour l'ASR, le TTS et d'autres technologies vocales.
★ 1 399+0Évolution des étoiles sur les 7 derniers jours - #84
Fine-tuning de LLM sur Mac avec Apple Silicon. Support natif MLX pour SFT, DPO, GRPO, Vision, TTS, STT, Embedding et OCR. API compatible avec Unsloth.
★ 1 398+0Évolution des étoiles sur les 7 derniers jours - #85
[ICASSP 2024] 🍵 Matcha-TTS : Une architecture TTS rapide avec appariement de flux conditionnel
★ 1 353+0Évolution des étoiles sur les 7 derniers jours - #86
[ICLR 2025] Modèles de codec acoustique discret SOTA avec 40/75 jetons par seconde pour la modélisation linguistique audio.
★ 1 317+0Évolution des étoiles sur les 7 derniers jours - #87
Moteur d'inférence hors ligne pour l'art, les conversations vocales en temps réel, les chatbots basés sur LLM et les flux de travail automatisés.
★ 1 314+0Évolution des étoiles sur les 7 derniers jours - #88
StreamSpeech est un modèle tout-en-un fluide pour la reconnaissance vocale, la traduction et la synthèse vocale, en mode hors ligne et simultané.
★ 1 288+0Évolution des étoiles sur les 7 derniers jours - #89
Une interface web pour différents réseaux de neurones liés à l'audio
★ 1 246+0Évolution des étoiles sur les 7 derniers jours - #90
Modèle de synthèse vocale basé sur le Flow Matching avec contrôle de style piloté par emoji
★ 1 228+0Évolution des étoiles sur les 7 derniers jours