text-to-speech
Repositori open source terpantau bertanda text-to-speech, diurutkan berdasarkan bintang.
- #31
Menghasilkan buku audio dari EPUB, PDF, dan teks dengan teks terjemahan (caption) yang disinkronkan.
★ 5.831+0Perubahan bintang dalam 7 hari terakhir - #32
Platform AI suara open-source. Alternatif self-hosted untuk Vapi dan Retell. On-premise, BYOK untuk Speech to Speech atau LLM/STT/TTS, dengan pembuat alur kerja visual, dukungan native MCP, dan teleponi.
★ 5.568+0Perubahan bintang dalam 7 hari terakhir - #33
Alat lokalisasi video AI sumber terbuka: otomatis mengunduh video YouTube/Bilibili, mengenali dan menerjemahkan subtitle, kloning suara, mencampur trek audio, dan menyematkan subtitle.
★ 5.404+0Perubahan bintang dalam 7 hari terakhir - #34
Wrapper berbasis Docker yang kompatibel dengan OpenAI untuk text-to-speech Kokoro-82M, mendukung PyTorch di CPU, AMD, dan NVIDIA GPU; fitur multi-speaker, pencampuran suara, auto-stitching, timestamp caption, SSML, dan antarmuka web readalong.
★ 5.399+0Perubahan bintang dalam 7 hari terakhir - #35
DiffSinger: Sintesis Suara Nyanyian melalui Mekanisme Difusi Dangkal (SVS & TTS); AAAI 2022; Kode resmi
★ 4.855+0Perubahan bintang dalam 7 hari terakhir - #36★ 4.624+0Perubahan bintang dalam 7 hari terakhir
- #37
Implementasi hampir real-time dari Whisper OpenAI.
★ 4.246+0Perubahan bintang dalam 7 hari terakhir - #38
Model dasar untuk TTS yang ekspresif dan mirip manusia
★ 4.203+0Perubahan bintang dalam 7 hari terakhir - #39
MOSS‑TTS Family adalah keluarga model pembuatan suara dan ucapan open‑source dari MOSI.AI dan tim OpenMOSS. Dirancang untuk skenario dunia nyata yang sangat akurat, sangat ekspresif, dan kompleks, mencakup ucapan berdurasi panjang yang stabil, dialog multi-pembicara, desain suara/karakter, efek suara lingkungan, dan TTS streaming waktu nyata.
★ 4.058+0Perubahan bintang dalam 7 hari terakhir - #40
Mengubah teks menjadi suara secara real-time.
★ 4.021+0Perubahan bintang dalam 7 hari terakhir - #41
TensorFlowTTS: Sintesis ucapan real-time mutakhir untuk Tensorflow 2 (mendukung bahasa Inggris, Prancis, Korea, Mandarin, Jerman, dan mudah diadaptasi untuk bahasa lain)
★ 3.996+0Perubahan bintang dalam 7 hari terakhir - #42
Alat konversi suara yang sederhana dan berkualitas tinggi dengan fokus pada kemudahan penggunaan dan performa.
★ 3.674+0Perubahan bintang dalam 7 hari terakhir - #43
Satu WebUI Gradio + React dengan ekstensi untuk ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, dan Bark.
★ 3.250+0Perubahan bintang dalam 7 hari terakhir - #44
SDK Python resmi untuk API ElevenLabs.
★ 3.083+0Perubahan bintang dalam 7 hari terakhir - #45
[AutoArk] GPA (General Purpose Audio) dapat melakukan ASR, TTS, dan konversi suara dengan satu model kecil!
★ 3.061+0Perubahan bintang dalam 7 hari terakhir - #46
aeneas adalah pustaka Python/C dan sekumpulan alat untuk menyinkronkan audio dan teks secara otomatis (dikenal sebagai forced alignment)
★ 2.862+0Perubahan bintang dalam 7 hari terakhir - #47★ 2.818+0Perubahan bintang dalam 7 hari terakhir
- #48
Pustaka Python dan alat CLI untuk berinteraksi dengan API text-to-speech Google Translate
★ 2.628+0Perubahan bintang dalam 7 hari terakhir - #49
Penyebaran sekali klik (termasuk paket integrasi offline)! Berbasis ChatTTS, mendukung output streaming, pemilihan suara, pembuatan audio panjang, dan pembacaan berbasis peran. Mudah digunakan, tanpa instalasi yang rumit.
★ 2.593+0Perubahan bintang dalam 7 hari terakhir - #50
MARY TTS — sistem sintesis text-to-speech multibahasa sumber terbuka yang ditulis dalam Java murni
★ 2.583+0Perubahan bintang dalam 7 hari terakhir - #51★ 2.530+0Perubahan bintang dalam 7 hari terakhir
- #52
TTS bahasa Vietnam dengan kloning suara instan • On-device • Inferensi CPU real-time • Kualitas audio 24kHz
★ 2.468+0Perubahan bintang dalam 7 hari terakhir - #53
Runtime suara real-time yang menjaga Agen tetap berbicara, bekerja, dan hadir. Runtime Suara Real-time untuk Agen AI.
★ 2.379+58Perubahan bintang dalam 7 hari terakhir - #54
HiFi-GAN: Generative Adversarial Networks untuk sintesis ucapan yang efisien dan fidelitas tinggi
★ 2.367+0Perubahan bintang dalam 7 hari terakhir - #55
Implementasi PyTorch untuk VALL-E (Zero-Shot Text-To-Speech), demo reproduksi tersedia di https://lifeiteng.github.io/valle/index.html
★ 2.215+0Perubahan bintang dalam 7 hari terakhir - #56
Mesin inferensi C++ murni yang lengkap untuk model audio, didukung oleh ggml. Mendukung TTS, STT, VAD, konversi suara, pembuatan musik, dan lainnya, dengan performa yang sangat dioptimalkan. Tanpa dependensi Python.
★ 2.214+0Perubahan bintang dalam 7 hari terakhir - #57
Text-to-Speech yang cepat dan dapat dikontrol untuk lebih dari 7000 bahasa!
★ 2.207+0Perubahan bintang dalam 7 hari terakhir - #58
Endpoint API text-to-speech gratis dan berkualitas tinggi sebagai pengganti OpenAI, Azure, atau ElevenLabs
★ 2.075+0Perubahan bintang dalam 7 hari terakhir - #59★ 2.048+0Perubahan bintang dalam 7 hari terakhir
- #60
Perangkat produksi video berbasis AI untuk Claude Code.
★ 2.036+0Perubahan bintang dalam 7 hari terakhir