text-to-speech
Các kho mã nguồn mở đang theo dõi được gắn thẻ text-to-speech, sắp xếp theo số sao.
- #31★ 5.831+0Thay đổi số sao trong 7 ngày qua
- #32
Nền tảng voice AI mã nguồn mở. Giải pháp thay thế tự lưu trữ cho Vapi và Retell. On Prem, BYOK qua Speech to Speech hoặc LLM/STT/TTS, tích hợp trình xây dựng quy trình trực quan, hỗ trợ MCP native và điện thoại.
★ 5.568+0Thay đổi số sao trong 7 ngày qua - #33
Công cụ bản địa hóa video AI mã nguồn mở: tự động tải xuống video YouTube/Bilibili, nhận diện và dịch phụ đề, lồng tiếng nhân bản giọng nói, trộn âm thanh và chèn phụ đề.
★ 5.404+0Thay đổi số sao trong 7 ngày qua - #34
Bộ bao bọc (wrapper) tương thích với OpenAI đã được Docker hóa cho Kokoro-82M text-to-speech với PyTorch trên đa nền tảng CPU, AMD, NVIDIA GPU; hỗ trợ đa giọng nói, phối giọng (voice-mixing), tự động ghép nối, mốc thời gian phụ đề, SSML và giao diện web đọc theo
★ 5.399+0Thay đổi số sao trong 7 ngày qua - #35
DiffSinger: Tổng hợp giọng hát qua cơ chế khuếch tán nông (SVS & TTS); AAAI 2022; Mã nguồn chính thức
★ 4.855+0Thay đổi số sao trong 7 ngày qua - #36★ 4.624+0Thay đổi số sao trong 7 ngày qua
- #37
Một bản triển khai gần như thời gian thực của Whisper từ OpenAI.
★ 4.246+0Thay đổi số sao trong 7 ngày qua - #38
Mô hình nền tảng cho TTS tự nhiên, biểu cảm giống con người
★ 4.203+0Thay đổi số sao trong 7 ngày qua - #39
MOSS‑TTS Family là một dòng mô hình tạo giọng nói và âm thanh mã nguồn mở từ MOSI.AI và nhóm OpenMOSS. Được thiết kế cho các kịch bản thực tế phức tạp, có độ trung thực và biểu cảm cao, bao gồm giọng nói dài ổn định, hội thoại nhiều người nói, thiết kế giọng nói/nhân vật, hiệu ứng âm thanh môi trường và TTS phát trực tuyến thời gian thực.
★ 4.058+0Thay đổi số sao trong 7 ngày qua - #40
Chuyển đổi văn bản thành giọng nói theo thời gian thực
★ 4.021+0Thay đổi số sao trong 7 ngày qua - #41
:stuck_out_tongue_closed_eyes: TensorFlowTTS: Tổng hợp giọng nói thời gian thực tiên tiến cho Tensorflow 2 (hỗ trợ tiếng Anh, Pháp, Hàn, Trung, Đức và dễ thích ứng cho các ngôn ngữ khác)
★ 3.996+0Thay đổi số sao trong 7 ngày qua - #42
Công cụ chuyển đổi giọng nói đơn giản, chất lượng cao, tập trung vào tính dễ sử dụng và hiệu năng.
★ 3.674+0Thay đổi số sao trong 7 ngày qua - #43
Giao diện WebUI đơn lẻ tích hợp Gradio + React với các tiện ích mở rộng cho ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T và Bark!
★ 3.250+0Thay đổi số sao trong 7 ngày qua - #44
Python SDK chính thức cho ElevenLabs API.
★ 3.083+0Thay đổi số sao trong 7 ngày qua - #45
[AutoArk] GPA (General Purpose Audio) có thể thực hiện ASR, TTS và chuyển đổi giọng nói chỉ với một mô hình nhỏ gọn!
★ 3.061+0Thay đổi số sao trong 7 ngày qua - #46
aeneas là một thư viện Python/C và bộ công cụ tự động đồng bộ hóa âm thanh và văn bản (còn gọi là căn chỉnh cưỡng bức)
★ 2.862+0Thay đổi số sao trong 7 ngày qua - #47★ 2.818+0Thay đổi số sao trong 7 ngày qua
- #48
Thư viện Python và công cụ CLI để giao tiếp với API chuyển đổi văn bản thành giọng nói của Google Translate
★ 2.628+0Thay đổi số sao trong 7 ngày qua - #49
🚀 Triển khai một chạm (bao gồm cả gói tích hợp offline)! Dựa trên ChatTTS, hỗ trợ đầu ra dạng stream, rút thẻ âm sắc, tạo âm thanh dài và đọc phân vai. Dễ sử dụng, không cần cài đặt phức tạp.
★ 2.593+0Thay đổi số sao trong 7 ngày qua - #50
MARY TTS -- một hệ thống tổng hợp văn bản thành giọng nói đa ngôn ngữ, mã nguồn mở được viết hoàn toàn bằng java
★ 2.583+0Thay đổi số sao trong 7 ngày qua - #51
Thư viện tổng hợp văn bản thành giọng nói (Text-to-Speech) ngoại tuyến cho Python
★ 2.530+0Thay đổi số sao trong 7 ngày qua - #52
TTS tiếng Việt với khả năng nhân bản giọng nói tức thì • Chạy trên thiết bị • Suy luận CPU thời gian thực • Chất lượng âm thanh 24kHz • Chuyển văn bản thành giọng nói tiếng Việt • Text to speech tiếng Việt • TTS tiếng Việt
★ 2.468+0Thay đổi số sao trong 7 ngày qua - #53
Một môi trường chạy giọng nói thời gian thực giúp các Agent trò chuyện, làm việc và hiện diện. Môi trường chạy giọng nói thời gian thực cho AI Agent
★ 2.379+58Thay đổi số sao trong 7 ngày qua - #54
HiFi-GAN: Generative Adversarial Networks cho tổng hợp giọng nói hiệu quả và độ trung thực cao
★ 2.367+0Thay đổi số sao trong 7 ngày qua - #55
Bản cài đặt PyTorch của VALL-E (Zero-Shot Text-To-Speech), Demo tái tạo tại https://lifeiteng.github.io/valle/index.html
★ 2.215+0Thay đổi số sao trong 7 ngày qua - #56
Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.
★ 2.214+0Thay đổi số sao trong 7 ngày qua - #57
Chuyển văn bản thành giọng nói có thể kiểm soát và nhanh chóng cho hơn 7000 ngôn ngữ!
★ 2.207+0Thay đổi số sao trong 7 ngày qua - #58
Endpoint API chuyển văn bản thành giọng nói miễn phí, chất lượng cao để thay thế OpenAI, Azure hoặc ElevenLabs
★ 2.075+0Thay đổi số sao trong 7 ngày qua - #59★ 2.048+0Thay đổi số sao trong 7 ngày qua
- #60
Bộ công cụ sản xuất video gốc AI dành cho Claude Code
★ 2.036+0Thay đổi số sao trong 7 ngày qua