voice-cloning
Các kho mã nguồn mở đang theo dõi được gắn thẻ voice-cloning, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng voice-cloning trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ voice-cloning.
- #1
Chỉ 1 phút dữ liệu giọng nói cũng có thể được dùng để huấn luyện một mô hình TTS tốt! (nhân bản giọng nói ít mẫu)
★ 61.476+218Thay đổi số sao trong 7 ngày qua - #2
Sao chép giọng nói trong 5 giây để tạo ra lời nói bất kỳ theo thời gian thực
★ 60.117+8Thay đổi số sao trong 7 ngày qua - #3
🐸💬 - bộ công cụ học sâu cho chuyển văn bản thành giọng nói, đã được kiểm chứng qua thực chiến trong nghiên cứu và sản xuất
★ 45.985+31Thay đổi số sao trong 7 ngày qua - #4
VoxCPM2: TTS không cần Tokenizer để tạo giọng nói đa ngôn ngữ, thiết kế giọng nói sáng tạo và nhân bản như thật
★ 36.595+445Thay đổi số sao trong 7 ngày qua - #5
Mô hình tạo giọng nói lớn đa ngôn ngữ, cung cấp khả năng toàn diện từ suy luận, đào tạo đến triển khai.
★ 23.426+498Thay đổi số sao trong 7 ngày qua - #6
Tạo sách nói từ sách điện tử, nhân bản giọng nói và hơn 1158 ngôn ngữ!
★ 20.097+44Thay đổi số sao trong 7 ngày qua - #7
Cắt, dịch, căn chỉnh phụ đề cấp độ Netflix và thậm chí lồng tiếng - nhóm phụ đề video AI hoàn toàn tự động chỉ với một cú nhấp chuột
★ 18.339+71Thay đổi số sao trong 7 ngày qua - #8
VoiceStudio là giải pháp thay thế ElevenLabs mã nguồn mở, chạy hoàn toàn cục bộ — nhân bản giọng nói, thiết kế giọng nói, lồng tiếng video, đọc chính tả, chuyển đổi văn bản thành giọng nói và tạo sách nói bằng 646 ngôn ngữ.
★ 14.835+3.076Thay đổi số sao trong 7 ngày qua - #9
Gradio WebUI dành cho người sáng tạo và nhà phát triển, tích hợp các tính năng TTS chính (Edge-TTS, kokoro) và nhân bản giọng nói zero-shot (E2 & F5-TTS, CosyVoice), xử lý âm thanh Whisper, tải xuống YouTube, tách giọng hát Demucs và dịch đa ngôn ngữ.
★ 12.730+83Thay đổi số sao trong 7 ngày qua - #10
Bộ công cụ xử lý giọng nói dễ sử dụng, bao gồm mô hình tự giám sát (Self-Supervised Learning), SOTA/Streaming ASR có dấu câu, Streaming TTS tích hợp frontend văn bản, Hệ thống xác thực người nói, Dịch giọng nói đầu cuối và Nhận diện từ khóa. Đạt giải Demo xuất sắc nhất tại NAACL 2022.
★ 12.676+6Thay đổi số sao trong 7 ngày qua - #11
YuE: Mô hình nền tảng tạo nhạc toàn bài mở, tương tự như Suno.ai nhưng là mã nguồn mở
★ 6.416+13Thay đổi số sao trong 7 ngày qua - #12
Công cụ bản địa hóa video AI mã nguồn mở: tự động tải xuống video YouTube/Bilibili, nhận diện và dịch phụ đề, lồng tiếng nhân bản giọng nói, trộn âm thanh và chèn phụ đề.
★ 5.404+45Thay đổi số sao trong 7 ngày qua - #13
MOSS‑TTS Family là một dòng mô hình tạo giọng nói và âm thanh mã nguồn mở từ MOSI.AI và nhóm OpenMOSS. Được thiết kế cho các kịch bản thực tế phức tạp, có độ trung thực và biểu cảm cao, bao gồm giọng nói dài ổn định, hội thoại nhiều người nói, thiết kế giọng nói/nhân vật, hiệu ứng âm thanh môi trường và TTS phát trực tuyến thời gian thực.
★ 4.058+26Thay đổi số sao trong 7 ngày qua - #14
Công cụ chuyển đổi giọng nói đơn giản, chất lượng cao, tập trung vào tính dễ sử dụng và hiệu năng.
★ 3.674+28Thay đổi số sao trong 7 ngày qua - #15★ 2.818+1Thay đổi số sao trong 7 ngày qua
- #16
Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.
★ 2.214+187Thay đổi số sao trong 7 ngày qua - #17★ 1.760+6Thay đổi số sao trong 7 ngày qua
- #18
Máy chủ MiniMax Model Context Protocol (MCP) chính thức cho phép tương tác với các API Chuyển đổi Văn bản thành Giọng nói, tạo hình ảnh và tạo video mạnh mẽ.
★ 1.573+3Thay đổi số sao trong 7 ngày qua - #19
Tích hợp ComfyUI toàn diện cho mô hình chuyển văn bản thành giọng nói VibeVoice của Microsoft, hỗ trợ tổng hợp giọng nói một và nhiều người nói chất lượng cao trực tiếp trong quy trình làm việc ComfyUI của bạn.
★ 1.555+6Thay đổi số sao trong 7 ngày qua - #20
Một ứng dụng Python/PyTorch để tổng hợp giọng nói con người một cách dễ dàng
★ 1.440+0Thay đổi số sao trong 7 ngày qua - #21
Tự triển khai mô hình Chatterbox TTS mạnh mẽ. Máy chủ này cung cấp Web UI thân thiện với người dùng, các điểm cuối API linh hoạt (bao gồm tương thích với OpenAI), giọng đọc có sẵn, nhân bản giọng nói và xử lý văn bản quy mô sách nói lớn. Chạy tăng tốc trên NVIDIA (CUDA), AMD (ROCm) và CPU.
★ 1.427+7Thay đổi số sao trong 7 ngày qua - #22
💎 Danh sách các kho ngữ liệu giọng nói có thể truy cập cho ASR, TTS và các Công nghệ Giọng nói khác
★ 1.399+0Thay đổi số sao trong 7 ngày qua - #23
Trình tạo podcast AI cho các tập song ngữ, đa ngôn ngữ, giải pháp thay thế cho NotebookLLM; Trình tạo podcast AI hội thoại giống người thật, đa ngôn ngữ, đa âm sắc
★ 1.289-1Thay đổi số sao trong 7 ngày qua - #24
Giao diện web (webui) cho các mạng neural liên quan đến âm thanh khác nhau.
★ 1.246-1Thay đổi số sao trong 7 ngày qua - #25
Mô hình chuyển văn bản thành giọng nói dựa trên Flow Matching với khả năng kiểm soát phong cách điều khiển bằng Emoji
★ 1.228+8Thay đổi số sao trong 7 ngày qua - #26
Một tích hợp node tùy chỉnh ComfyUI cho chuyển đổi văn bản thành giọng nói và chuyển đổi giọng nói đa ngôn ngữ, đa công nghệ cục bộ. Hỗ trợ: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (cổ điển và đa ngôn ngữ), F5-TTS, Higgs Audio 2, 3 và VibeVoice với độ dài văn bản không giới hạn, thời gian SRT, hỗ trợ nhân vật và nhiều công cụ âm thanh khác
★ 1.187+8Thay đổi số sao trong 7 ngày qua - #27
Máy chủ suy luận LLM gốc cho Apple Silicon. Tương thích với API OpenAI và Anthropic. Không sử dụng Python. Bao gồm ứng dụng MLX Core trên macOS với tính năng trò chuyện, chế độ đại lý và gọi công cụ.
★ 1.115+261Thay đổi số sao trong 7 ngày qua - #28
Trình tạo sách nói đa giọng nói hỗ trợ bởi AI — chú thích kịch bản LLM, nhân bản giọng nói, thiết kế giọng nói, huấn luyện LoRA, kiểm soát phong cách theo từng dòng, và xuất ra MP3, M4B chia chương, hoặc đa rãnh Audacity. Xây dựng trên Qwen3-TTS.
★ 995+12Thay đổi số sao trong 7 ngày qua - #29
Một mô hình chỉnh sửa âm thanh Học tăng cường dựa trên LLM 3B tham số mạnh mẽ, xuất sắc trong việc chỉnh sửa cảm xúc, phong cách nói và ngôn ngữ cận lời, đồng thời tích hợp tính năng chuyển đổi văn bản thành giọng nói zero-shot mạnh mẽ
★ 972+3Thay đổi số sao trong 7 ngày qua - #30
Công cụ chuyển văn bản thành giọng nói (TTS) Android nhẹ, hoạt động ngoại tuyến, hỗ trợ sao chép giọng nói toàn hệ thống và đọc văn bản chất lượng cao.
★ 803+5Thay đổi số sao trong 7 ngày qua