text-to-speech
Các kho mã nguồn mở đang theo dõi được gắn thẻ text-to-speech, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng text-to-speech trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ text-to-speech.
- #1
Một môi trường chạy giọng nói thời gian thực giúp các Agent trò chuyện, làm việc và hiện diện. Môi trường chạy giọng nói thời gian thực cho AI Agent
★ 2.362 - #2
Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.
★ 2.214 - #3
Trình chỉnh sửa video mã nguồn mở, ưu tiên lưu trữ cục bộ, nơi người sáng tạo và các tác nhân AI cùng chỉnh sửa trên một dòng thời gian thực.
★ 792 - #4
Công cụ dịch màn hình Android thời gian thực mã nguồn mở không cần ROOT, phù hợp cho trò chơi, tiểu thuyết hình ảnh và manga. Hỗ trợ OCR trên thiết bị và đám mây, LLM ngoại tuyến, nhiều dịch vụ dịch thuật, hiển thị bản dịch trên màn hình và chuyển văn bản thành giọng nói (TTS).
★ 786 - #5
Công cụ đọc chính tả bằng giọng nói cục bộ, miễn phí, tốc độ cao cho macOS với khả năng chuyển đổi văn bản trên thiết bị
★ 541
- #1
Sử dụng mô hình ngôn ngữ lớn AI và quy trình làm việc tự động để tạo video ngắn độ nét cao chỉ bằng một cú nhấp chuột dựa trên chủ đề hoặc từ khóa.
★ 119.977+1.509Thay đổi số sao trong 7 ngày qua - #2
Giao diện người dùng cục bộ để chạy và huấn luyện LLM cùng các mô hình khuếch tán, bao gồm Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX và nhiều hơn nữa.
★ 75.515+337Thay đổi số sao trong 7 ngày qua - #3
Chỉ 1 phút dữ liệu giọng nói cũng có thể được dùng để huấn luyện một mô hình TTS tốt! (nhân bản giọng nói ít mẫu)
★ 61.476+138Thay đổi số sao trong 7 ngày qua - #4
Hệ thống sản xuất video tự trị (agentic) mã nguồn mở đầu tiên trên thế giới. 12 pipeline sản xuất, hơn 100 công cụ, hơn 700 kỹ năng agent và tệp kiến thức sản xuất. Biến trợ lý lập trình AI của bạn thành một studio sản xuất video toàn diện.
★ 55.719+1.707Thay đổi số sao trong 7 ngày qua - #5
🐸💬 - bộ công cụ học sâu cho chuyển văn bản thành giọng nói, đã được kiểm chứng qua thực chiến trong nghiên cứu và sản xuất
★ 45.985+18Thay đổi số sao trong 7 ngày qua - #6★ 39.814+9Thay đổi số sao trong 7 ngày qua
- #7★ 37.419+61Thay đổi số sao trong 7 ngày qua
- #8
🚀 Nhân bản giọng nói trong 5 giây để tạo ra lời nói bất kỳ theo thời gian thực
★ 36.912+0Thay đổi số sao trong 7 ngày qua - #9
VoxCPM2: TTS không cần Tokenizer để tạo giọng nói đa ngôn ngữ, thiết kế giọng nói sáng tạo và nhân bản như thật
★ 36.595+345Thay đổi số sao trong 7 ngày qua - #10
Một hệ thống chuyển đổi văn bản thành giọng nói (Text-To-Speech) Zero-Shot hiệu quả và có thể kiểm soát ở cấp độ công nghiệp
★ 23.686+109Thay đổi số sao trong 7 ngày qua - #11
Mô hình tạo giọng nói lớn đa ngôn ngữ, cung cấp khả năng toàn diện từ suy luận, đào tạo đến triển khai.
★ 23.426+359Thay đổi số sao trong 7 ngày qua - #12
Một mô hình TTS có khả năng tạo ra đoạn hội thoại cực kỳ chân thực trong một lần chạy duy nhất.
★ 19.387+2Thay đổi số sao trong 7 ngày qua - #13
Dịch video từ ngôn ngữ này sang ngôn ngữ khác và chèn lồng tiếng & phụ đề.
★ 18.871+38Thay đổi số sao trong 7 ngày qua - #14★ 17.476+1Thay đổi số sao trong 7 ngày qua
- #15
VoiceStudio là giải pháp thay thế ElevenLabs mã nguồn mở, chạy hoàn toàn cục bộ — nhân bản giọng nói, thiết kế giọng nói, lồng tiếng video, đọc chính tả, chuyển đổi văn bản thành giọng nói và tạo sách nói bằng 646 ngôn ngữ.
★ 14.835+2.880Thay đổi số sao trong 7 ngày qua - #16
Chuyển đổi giọng nói thành văn bản, văn bản thành giọng nói, phân đoạn người nói, cải thiện giọng nói, tách nguồn âm thanh và VAD sử dụng Kaldi thế hệ mới với onnxruntime không cần kết nối Internet. Hỗ trợ hệ thống nhúng, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, máy chủ x86_64, websocket server/client, hỗ trợ 12 ngôn ngữ lập trình
★ 14.575+95Thay đổi số sao trong 7 ngày qua - #17
TTS đa ngôn ngữ, chạy trên thiết bị, cực kỳ nhanh — chạy nguyên bản qua ONNX.
★ 13.757+20Thay đổi số sao trong 7 ngày qua - #18
Gradio WebUI dành cho người sáng tạo và nhà phát triển, tích hợp các tính năng TTS chính (Edge-TTS, kokoro) và nhân bản giọng nói zero-shot (E2 & F5-TTS, CosyVoice), xử lý âm thanh Whisper, tải xuống YouTube, tách giọng hát Demucs và dịch đa ngôn ngữ.
★ 12.730+54Thay đổi số sao trong 7 ngày qua - #19
Sử dụng dịch vụ chuyển văn bản thành giọng nói trực tuyến của Microsoft Edge từ Python MÀ KHÔNG cần Microsoft Edge, Windows hoặc khóa API
★ 11.847+29Thay đổi số sao trong 7 ngày qua - #20
Amphion (/æmˈfaɪən/) là bộ công cụ tạo Âm thanh, Âm nhạc và Tiếng nói. Mục đích của nó là hỗ trợ nghiên cứu có thể tái tạo và giúp các nhà nghiên cứu, kỹ sư trẻ bắt đầu trong lĩnh vực nghiên cứu và phát triển tạo âm thanh, âm nhạc và tiếng nói.
★ 10.276+1Thay đổi số sao trong 7 ngày qua - #21★ 9.949+3Thay đổi số sao trong 7 ngày qua
- #22
EmotiVoice 😊: Công cụ TTS đa giọng nói và điều khiển bằng prompt
★ 8.522-1Thay đổi số sao trong 7 ngày qua - #23
Một thư viện chuyển đổi văn bản thành giọng nói (TTS), giọng nói thành văn bản (STT) và giọng nói thành giọng nói (STS) được xây dựng trên framework MLX của Apple, cung cấp khả năng phân tích giọng nói hiệu quả trên Apple Silicon.
★ 7.826+23Thay đổi số sao trong 7 ngày qua - #24
Thư viện chuyển văn bản thành giọng nói đa ngôn ngữ chất lượng cao từ MyShell.ai. Hỗ trợ tiếng Anh, Tây Ban Nha, Pháp, Trung Quốc, Nhật Bản và Hàn Quốc.
★ 7.616+7Thay đổi số sao trong 7 ngày qua - #25
eSpeak NG là một trình tổng hợp giọng nói mã nguồn mở hỗ trợ hơn một trăm ngôn ngữ và giọng địa phương.
★ 6.802+13Thay đổi số sao trong 7 ngày qua - #26
AI giọng nói trên thiết bị dành cho Apple Silicon
★ 6.353+8Thay đổi số sao trong 7 ngày qua - #27
StyleTTS 2: Hướng tới Chuyển văn bản thành giọng nói cấp độ con người thông qua khuếch tán phong cách và huấn luyện đối kháng với các Speech Language Model lớn
★ 6.342+3Thay đổi số sao trong 7 ngày qua - #28
Kho lưu trữ này chứa các tài nguyên được tuyển chọn thủ công về Prompt Engineering với trọng tâm là Generative Pre-trained Transformer (GPT), ChatGPT, PaLM, v.v.
★ 6.306+7Thay đổi số sao trong 7 ngày qua - #29
Silero Models: các mô hình chuyển văn bản thành giọng nói được huấn luyện trước trở nên vô cùng đơn giản
★ 6.084-1Thay đổi số sao trong 7 ngày qua - #30
Biến PC, Mac hoặc máy Linux của bạn thành một AI server. Suy luận LLM, giao diện trò chuyện, giọng nói, tác nhân, quy trình làm việc, RAG và tạo hình ảnh.
★ 5.931+1.108Thay đổi số sao trong 7 ngày qua