tts
Các kho mã nguồn mở đang theo dõi được gắn thẻ tts, sắp xếp theo số sao.
- #121
Trình tạo sách nói đa giọng nói hỗ trợ bởi AI — chú thích kịch bản LLM, nhân bản giọng nói, thiết kế giọng nói, huấn luyện LoRA, kiểm soát phong cách theo từng dòng, và xuất ra MP3, M4B chia chương, hoặc đa rãnh Audacity. Xây dựng trên Qwen3-TTS.
★ 996+17Thay đổi số sao trong 7 ngày qua - #122
🧸 Lobe Vidol - Giúp mọi người dễ dàng tiếp cận Thần tượng ảo
★ 986+1Thay đổi số sao trong 7 ngày qua - #123
Một mô hình chỉnh sửa âm thanh Học tăng cường dựa trên LLM 3B tham số mạnh mẽ, xuất sắc trong việc chỉnh sửa cảm xúc, phong cách nói và ngôn ngữ cận lời, đồng thời tích hợp tính năng chuyển đổi văn bản thành giọng nói zero-shot mạnh mẽ
★ 971+1Thay đổi số sao trong 7 ngày qua - #124★ 970+2Thay đổi số sao trong 7 ngày qua
- #125★ 955-1Thay đổi số sao trong 7 ngày qua
- #126
Trung tâm nghiên cứu AI âm thanh: các bài báo, mô hình mở, điểm chuẩn và tập dữ liệu trên audio LLMs, nhận dạng giọng nói, TTS, tạo nhạc và âm thanh.
★ 953+3Thay đổi số sao trong 7 ngày qua - #127
Làm cho giọng nói TTS tự nhiên của Azure có thể truy cập được đối với bất kỳ ứng dụng tương thích SAPI 5 nào.
★ 933+12Thay đổi số sao trong 7 ngày qua - #128
Hệ thống TTS nền tảng mã nguồn mở được hỗ trợ bởi LLM
★ 920+1Thay đổi số sao trong 7 ngày qua - #129
Bộ công cụ thuật toán AI ngoại tuyến miễn phí bằng Java, hỗ trợ nhận dạng khuôn mặt, phát hiện liveness, nhận dạng biểu cảm, phát hiện đối tượng, phân đoạn thực thể, phát hiện người đi bộ, nhận dạng văn bản OCR, nhận dạng biển số xe, nhận dạng bảng biểu, ASR+TTS, dịch máy và các chức năng khác, chỉ cần thêm phụ thuộc Maven là có thể sử dụng. Hỗ trợ PyTorch, Tensorflow, đã tích hợp các mô hình phổ biến như Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5), Whisper
★ 908+3Thay đổi số sao trong 7 ngày qua - #130
Framework phục vụ mô hình ML hiệu năng cao, cung cấp tính năng xử lý theo lô động và đường ống CPU/GPU để khai thác tối đa máy tính của bạn
★ 902+0Thay đổi số sao trong 7 ngày qua - #131
Giao diện web để sử dụng và tinh chỉnh XTTS
★ 895+0Thay đổi số sao trong 7 ngày qua - #132
DiffWave là một bộ tổng hợp dạng sóng và bộ tạo giọng nói neural nhanh chóng, chất lượng cao.
★ 885+0Thay đổi số sao trong 7 ngày qua - #133
Chuyển đổi các tệp PDF thành podcast AI để tạo ra nội dung âm thanh hấp dẫn khi đang di chuyển.
★ 875+1Thay đổi số sao trong 7 ngày qua - #134
Bộ công cụ thân thiện với người dùng để nhận dạng/chuyển đổi/ghi âm giọng nói, v.v.
★ 873+0Thay đổi số sao trong 7 ngày qua - #135
Mô hình Bark của Suno AI viết bằng C/C++ để tạo văn bản thành giọng nói tốc độ cao
★ 867+1Thay đổi số sao trong 7 ngày qua - #136
Giải pháp tích hợp AI đơn giản và chi phí thấp nhất. Nếu bạn thích dự án này, hãy tặng một Star~
★ 856+2Thay đổi số sao trong 7 ngày qua - #137
SumatraPDF fork: Chinese EPUB/MOBI, smart PDF dark mode, OCR, TTS, offline dictionary.
★ 828+15Thay đổi số sao trong 7 ngày qua - #138
Voxtral ASR & TTS chạy nguyên bản và trên trình duyệt. Một triển khai Rust của Voxtral mini realtime ASR/TTS từ Mistral sử dụng framework Burn ML.
★ 819+2Thay đổi số sao trong 7 ngày qua - #139
🔥🔥 Kokoro viết bằng Rust. https://huggingface.co/hexgrad/Kokoro-82M Công cụ chuyển văn bản thành giọng nói (TTS) thời gian thực cực nhanh với chất lượng cao nhất mà bạn từng thấy.
★ 817+1Thay đổi số sao trong 7 ngày qua - #140
Chuyển đổi bất kỳ kho lưu trữ git nào thành podcast hấp dẫn
★ 814-1Thay đổi số sao trong 7 ngày qua - #141
Trình đọc eBook trên terminal với tính năng chuyển đổi văn bản thành giọng nói chất lượng như sách nói — Hỗ trợ EPUB, PDF, DOCX, HTML, RTF, TXT và MD.
★ 806+2Thay đổi số sao trong 7 ngày qua - #142
Lobe TTS - Thư viện TTS/STT chất lượng cao và đáng tin cậy cho máy chủ và trình duyệt.
★ 805+1Thay đổi số sao trong 7 ngày qua - #143
AI VTuber tích hợp LLM, ASR, TTS, OCR, CV và nhiều công nghệ khác để livestream hoặc chơi Minecraft cùng bạn.
★ 803+5Thay đổi số sao trong 7 ngày qua - #144
Chuyển đổi giọng nói thành văn bản rồi thành giọng nói (Speech to Text to Speech). Gửi văn bản dưới dạng thông điệp OSC tới VRChat để hiển thị trên avatar.
★ 803+4Thay đổi số sao trong 7 ngày qua - #145
Công cụ chuyển văn bản thành giọng nói (TTS) Android nhẹ, hoạt động ngoại tuyến, hỗ trợ sao chép giọng nói toàn hệ thống và đọc văn bản chất lượng cao.
★ 801+2Thay đổi số sao trong 7 ngày qua - #146
Confucius4-TTS: Công cụ TTS Zero-Shot đa ngôn ngữ và xuyên ngôn ngữ
★ 794+10Thay đổi số sao trong 7 ngày qua - #147
SDK Swift dạng mô-đun để xử lý âm thanh với MLX trên Apple Silicon
★ 772+6Thay đổi số sao trong 7 ngày qua - #148
Công cụ dịch màn hình Android thời gian thực mã nguồn mở không cần ROOT, phù hợp cho trò chơi, tiểu thuyết hình ảnh và manga. Hỗ trợ OCR trên thiết bị và đám mây, LLM ngoại tuyến, nhiều dịch vụ dịch thuật, hiển thị bản dịch trên màn hình và chuyển văn bản thành giọng nói (TTS).
★ 768+82Thay đổi số sao trong 7 ngày qua - #149★ 763+1Thay đổi số sao trong 7 ngày qua
- #150
Trợ lý giọng nói thời gian thực — hỗ trợ truyền phát WebRTC, ASR faster-whisper, LLM cục bộ, TTS Vui Nano (300M). Tương thích với OpenAI Realtime API. Hỗ trợ sao chép giọng nói, ngắt lời, đạt tốc độ ~9× thời gian thực trên card 4090. Giấy phép Apache 2.0.
★ 757+10Thay đổi số sao trong 7 ngày qua