text-to-speech
Các kho mã nguồn mở đang theo dõi được gắn thẻ text-to-speech, sắp xếp theo số sao.
- #61
một phần mềm tổng hợp giọng nói mã nguồn mở và miễn phí cho tiếng Nga và các ngôn ngữ khác
★ 1.836+0Thay đổi số sao trong 7 ngày qua - #62
Hệ thống tự động lập trình cho ứng dụng của bạn — Alan AI SDK cho Android
★ 1.807+0Thay đổi số sao trong 7 ngày qua - #63★ 1.760+0Thay đổi số sao trong 7 ngày qua
- #64
Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho Flutter
★ 1.756+0Thay đổi số sao trong 7 ngày qua - #65
Tự động dịch văn bản của video dựa trên tệp phụ đề, sau đó sử dụng các dịch vụ giọng nói AI để tạo một bản âm thanh lồng tiếng & dịch mới với phần lời thoại được đồng bộ hóa theo thời gian của phụ đề.
★ 1.746+0Thay đổi số sao trong 7 ngày qua - #66
Tiện ích mở rộng trình duyệt tuyệt vời giúp đọc to nội dung trang web chỉ bằng một cú nhấp chuột
★ 1.737+0Thay đổi số sao trong 7 ngày qua - #67
Cách khai báo để chạy các mô hình AI trong React Native trên thiết bị, được hỗ trợ bởi ExecuTorch.
★ 1.707+0Thay đổi số sao trong 7 ngày qua - #68
Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho Ionic
★ 1.649+0Thay đổi số sao trong 7 ngày qua - #69
Bản triển khai không chính thức của Parallel WaveGAN (+ MelGAN & Multi-band MelGAN & HiFi-GAN & StyleMelGAN) bằng PyTorch
★ 1.646+0Thay đổi số sao trong 7 ngày qua - #70
Ứng dụng Speech Note trên Linux. Ghi chú, đọc và dịch với tính năng Chuyển giọng nói thành văn bản, Chuyển văn bản thành giọng nói và Dịch máy ngoại tuyến.
★ 1.622+0Thay đổi số sao trong 7 ngày qua - #71
Chủ đề → Video lồng tiếng 4K cho các tác nhân lập trình. v4.0: toàn bộ TTS qua thành phần công cụ ttsCN (11 nền tảng bao gồm nhân bản giọng nói MiniMax, đồng bộ phụ đề cấp từ gốc), Công cụ tài sản dựa trên manifest, bố cục Remotion, tạo AI giới hạn chi phí
★ 1.599+0Thay đổi số sao trong 7 ngày qua - #72
Máy chủ MiniMax Model Context Protocol (MCP) chính thức cho phép tương tác với các API Chuyển đổi Văn bản thành Giọng nói, tạo hình ảnh và tạo video mạnh mẽ.
★ 1.573+0Thay đổi số sao trong 7 ngày qua - #73
Máy chủ suy luận LLM hiệu năng cao tương thích với OpenAI và Anthropic dành cho Apple Silicon. Hỗ trợ MLX native, continuous batching, các mô hình đa phương thức, gọi công cụ MCP và Claude Code.
★ 1.557+0Thay đổi số sao trong 7 ngày qua - #74
Tích hợp ComfyUI toàn diện cho mô hình chuyển văn bản thành giọng nói VibeVoice của Microsoft, hỗ trợ tổng hợp giọng nói một và nhiều người nói chất lượng cao trực tiếp trong quy trình làm việc ComfyUI của bạn.
★ 1.555+0Thay đổi số sao trong 7 ngày qua - #75★ 1.548+0Thay đổi số sao trong 7 ngày qua
- #76
Trò chuyện với Mac của bạn, truy vấn tài liệu mà không cần đám mây. AI giọng nói trên thiết bị + RAG
★ 1.542+0Thay đổi số sao trong 7 ngày qua - #77
Talking Head (3D): Một lớp JavaScript để đồng bộ hóa môi thời gian thực sử dụng avatar 3D toàn thân.
★ 1.522+0Thay đổi số sao trong 7 ngày qua - #78
Một ứng dụng Python/PyTorch để tổng hợp giọng nói con người một cách dễ dàng
★ 1.440+0Thay đổi số sao trong 7 ngày qua - #79★ 1.437+0Thay đổi số sao trong 7 ngày qua
- #80
Tự triển khai mô hình Chatterbox TTS mạnh mẽ. Máy chủ này cung cấp Web UI thân thiện với người dùng, các điểm cuối API linh hoạt (bao gồm tương thích với OpenAI), giọng đọc có sẵn, nhân bản giọng nói và xử lý văn bản quy mô sách nói lớn. Chạy tăng tốc trên NVIDIA (CUDA), AMD (ROCm) và CPU.
★ 1.427+0Thay đổi số sao trong 7 ngày qua - #81
🍦 Speech-AI-Forge là một dự án phát triển xung quanh mô hình tạo TTS, tích hợp API Server và WebUI dựa trên Gradio.
★ 1.418+0Thay đổi số sao trong 7 ngày qua - #82
Dịch đồng bộ cho video. Lồng tiếng video
★ 1.413+0Thay đổi số sao trong 7 ngày qua - #83
💎 Danh sách các kho ngữ liệu giọng nói có thể truy cập cho ASR, TTS và các Công nghệ Giọng nói khác
★ 1.399+0Thay đổi số sao trong 7 ngày qua - #84
Tinh chỉnh LLM trên máy Mac của bạn với Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding và tinh chỉnh OCR — chạy gốc trên MLX. API tương thích với Unsloth.
★ 1.398+0Thay đổi số sao trong 7 ngày qua - #85
[ICASSP 2024] 🍵 Matcha-TTS: Kiến trúc TTS nhanh với conditional flow matching
★ 1.353+0Thay đổi số sao trong 7 ngày qua - #86
[ICLR 2025] Các mô hình codec âm thanh rời rạc SOTA với 40/75 token mỗi giây cho mô hình hóa ngôn ngữ âm thanh
★ 1.317+0Thay đổi số sao trong 7 ngày qua - #87
Công cụ suy luận ngoại tuyến cho nghệ thuật, trò chuyện thoại thời gian thực, chatbot hỗ trợ bởi LLM và quy trình làm việc tự động
★ 1.314+0Thay đổi số sao trong 7 ngày qua - #88
StreamSpeech là một mô hình liền mạch "tất cả trong một" dành cho nhận dạng giọng nói ngoại tuyến và đồng thời, dịch giọng nói và tổng hợp giọng nói.
★ 1.288+0Thay đổi số sao trong 7 ngày qua - #89
Giao diện web (webui) cho các mạng neural liên quan đến âm thanh khác nhau.
★ 1.246+0Thay đổi số sao trong 7 ngày qua - #90
Mô hình chuyển văn bản thành giọng nói dựa trên Flow Matching với khả năng kiểm soát phong cách điều khiển bằng Emoji
★ 1.228+0Thay đổi số sao trong 7 ngày qua