text-to-speech
標記 text-to-speech 主題、收錄中的開源專案,依星數排序。
- #61★ 1,836+0近 7 天星數變化
- #62
為你的應用程式打造的自我編碼系統 — 適用於 Android 的 Alan AI SDK
★ 1,807+0近 7 天星數變化 - #63★ 1,760+0近 7 天星數變化
- #64
應用程式的自我編碼系統 — 用於 Flutter 的 Alan AI SDK
★ 1,756+0近 7 天星數變化 - #65
根據字幕檔自動翻譯影片文字,然後使用 AI 語音服務建立新的配音與翻譯音軌,並透過字幕的時間軸來同步語音。
★ 1,746+0近 7 天星數變化 - #66
一個可以用一鍵朗讀網頁內容的超棒瀏覽器擴充功能
★ 1,737+0近 7 天星數變化 - #67
透過 ExecuTorch 在 React Native 裝置端以宣告式方式執行 AI 模型。
★ 1,707+0近 7 天星數變化 - #68
應用程式的自我編碼系統 — 適用於 Ionic 的 Alan AI SDK
★ 1,649+0近 7 天星數變化 - #69
使用 PyTorch 的非官方 Parallel WaveGAN(含 MelGAN、Multi-band MelGAN、HiFi-GAN 與 StyleMelGAN)
★ 1,646+0近 7 天星數變化 - #70★ 1,622+0近 7 天星數變化
- #71
主題 → 適用於 Coding Agent 的 4K 旁白影片。v4.0:所有 TTS 皆透過 ttsCN 引擎元件(包含 MiniMax 聲音複製等 11 個平台、原生詞級字幕同步)、基於 manifest 的資產引擎、Remotion 合成、成本受控的 AI 生成
★ 1,599+0近 7 天星數變化 - #72
官方 MiniMax Model Context Protocol (MCP) 伺服器,可與強大的文字轉語音、影像生成和影片生成 API 進行互動。
★ 1,573+0近 7 天星數變化 - #73
針對 Apple Silicon 的高效能 OpenAI 與 Anthropic 相容 LLM 推論伺服器。原生支援 MLX、連續批次處理、多模態模型、MCP 工具呼叫以及 Claude Code。
★ 1,557+0近 7 天星數變化 - #74
適用於 Microsoft VibeVoice 文字轉語音模型的完整 ComfyUI 整合,讓您能在 ComfyUI 工作流程中直接進行高品質的單人與多人語音合成。
★ 1,555+0近 7 天星數變化 - #75★ 1,548+0近 7 天星數變化
- #76★ 1,542+0近 7 天星數變化
- #77
會說話的頭像 (3D):使用全身 3D 頭像進行即時對嘴的 JavaScript 類別。
★ 1,522+0近 7 天星數變化 - #78
用於輕鬆合成人聲的 Python/PyTorch 應用程式
★ 1,440+0近 7 天星數變化 - #79★ 1,437+0近 7 天星數變化
- #80
自架強大的 Chatterbox TTS 模型。此伺服器提供使用者友善的 Web UI、靈活的 API 端點(包含相容 OpenAI)、預定義語音、語音複製,以及大型有聲書規模的文字處理。可在 NVIDIA (CUDA)、AMD (ROCm) 和 CPU 上加速執行。
★ 1,427+0近 7 天星數變化 - #81
🍦 Speech-AI-Forge 是一個圍繞 TTS 生成模型開發的專案,實作了 API 伺服器與基於 Gradio 的 WebUI。
★ 1,418+0近 7 天星數變化 - #82
影片同步翻譯與影片配音
★ 1,413+0近 7 天星數變化 - #83
💎 適用於 ASR、TTS 及其他語音技術的無障礙語音語料庫清單
★ 1,399+0近 7 天星數變化 - #84
在配備 Apple Silicon 的 Mac 上微調 LLMs。支援 SFT、DPO、GRPO、Vision、TTS、STT、Embedding 與 OCR 微調 —— 基於 MLX 原生實現。相容 Unsloth API。
★ 1,398+0近 7 天星數變化 - #85
[ICASSP 2024] 🍵 Matcha-TTS:具備條件式流匹配(Conditional Flow Matching)的高效 TTS 架構
★ 1,353+0近 7 天星數變化 - #86
[ICLR 2025] 針對音訊語言建模、每秒 40/75 個 token 的 SOTA 離散聲學編解碼器模型
★ 1,317+0近 7 天星數變化 - #87★ 1,314+0近 7 天星數變化
- #88
StreamSpeech 是一個用於離線與同步語音辨識、語音翻譯及語音合成的「一體化」無縫模型。
★ 1,288+0近 7 天星數變化 - #89
一個用於各種音訊相關神經網路的 WebUI
★ 1,246+0近 7 天星數變化 - #90
基於 Flow Matching 且支援 Emoji 驅動風格控制的文字轉語音模型
★ 1,228+0近 7 天星數變化