text-to-speech
标记 text-to-speech 主题、收录中的开源项目,按星标数排序。
- #61★ 1,837+1近 7 天星标变化
- #62
为你的应用程序打造的自我编码系统 — 适用于 Android 的 Alan AI SDK
★ 1,807+0近 7 天星标变化 - #63★ 1,774+14近 7 天星标变化
- #64
应用程序的自我编码系统 — 用于 Flutter 的 Alan AI SDK
★ 1,756+0近 7 天星标变化 - #65
根据字幕文件自动翻译视频文本,然后使用 AI 语音服务创建新的配音与翻译音轨,并使用字幕的时间轴来同步语音。
★ 1,746+0近 7 天星标变化 - #66
一个可以一键朗读网页内容的超棒浏览器扩展
★ 1,742+5近 7 天星标变化 - #67
借助 ExecuTorch 在 React Native 设备端以声明式方式运行 AI 模型。
★ 1,730+23近 7 天星标变化 - #68
应用程序的自我编码系统 — 适用于 Ionic 的 Alan AI SDK
★ 1,649+0近 7 天星标变化 - #69
使用 PyTorch 的非官方 Parallel WaveGAN(含 MelGAN、Multi-band MelGAN、HiFi-GAN 与 StyleMelGAN)
★ 1,645-1近 7 天星标变化 - #70★ 1,633+11近 7 天星标变化
- #71
主题 → 适用于 Coding Agent 的 4K 旁白视频。v4.0:所有 TTS 均通过 ttsCN 引擎组件(包含 MiniMax 声音克隆等 11 个平台、原生词级字幕同步)、基于 manifest 的资产引擎、Remotion 合成、成本受控的 AI 生成
★ 1,608+9近 7 天星标变化 - #72★ 1,584+36近 7 天星标变化
- #73
官方 MiniMax Model Context Protocol (MCP) 服务器,可与强大的文本转语音、图像生成和视频生成 API 进行交互。
★ 1,579+6近 7 天星标变化 - #74
针对 Apple Silicon 的高性能 OpenAI 与 Anthropic 兼容 LLM 推理服务器。原生支持 MLX、连续批处理、多模态模型、MCP 工具调用以及 Claude Code。
★ 1,568+11近 7 天星标变化 - #75
适用于 Microsoft VibeVoice 文本转语音模型的完整 ComfyUI 集成,让您能在 ComfyUI 工作流程中直接进行高质量的单人与多人语音合成。
★ 1,560+5近 7 天星标变化 - #76
会说话的头像 (3D):使用全身 3D 头像进行实时对嘴的 JavaScript 类。
★ 1,544+22近 7 天星标变化 - #77
自架强大的 Chatterbox TTS 模型。此服务器提供用户友好的 Web UI、灵活的 API 端点(包含兼容 OpenAI)、预定义语音、语音克隆,以及大型有声书规模的文本处理。可在 NVIDIA (CUDA)、AMD (ROCm) 和 CPU 上加速运行。
★ 1,440+13近 7 天星标变化 - #78★ 1,439+2近 7 天星标变化
- #79
用于轻松合成人声的 Python/PyTorch 应用程序
★ 1,437-3近 7 天星标变化 - #80
🍦 Speech-AI-Forge 是一个围绕 TTS 生成模型开发的项目,实现了 API 服务器与基于 Gradio 的 WebUI。
★ 1,420+2近 7 天星标变化 - #81
视频同步翻译与视频配音
★ 1,414+1近 7 天星标变化 - #82
在配备 Apple Silicon 的 Mac 上微调 LLMs。支持 SFT、DPO、GRPO、Vision、TTS、STT、Embedding 与 OCR 微调 —— 基于 MLX 原生实现。兼容 Unsloth API。
★ 1,404+6近 7 天星标变化 - #83
💎 适用于 ASR、TTS 及其他语音技术的无障碍语音语料库列表
★ 1,402+3近 7 天星标变化 - #84
MOSS-TTSD 是一个专为具表现力的多说话人合成而设计的语音对话生成模型。具备长上下文建模、灵活的说话人控制与多语言支持,同时可通过短语音参考实现零样本语音克隆。
★ 1,394+0近 7 天星标变化 - #85
[ICASSP 2024] 🍵 Matcha-TTS:具备条件式流匹配(Conditional Flow Matching)的高效 TTS 架构
★ 1,355+2近 7 天星标变化 - #86
[ICLR 2025] 针对音频语言建模、每秒 40/75 个 token 的 SOTA 离散声学编解码器模型
★ 1,319+2近 7 天星标变化 - #87★ 1,314+0近 7 天星标变化
- #88
StreamSpeech 是一个用于离线与同步语音识别、语音翻译及语音合成的“一体化”无缝模型。
★ 1,289+1近 7 天星标变化 - #89
适用于 Windows、Linux 与 macOS 的无审查本地 AI 工作室。零设置图形界面,支持图像生成、GGUF LLM、文本转语音与语音转文本
★ 1,287+182近 7 天星标变化 - #90
基于 Flow Matching 且支持 Emoji 驱动风格控制的文本转语音模型
★ 1,268+40近 7 天星标变化