voice-cloning
标记 voice-cloning 主题、收录中的开源项目,按星标数排序。
- #31
强大的 3B 参数、基于 LLM 的强化学习音频编辑模型,擅长编辑情感、说话风格与副语言学,并具备强大的零样本文本转语音功能
★ 974+1近 7 天星标变化 - #32★ 807+5近 7 天星标变化
- #33
实时语音助手 —— WebRTC 流式传输、faster-whisper ASR、本地 LLM、Vui Nano (300M) TTS。兼容 OpenAI Realtime API。支持语音克隆、插话打断,在 4090 上约有 9 倍实时性能。采用 Apache 2.0 许可证。
★ 760+7近 7 天星标变化 - #34
MimikaStudio - 适用于 macOS (Apple Silicon) 的本地优先应用程序 + 支持 Agentic MCP
★ 736+4近 7 天星标变化 - #35
使用 Chatterbox 的本地、兼容 OpenAI 的文本转语音 (TTS) API,让用户能在任何使用 OpenAI API 的地方生成语音克隆内容(例如 Open WebUI、AnythingLLM 等)
★ 677+1近 7 天星标变化 - #36
将 PDF 与 EPUB 转为有声书;将字幕或视频转为配音视频(包含翻译)等等。完全免费。Pandrator 使用本机模型,包含语音复制(即时、RVC 强化、XTTS 微调)与 LLM 处理。期许成为一个具备图形界面、安装程序与一体化套件的使用者友善应用程序。
★ 622+3近 7 天星标变化 - #37
YouDub 是一个开源工具,旨在自动化地将优质的 YouTube 视频进行翻译和配音,以便将其搬运到中文互联网上。该工具使用了 AI 语音识别技术将音频转换为文本,然后通过大语言模型将文本翻译成中文,最后通过 AI 声音克隆技术将中文转换为音频。这样,我们就可以创建出具有原始 YouTuber 音色的中文配音视频。
★ 615-1近 7 天星标变化 - #38
用于 VibeVoice TTS 的 ComfyUI 自定义节点。具备表现力、长文本、多说话人对话语音功能
★ 596-1近 7 天星标变化 - #39
Chatterbox 的修改版本,支持文本文件输入且无字符限制。我用它来制作有声书,特别是给孩子们听的。
★ 575-1近 7 天星标变化 - #40
在 Mac (M1/M2/M3/M4) 上本地运行 Qwen3-TTS 文字转语音。支持语音克隆、语音设计与自定义语音,使用 MLX 实现 100% 离线运行
★ 561+2近 7 天星标变化 - #41
全球首款具备个性化语音克隆功能的开源实时端到端语音对话模型。
★ 550+1近 7 天星标变化 - #42
ComfyUI 的 OmniVoice TTS 节点 - 支持语音克隆、语音设计与多说话人对话的零样本多语言文字转语音技术
★ 547+6近 7 天星标变化 - #43
用于高表现力语音与真实零样本语音复制的 ComfyUI 节点
★ 509+0近 7 天星标变化