跳到主要内容
buildradar
登录
主题 · text-to-speech

text-to-speech

标记 text-to-speech 主题、收录中的开源项目,按星标数排序。

共 151 个项目
  • Irodori-TTS@Aratako

    基于 Flow Matching 且支持 Emoji 驱动风格控制的文本转语音模型

    1,268+0近 7 天星标变化
  • audio-webui@gitmylo

    一个用于各种音频相关神经网络的 WebUI

    1,245+0近 7 天星标变化
  • TTS-Audio-Suite@diodiogod

    一个 ComfyUI 自定义节点集成套件,用于本地多引擎、多语言文本转语音与语音转换。支持:RVC、Echo-TTS、Qwen3-TTS、Cozy Voice 3、Step Audio EditX、IndexTTS-2、Chatterbox(经典与多语言)、F5-TTS、Higgs Audio 2、3 与 VibeVoice,具备无限文本长度、SRT 计时、角色支持及多种音频工具

    1,199+0近 7 天星标变化
  • 使用 Apple Foundation Models 框架构建、测试与评估应用程序的实作实验室。

    1,179+0近 7 天星标变化
  • dia2@nari-labs

    能够实时流式传输对话语音的 TTS 模型。

    1,176+0近 7 天星标变化
  • speech-swift@soniqo

    适用于 Apple Silicon 的 AI 语音工具组 — 由 MLX 与 CoreML 驱动的 ASR、TTS、语音转语音、VAD 与说话者分段

    1,172+0近 7 天星标变化
  • sglang-omni@sgl-project

    SGLang-Omni 为 TTS、ASR、语音与全能模型提供高性能服务。

    1,159+56近 7 天星标变化
  • 应用程序的自我编码系统 — 适用于 Cordova 的 Alan AI SDK

    1,132+0近 7 天星标变化
  • Patter@PatterAI

    开源语音 AI SDK。专为想掌控技术栈的开发者打造的 Vapi/Retell 替代方案。只需 4 行代码就能赋予 AI 代理电话号码——支持 Python 与 TypeScript,采用 MIT 授权,整合 Twilio、Telnyx 与 Plivo。

    1,052+7近 7 天星标变化
  • Cognitive-Speech-TTS@Azure-Samples

    微软语音合成 (Text-to-Speech) API 多语言示例代码,属于 Cognitive Services 的一部分。

    1,014+1近 7 天星标变化
  • alexandria-audiobook@Finrandojin

    AI 驱动的多语音有声书生成器 — LLM 脚本注解、语音复制、语音设计、LoRA 训练、逐行风格控制,以及导出为 MP3、分章 M4B 或 Audacity 多轨。基于 Qwen3-TTS 构建。

    1,003+10近 7 天星标变化
  • NISQA@gabrielmittag

    NISQA - 非侵入式语音质量与 TTS 自然度评估

    974+4近 7 天星标变化
  • Step-Audio-EditX@stepfun-ai

    强大的 3B 参数、基于 LLM 的强化学习音频编辑模型,擅长编辑情感、说话风格与副语言学,并具备强大的零样本文本转语音功能

    974+1近 7 天星标变化
  • botium-speech-processing@codeforequity-at

    Botium 语音处理

    943+0近 7 天星标变化
  • 让任何兼容 SAPI 5 的应用程序都能使用 Azure 自然 TTS 语音。

    936+7近 7 天星标变化
  • 适用于 PHP 的 Vonage REST API 客户端。支持 SMS、语音、文字转语音、号码、验证 (2FA) 等 API。

    931-1近 7 天星标变化
  • FireRedTTS@FireRedTeam

    一个由 LLM 驱动的开源基础 TTS 系统

    919-1近 7 天星标变化
  • EDDiscovery@EDDiscovery

    Elite Dangerous 的船长日志与 3D 星图

    900+4近 7 天星标变化
  • diffwave@lmnt-com

    DiffWave 是一个快速、高质量的神经声码器与波形合成器。

    884-1近 7 天星标变化
  • bark.cpp@PABannier

    C/C++ 版本的 Suno AI Bark 模型,用于快速文本转语音生成

    868+2近 7 天星标变化
  • 无需 ROOT 的开源 Android 屏幕实时翻译工具,适合游戏、视觉小说和漫画。支持端侧与云端 OCR、离线 LLM、多种翻译服务和文字朗读(TTS),译文可直接显示在画面上。

    809+73近 7 天星标变化
  • CloneTTS@sipeter

    运行在安卓本地的轻量级文字转语音 (TTS) 引擎,支持离线发音人提取、零门槛音色克隆与双擎系统级全局听书。

    807+5近 7 天星标变化
  • lue@paulilaaso

    具备有声书品质文字转语音功能的终端机电子书阅读器 — 支持 EPUB、PDF、DOCX、HTML、RTF、TXT 与 MD。

    806+1近 7 天星标变化
  • 语音转文字再转语音。歌曲正在播放中。将文本作为 OSC 消息发送至 VRChat 以显示在虚拟化身上。(STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)

    805+5近 7 天星标变化
  • lobe-tts@lobehub

    🎤 Lobe TTS - 适用于服务器与的高质量且可靠的 TTS/STT 库

    805-1近 7 天星标变化
  • ai-video-editor@MartinDelophy

    开源、优先本地端的视频编辑器,创作者与 AI 代理可编辑同一个真实时间轴

    803+82近 7 天星标变化
  • Confucius4-TTS@netease-youdao

    Confucius4-TTS:多语言与跨语言 Zero-Shot TTS 引擎

    793+6近 7 天星标变化
  • june@mezbaul-h

    用于引人入胜对话的本地语音聊天机器人,由 Ollama、Hugging Face Transformers 与 Coqui TTS Toolkit 提供支持

    788+1近 7 天星标变化
  • mlx-audio-swift@Blaizzy

    一个用于在 Apple Silicon 上通过 MLX 进行音频处理的模块化 Swift SDK。

    774+5近 7 天星标变化
  • vui@fluxions-ai

    实时语音助手 —— WebRTC 流式传输、faster-whisper ASR、本地 LLM、Vui Nano (300M) TTS。兼容 OpenAI Realtime API。支持语音克隆、插话打断,在 4090 上约有 9 倍实时性能。采用 Apache 2.0 许可证。

    760+7近 7 天星标变化
← 返回主题列表