跳到主要内容
buildradar
登录
主题 · text-to-speech

text-to-speech

标记 text-to-speech 主题、收录中的开源项目,按星标数排序。

共 150 个项目
  • RHVoice@RHVoice

    一个用于俄语和其他语言的免费开源语音合成器

    1,837+1近 7 天星标变化
  • 为你的应用程序打造的自我编码系统 — 适用于 Android 的 Alan AI SDK

    1,807+0近 7 天星标变化
  • Genie-TTS@High-Logic

    GPT-SoVITS ONNX 推理引擎与模型转换器

    1,774+14近 7 天星标变化
  • 应用程序的自我编码系统 — 用于 Flutter 的 Alan AI SDK

    1,756+0近 7 天星标变化
  • 根据字幕文件自动翻译视频文本,然后使用 AI 语音服务创建新的配音与翻译音轨,并使用字幕的时间轴来同步语音。

    1,746+0近 7 天星标变化
  • read-aloud@ken107

    一个可以一键朗读网页内容的超棒浏览器扩展

    1,742+5近 7 天星标变化
  • react-native-executorch@software-mansion

    借助 ExecuTorch 在 React Native 设备端以声明式方式运行 AI 模型。

    1,730+23近 7 天星标变化
  • alan-sdk-ionic@alan-ai

    应用程序的自我编码系统 — 适用于 Ionic 的 Alan AI SDK

    1,649+0近 7 天星标变化
  • ParallelWaveGAN@kan-bayashi

    使用 PyTorch 的非官方 Parallel WaveGAN(含 MelGAN、Multi-band MelGAN、HiFi-GAN 与 StyleMelGAN)

    1,645-1近 7 天星标变化
  • dsnote@mkiol

    Speech Note Linux 应用程序。具备离线语音转文字、文字转语音以及机器翻译的笔记、阅读与翻译功能。

    1,633+11近 7 天星标变化
  • video-podcast-maker@Agents365-ai

    主题 → 适用于 Coding Agent 的 4K 旁白视频。v4.0:所有 TTS 均通过 ttsCN 引擎组件(包含 MiniMax 声音克隆等 11 个平台、原生词级字幕同步)、基于 manifest 的资产引擎、Remotion 合成、成本受控的 AI 生成

    1,608+9近 7 天星标变化
  • soprano@ekwek1

    Soprano:即时、超逼真的文字转语音

    1,584+36近 7 天星标变化
  • MiniMax-MCP@MiniMax-AI

    官方 MiniMax Model Context Protocol (MCP) 服务器,可与强大的文本转语音、图像生成和视频生成 API 进行交互。

    1,579+6近 7 天星标变化
  • vllm-mlx@waybarrios

    针对 Apple Silicon 的高性能 OpenAI 与 Anthropic 兼容 LLM 推理服务器。原生支持 MLX、连续批处理、多模态模型、MCP 工具调用以及 Claude Code。

    1,568+11近 7 天星标变化
  • VibeVoice-ComfyUI@Enemyx-net

    适用于 Microsoft VibeVoice 文本转语音模型的完整 ComfyUI 集成,让您能在 ComfyUI 工作流程中直接进行高质量的单人与多人语音合成。

    1,560+5近 7 天星标变化
  • TalkingHead@met4citizen

    会说话的头像 (3D):使用全身 3D 头像进行实时对嘴的 JavaScript 类。

    1,544+22近 7 天星标变化
  • 自架强大的 Chatterbox TTS 模型。此服务器提供用户友好的 Web UI、灵活的 API 端点(包含兼容 OpenAI)、预定义语音、语音克隆,以及大型有声书规模的文本处理。可在 NVIDIA (CUDA)、AMD (ROCm) 和 CPU 上加速运行。

    1,440+13近 7 天星标变化
  • OuteTTS@edwko

    OuteTTS 模型的介面。

    1,439+2近 7 天星标变化
  • Voice-Cloning-App@voice-cloning-app

    用于轻松合成人声的 Python/PyTorch 应用程序

    1,437-3近 7 天星标变化
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge 是一个围绕 TTS 生成模型开发的项目,实现了 API 服务器与基于 Gradio 的 WebUI。

    1,420+2近 7 天星标变化
  • SoniTranslate@R3gm

    视频同步翻译与视频配音

    1,414+1近 7 天星标变化
  • mlx-tune@ARahim3

    在配备 Apple Silicon 的 Mac 上微调 LLMs。支持 SFT、DPO、GRPO、Vision、TTS、STT、Embedding 与 OCR 微调 —— 基于 MLX 原生实现。兼容 Unsloth API。

    1,404+6近 7 天星标变化
  • 💎 适用于 ASR、TTS 及其他语音技术的无障碍语音语料库列表

    1,402+3近 7 天星标变化
  • MOSS-TTSD@OpenMOSS

    MOSS-TTSD 是一个专为具表现力的多说话人合成而设计的语音对话生成模型。具备长上下文建模、灵活的说话人控制与多语言支持,同时可通过短语音参考实现零样本语音克隆。

    1,394+0近 7 天星标变化
  • Matcha-TTS@shivammehta25

    [ICASSP 2024] 🍵 Matcha-TTS:具备条件式流匹配(Conditional Flow Matching)的高效 TTS 架构

    1,355+2近 7 天星标变化
  • WavTokenizer@jishengpeng

    [ICLR 2025] 针对音频语言建模、每秒 40/75 个 token 的 SOTA 离散声学编解码器模型

    1,319+2近 7 天星标变化
  • airunner@Capsize-Games

    用于艺术、实时语音对话、LLM 驱动的聊天机器人与自动化工作流程的离线推理引擎

    1,314+0近 7 天星标变化
  • StreamSpeech@ictnlp

    StreamSpeech 是一个用于离线与同步语音识别、语音翻译及语音合成的“一体化”无缝模型。

    1,289+1近 7 天星标变化
  • Uncensored-Local-Studio@techjarves

    适用于 Windows、Linux 与 macOS 的无审查本地 AI 工作室。零设置图形界面,支持图像生成、GGUF LLM、文本转语音与语音转文本

    1,287+182近 7 天星标变化
  • Irodori-TTS@Aratako

    基于 Flow Matching 且支持 Emoji 驱动风格控制的文本转语音模型

    1,268+40近 7 天星标变化
← 返回主题列表