跳到主要内容
buildradar
登录
主题 · tts

tts

标记 tts 主题、收录中的开源项目,按星标数排序。

共 191 个项目
  • alexandria-audiobook@Finrandojin

    AI 驱动的多语音有声书生成器 — LLM 脚本注解、语音复制、语音设计、LoRA 训练、逐行风格控制,以及导出为 MP3、分章 M4B 或 Audacity 多轨。基于 Qwen3-TTS 构建。

    1,000+10近 7 天星标变化
  • lobe-vidol@lobehub

    🧸 Lobe Vidol - 让虚拟偶像触手可及

    986+1近 7 天星标变化
  • Step-Audio-EditX@stepfun-ai

    强大的 3B 参数、基于 LLM 的强化学习音频编辑模型,擅长编辑情感、说话风格与副语言学,并具备强大的零样本文本转语音功能

    973+1近 7 天星标变化
  • NISQA@gabrielmittag

    NISQA - 非侵入式语音质量与 TTS 自然度评估

    972+4近 7 天星标变化
  • epub2tts@aedocw

    将 epub 或文本文件转换为有声书

    955-1近 7 天星标变化
  • audio-ai-hub@BinWang28

    语音 AI 研究中枢:涵盖语音 LLM、语音识别、TTS、音乐与语音生成的论文、开源模型、基准测试与数据集。

    953+2近 7 天星标变化
  • 让任何兼容 SAPI 5 的应用程序都能使用 Azure 自然 TTS 语音。

    934+7近 7 天星标变化
  • FireRedTTS@FireRedTeam

    一个由 LLM 驱动的开源基础 TTS 系统

    919-1近 7 天星标变化
  • SmartJavaAI@geekwenjie

    🔥🔥🔥Java免费离线AI算法工具箱,支持人脸识别、活体检测、表情识别、目标检测、实例分割、行人检测、OCR文字识别、车牌识别、表格识别、ASR+TTS、机器翻译等功能,Maven引用即可使用。支持PyTorch、Tensorflow,已集成 Mtcnn、InsightFace、SeetaFace6、YOLOv8~v12、PaddleOCR(PPOCRv5)、Whisper等主流模型

    910+4近 7 天星标变化
  • mosec@mosecorg

    高性能的 ML 模型服务框架,提供动态批处理和 CPU/GPU 流水线以充分发挥算力

    902+0近 7 天星标变化
  • xtts-webui@daswer123

    用于使用 XTTS 及其微调的 Webui

    896+1近 7 天星标变化
  • diffwave@lmnt-com

    DiffWave 是一个快速、高质量的神经声码器与波形合成器。

    884-1近 7 天星标变化
  • pdf-to-podcast@NVIDIA-AI-Blueprints

    将 PDF 转换为 AI 播客,以制作引人入胜的随身音频内容。

    874+0近 7 天星标变化
  • Easy-Voice-Toolkit@Spr-Aachen

    一个用户友好的语音识别、转录、转换等工具箱 | 简单易用的语音工具箱

    873+0近 7 天星标变化
  • bark.cpp@PABannier

    C/C++ 版本的 Suno AI Bark 模型,用于快速文本转语音生成

    868+2近 7 天星标变化
  • esp-ai@wangzongming

    最简单且成本最低的 AI 接入方案。如果你喜欢这个项目,请给它一个 Star~

    856+1近 7 天星标变化
  • SumatraPDF fork: Chinese EPUB/MOBI, smart PDF dark mode, OCR, TTS, offline dictionary.

    830+11近 7 天星标变化
  • Kokoros@lucasjinreal

    🔥🔥 用 Rust 实现的 Kokoro。https://huggingface.co/hexgrad/Kokoro-82M 有史以来速度极快、实时且高质量的 TTS。

    819+4近 7 天星标变化
  • 在原生环境与浏览器中运行的 Voxtral ASR 与 TTS。使用 Burn ML 框架实现的 Mistral Voxtral mini 实时 ASR / TTS 的 Rust 版本

    819+1近 7 天星标变化
  • gitpodcast@BandarLabs

    将任何 git 存储库转换为引人入胜的 podcast

    814-1近 7 天星标变化
  • lobe-tts@lobehub

    🎤 Lobe TTS - 适用于服务器与的高质量且可靠的 TTS/STT 库

    805-1近 7 天星标变化
  • lue@paulilaaso

    具备有声书品质文字转语音功能的终端机电子书阅读器 — 支持 EPUB、PDF、DOCX、HTML、RTF、TXT 与 MD。

    805+1近 7 天星标变化
  • 语音转文字再转语音。歌曲正在播放中。将文本作为 OSC 消息发送至 VRChat 以显示在虚拟化身上。(STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)

    804+5近 7 天星标变化
  • CloneTTS@sipeter

    运行在安卓本地的轻量级文字转语音 (TTS) 引擎,支持离线发音人提取、零门槛音色克隆与双擎系统级全局听书。

    804+5近 7 天星标变化
  • ZerolanLiveRobot@AkagawaTsurunaki

    结合 LLM、ASR、TTS、OCR、CV 等技术的 AI VTuber,可与你直播或游玩 Minecraft。

    803+2近 7 天星标变化
  • Confucius4-TTS@netease-youdao

    Confucius4-TTS:多语言与跨语言 Zero-Shot TTS 引擎

    794+6近 7 天星标变化
  • 无需 ROOT 的开源 Android 屏幕实时翻译工具,适合游戏、视觉小说和漫画。支持端侧与云端 OCR、离线 LLM、多种翻译服务和文字朗读(TTS),译文可直接显示在画面上。

    794+73近 7 天星标变化
  • mlx-audio-swift@Blaizzy

    一个用于在 Apple Silicon 上通过 MLX 进行音频处理的模块化 Swift SDK。

    774+5近 7 天星标变化
  • dla@markovka17

    用于音频处理的深度学习

    762-1近 7 天星标变化
  • vui@fluxions-ai

    实时语音助手 —— WebRTC 流式传输、faster-whisper ASR、本地 LLM、Vui Nano (300M) TTS。兼容 OpenAI Realtime API。支持语音克隆、插话打断,在 4090 上约有 9 倍实时性能。采用 Apache 2.0 许可证。

    759+7近 7 天星标变化
← 返回主题列表