跳到主要内容
buildradar
登录
主题 · speech

speech

标记 speech 主题、收录中的开源项目,按星标数排序。

共 74 个项目
  • MARS5-TTS@Camb-ai

    来自 CAMB.AI 的 MARS5 语音模型 (TTS)

    2,818+0近 7 天星标变化
  • speechgpt@hahahumble

    💬 SpeechGPT 是一个让你与 ChatGPT 对话的网页应用程序。

    2,750+0近 7 天星标变化
  • gTTS@pndurette

    用于对接 Google Translate 文本转语音 API 的 Python 库与 CLI 工具。

    2,628+0近 7 天星标变化
  • ten-vad@TEN-framework

    语音活动检测(VAD):低延迟、高性能且轻量

    2,256+0近 7 天星标变化
  • IMS-Toucan@DigitalPhonetics

    支持超过 7000 种语言、可控制且快速的文字转语音!

    2,207+0近 7 天星标变化
  • soloud@jarikomppa

    免费、简单且可移植的游戏音频引擎

    2,170+0近 7 天星标变化
  • openai-edge-tts@travisvn

    免费、高质量的文本转语音 API 端点,可替代 OpenAI、Azure 或 ElevenLabs

    2,075+0近 7 天星标变化
  • Praat:用电脑进行语音学研究

    1,970+0近 7 天星标变化
  • julius@julius-speech

    开源的大词汇量连续语音识别引擎

    1,935+0近 7 天星标变化
  • 从事音频与音乐技术 AI 领域的初创公司社群清单

    1,769+0近 7 天星标变化
  • SALMONN@bytedance

    SALMONN 系列:一套先进的多模态 LLM

    1,521+0近 7 天星标变化
  • voicefixer@haoheliu

    通用语音还原

    1,375+0近 7 天星标变化
  • CrisperWhisper@nyrahealth

    可控制的转录。逐字(包含每个语气词、停顿、口吃、声音)或意图(说话者想表达的意思,针对可读性优化),并带有单词级别的时间戳。

    1,371+0近 7 天星标变化
  • nlp-paper@DengBoCong

    自然语言处理领域下的相关论文(附阅读笔记),复现模型以及数据处理等(代码含 TensorFlow 和 PyTorch 两版本)

    1,333+0近 7 天星标变化
  • MTools@HG-ha

    MTools 是一个功能强大的多功能桌面应用程序,集成了音视频处理、图片编辑、文本操作和编码工具,内置AI增强功能。旨在简化您的工作流程,提升生产效率

    1,305+0近 7 天星标变化
  • StreamSpeech@ictnlp

    StreamSpeech 是一个用于离线与同步语音识别、语音翻译及语音合成的“一体化”无缝模型。

    1,288+0近 7 天星标变化
  • Deep-Learning-Experiments@roatienza

    用于理解深度学习的视频、笔记与实验。

    1,198+0近 7 天星标变化
  • lhotse@lhotse-speech

    用于在机器学习项目中处理多模态数据的工具。

    1,149+0近 7 天星标变化
  • conformer@sooftware

    [非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 实现

    1,132+0近 7 天星标变化
  • pykaldi@pykaldi

    Kaldi 的 Python 包装器

    1,040+1近 7 天星标变化
  • FireRedTTS@FireRedTeam

    一个由 LLM 驱动的开源基础 TTS 系统

    919-1近 7 天星标变化
  • inaSpeechSegmenter@ina-foss

    基于 CNN 的音频分割工具包。可用于检测语音、音乐、噪音与说话者性别,专为基于各性别说话时间的大规模两性平等研究而设计。

    910+0近 7 天星标变化
  • diffwave@lmnt-com

    DiffWave 是一个快速、高质量的神经声码器与波形合成器。

    884-1近 7 天星标变化
  • AnyGPT@OpenMOSS

    “AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling”的代码

    881-1近 7 天星标变化
  • PPASR@yeyupiaoling

    基于 PaddlePaddle 实现端到端中文语音识别,从入门到实战,超简单的入门案例,超实用的企业项目。支持当前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型

    870-1近 7 天星标变化
  • 在原生环境与浏览器中运行的 Voxtral ASR 与 TTS。使用 Burn ML 框架实现的 Mistral Voxtral mini 实时 ASR / TTS 的 Rust 版本

    819+1近 7 天星标变化
  • AlphaAvatar@AlphaAvatar

    一个基于 LiveKit 构建的实时交互式 Omni Avatar,允许你无缝集成任何开源 Avatar 组件(实时模型、视觉、语音、记忆、搜索等)。

    813+2近 7 天星标变化
  • XR3Player@goxr3plus

    🎧 🎼 最先进的 JavaFX 媒体播放器

    771+0近 7 天星标变化
  • cboard@cboard-org

    为浏览器提供文字转语音功能的辅助与替代沟通(AAC)系统

    756+9近 7 天星标变化
  • allosaurus@xinjli

    Allosaurus 是一个预先训练的通用语音识别器,支持超过 2000 种语言

    746+4近 7 天星标变化
← 返回主题列表