speech
标记 speech 主题、收录中的开源项目,按星标数排序。
- #31★ 2,818+0近 7 天星标变化
- #32★ 2,750+0近 7 天星标变化
- #33★ 2,628+0近 7 天星标变化
- #34★ 2,256+0近 7 天星标变化
- #35
支持超过 7000 种语言、可控制且快速的文字转语音!
★ 2,207+0近 7 天星标变化 - #36★ 2,170+0近 7 天星标变化
- #37
免费、高质量的文本转语音 API 端点,可替代 OpenAI、Azure 或 ElevenLabs
★ 2,075+0近 7 天星标变化 - #38
Praat:用电脑进行语音学研究
★ 1,970+0近 7 天星标变化 - #39★ 1,935+0近 7 天星标变化
- #40
从事音频与音乐技术 AI 领域的初创公司社群清单
★ 1,769+0近 7 天星标变化 - #41★ 1,521+0近 7 天星标变化
- #42
通用语音还原
★ 1,375+0近 7 天星标变化 - #43
可控制的转录。逐字(包含每个语气词、停顿、口吃、声音)或意图(说话者想表达的意思,针对可读性优化),并带有单词级别的时间戳。
★ 1,371+0近 7 天星标变化 - #44★ 1,333+0近 7 天星标变化
- #45★ 1,305+0近 7 天星标变化
- #46
StreamSpeech 是一个用于离线与同步语音识别、语音翻译及语音合成的“一体化”无缝模型。
★ 1,288+0近 7 天星标变化 - #47
用于理解深度学习的视频、笔记与实验。
★ 1,198+0近 7 天星标变化 - #48★ 1,149+0近 7 天星标变化
- #49
[非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 实现
★ 1,132+0近 7 天星标变化 - #50★ 1,040+1近 7 天星标变化
- #51
一个由 LLM 驱动的开源基础 TTS 系统
★ 919-1近 7 天星标变化 - #52
基于 CNN 的音频分割工具包。可用于检测语音、音乐、噪音与说话者性别,专为基于各性别说话时间的大规模两性平等研究而设计。
★ 910+0近 7 天星标变化 - #53★ 884-1近 7 天星标变化
- #54★ 881-1近 7 天星标变化
- #55
基于 PaddlePaddle 实现端到端中文语音识别,从入门到实战,超简单的入门案例,超实用的企业项目。支持当前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型
★ 870-1近 7 天星标变化 - #56
在原生环境与浏览器中运行的 Voxtral ASR 与 TTS。使用 Burn ML 框架实现的 Mistral Voxtral mini 实时 ASR / TTS 的 Rust 版本
★ 819+1近 7 天星标变化 - #57
一个基于 LiveKit 构建的实时交互式 Omni Avatar,允许你无缝集成任何开源 Avatar 组件(实时模型、视觉、语音、记忆、搜索等)。
★ 813+2近 7 天星标变化 - #58★ 771+0近 7 天星标变化
- #59★ 756+9近 7 天星标变化
- #60
Allosaurus 是一个预先训练的通用语音识别器,支持超过 2000 种语言
★ 746+4近 7 天星标变化