speech-recognition
标记 speech-recognition 主题、收录中的开源项目,按星标数排序。
- #121★ 720+1近 7 天星标变化
- #122★ 718-1近 7 天星标变化
- #123
基于 PyTorch-Lightning 与 Hydra 的端到端语音识别开源工具包。
★ 714+0近 7 天星标变化 - #124★ 711+2近 7 天星标变化
- #125
语音 API 示例。
★ 707-1近 7 天星标变化 - #126
语音转文字性能评测框架
★ 698+1近 7 天星标变化 - #127
使用 OpenAI Whisper 与 TensorFlow Lite 在 Android 上进行离线语音识别
★ 689+1近 7 天星标变化 - #128
INTERSPEECH 2023-2024 论文集:收录 INTERSPEECH 2023-24 会议中具有影响力与精彩的研究论文。探索语音与语言处理的最新进展。内含代码。为此存储库点 Star 以支持语音技术的发展!
★ 684+0近 7 天星标变化 - #129
适用于 React Native Expo 项目的语音识别
★ 678+4近 7 天星标变化 - #130
一个免费的语音数字音频数据集。MNIST 的音频版本。
★ 678+0近 7 天星标变化 - #131
一个 SOTA 工业级一体化 ASR 系统,包含 ASR、VAD、LID 和 Punc 模块。FireRedASR2 支持中文(普通话、20+ 种方言/口音)、英文、中英夹杂(code-switching),以及语音和歌唱的 ASR。FireRedVAD 支持 100+ 种语言的语音/歌唱/音乐。FireRedLID 支持 100+ 种语言和 20+ 种中文方言。FireRedPunc 支持中英文。
★ 677+11近 7 天星标变化 - #132★ 671+0近 7 天星标变化
- #133★ 669+0近 7 天星标变化
- #134★ 648+1近 7 天星标变化
- #135
实时音频翻译,可撷取系统音频与麦克风,执行 ASR (Whisper/SenseVoice),并通过 LLM API 进行翻译与流式显示。适用于 VTuber、直播主与观看外语内容。
★ 642+36近 7 天星标变化 - #136★ 638+0近 7 天星标变化
- #137
基于 Whisper 的 Android 输入法 (IME)
★ 634+4近 7 天星标变化 - #138
用于多语言 ASR 与 TTS 模型的 C++ ggml 运行时中心:包含 Cohere Transcribe、Parakeet TDT、Voxtral、Canary 1B v2 等,并支持通用强制对齐等功能。
★ 619+13近 7 天星标变化 - #139
使用 faster-whisper 进行实时语音转文字。
★ 614+0近 7 天星标变化 - #140
具备字典与语言模型的连接时序分类 (CTC) 解码器。
★ 579-1近 7 天星标变化 - #141
支持多种推理引擎的 Whisper 模型语音转文字优化流水线。
★ 578+0近 7 天星标变化 - #142
您的应用程序自动编码系统 — 用于 React Native 的 Alan AI SDK
★ 575+0近 7 天星标变化 - #143★ 564+0近 7 天星标变化
- #144
🗣 一个在自定义 UI 中获取用户语音权限并将输入转为文本的覆盖界面
★ 557+1近 7 天星标变化 - #145
SpeechIO Leaderboard:一个大型、稳健且全面的自动语音识别基准测试平台。
★ 553+0近 7 天星标变化 - #146
韩语语音识别 STT API 列表及性能基准测试。
★ 547+0近 7 天星标变化 - #147
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 547+13近 7 天星标变化 - #148★ 541+0近 7 天星标变化
- #149★ 529+1近 7 天星标变化
- #150
通过 Vosk 的 WebAssembly 构建,可在浏览器中运行的语音识别库
★ 529+1近 7 天星标变化