asr
标记 asr 主题、收录中的开源项目,按星标数排序。
- #31
使用新一代 Kaldi 与 ncnn 在无网络连接下进行实时语音识别与语音活动检测(VAD)。支持 iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4A 等。
★ 1,777+0近 7 天星标变化 - #32
百聆 是一个类似 GPT-4o 的语音对话机器人,通过 ASR+LLM+TTS 实现,集成 DeepSeek R1 等优秀大模型,接入 openClaw,真正的个人语音助手,时延低至 800ms,Mac 等低配置也可运行,支持打断
★ 1,759+0近 7 天星标变化 - #33★ 1,622+0近 7 天星标变化
- #34
使用 LLM、计算机视觉和自动语音识别来分析视频。
★ 1,570+0近 7 天星标变化 - #35★ 1,520+0近 7 天星标变化
- #36★ 1,512+0近 7 天星标变化
- #37
🍦 Speech-AI-Forge 是一个围绕 TTS 生成模型开发的项目,实现了 API 服务器与基于 Gradio 的 WebUI。
★ 1,418+0近 7 天星标变化 - #38
视频同步翻译与视频配音
★ 1,413+0近 7 天星标变化 - #39
可控制的转录。逐字(包含每个语气词、停顿、口吃、声音)或意图(说话者想表达的意思,针对可读性优化),并带有单词级别的时间戳。
★ 1,371+0近 7 天星标变化 - #40★ 1,347+0近 7 天星标变化
- #41★ 1,303+0近 7 天星标变化
- #42
StreamSpeech 是一个用于离线与同步语音识别、语音翻译及语音合成的“一体化”无缝模型。
★ 1,288+0近 7 天星标变化 - #43
基于 Vosk 与 Kaldi 库的 WebSocket、gRPC 和 WebRTC 语音识别服务器
★ 1,262+0近 7 天星标变化 - #44
微调 Whisper 语音识别模型,支持无时间戳数据训练、有时间戳数据训练以及无语音数据训练。加速推理并支持 Web 部署、Windows 桌面部署与 Android 部署
★ 1,222+0近 7 天星标变化 - #45
适用于 Apple Silicon 的 AI 语音工具组 — 由 MLX 与 CoreML 驱动的 ASR、TTS、语音转语音、VAD 与说话者分段
★ 1,161+0近 7 天星标变化 - #46
专为真实世界打造的第一个基础 ASR——具备 7 种原子级声学条件、54 种复合场景、260 万个样本,在其他模型纷纷失效的环境下,效能比 SOTA 提升高达约 30%。**当其他模型在实战中失败时,你最后还是会回到 MEGA-ASR。⭐**
★ 1,136+0近 7 天星标变化 - #47
[非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 实现
★ 1,132+0近 7 天星标变化 - #48
SGLang-Omni 为 TTS、ASR、语音与全能模型提供高性能服务。
★ 1,118+56近 7 天星标变化 - #49★ 1,057+6近 7 天星标变化
- #50
使用 Vosk 库为 Android 提供离线语音识别。
★ 1,057+1近 7 天星标变化 - #51★ 1,056+9近 7 天星标变化
- #52★ 1,040+1近 7 天星标变化
- #53★ 1,022+63近 7 天星标变化
- #54★ 985+4近 7 天星标变化
- #55★ 939+0近 7 天星标变化
- #56
VocoType 是一款运行在本地端侧的隐私安全语音输入工具,通过快捷键即可将语音实时转换为文字并自动输入到当前应用。支持语音转文字 MCP、AI 优化文本、自定义替换词典、录音视频转文字等功能,让语音输入更高效、更安全。
★ 930+10近 7 天星标变化 - #57
此项目提供具备用户级访问支持的 API,使用微调并处理过的 Whisper ASR 模型将语音转为文字。
★ 914+0近 7 天星标变化 - #58
🔥🔥🔥Java免费离线AI算法工具箱,支持人脸识别、活体检测、表情识别、目标检测、实例分割、行人检测、OCR文字识别、车牌识别、表格识别、ASR+TTS、机器翻译等功能,Maven引用即可使用。支持PyTorch、Tensorflow,已集成 Mtcnn、InsightFace、SeetaFace6、YOLOv8~v12、PaddleOCR(PPOCRv5)、Whisper等主流模型
★ 910+4近 7 天星标变化 - #59
一个用户友好的语音识别、转录、转换等工具箱 | 简单易用的语音工具箱
★ 873+0近 7 天星标变化 - #60
基于 PaddlePaddle 实现端到端中文语音识别,从入门到实战,超简单的入门案例,超实用的企业项目。支持当前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型
★ 870-1近 7 天星标变化