speech-recognition
标记 speech-recognition 主题、收录中的开源项目,按星标数排序。
- #91
语音 AI 研究中枢:涵盖语音 LLM、语音识别、TTS、音乐与语音生成的论文、开源模型、基准测试与数据集。
★ 953+2近 7 天星标变化 - #92
开箱即用的自托管离线转录与说话人日志服务,并附带 LLM 摘要
★ 948+1近 7 天星标变化 - #93
Whisper.net。使用 Whisper Models 轻松实现语音转文字
★ 942+1近 7 天星标变化 - #94★ 939+0近 7 天星标变化
- #95
一个基于 Python 的桌面语音助手,能够执行系统级指令、整合语音识别与文字转语音,并处理异步的用户互动。
★ 921+11近 7 天星标变化 - #96
针对流式传输与设备端使用优化的 Whisper 模型
★ 897-1近 7 天星标变化 - #97
一个无需互联网即可在你自己的计算机上运行的会说话的 LLM。
★ 891+1近 7 天星标变化 - #98★ 883+0近 7 天星标变化
- #99
基于 PaddlePaddle 实现端到端中文语音识别,从入门到实战,超简单的入门案例,超实用的企业项目。支持当前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型
★ 869-1近 7 天星标变化 - #100
为你的 React 应用加入语音识别功能💬
★ 842+0近 7 天星标变化 - #101
Connectionist Temporal Classification (CTC) 解码算法:最佳路径、Beam Search、词典搜索、前缀搜索与 Token Passing。以 Python 实现。
★ 836-1近 7 天星标变化 - #102
使用 OpenAI 的 Whisper 建立实时语音转文字网页应用程序 https://openai.com/blog/whisper/
★ 835+0近 7 天星标变化 - #103★ 823-1近 7 天星标变化
- #104
适用于 Linux 的免费、开源、100% 离线语音听写工具。通过 whisper.cpp、Whisper 与 VOSK 引擎支持随处语音输入,具备 GPU 加速,支持 X11 与 Wayland!
★ 816+17近 7 天星标变化 - #105★ 805-1近 7 天星标变化
- #106
语音转文字再转语音。歌曲正在播放中。将文本作为 OSC 消息发送至 VRChat 以显示在虚拟化身上。(STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 805+5近 7 天星标变化 - #107
whisper.cpp 的 React Native 绑定。
★ 802+2近 7 天星标变化 - #108★ 798+13近 7 天星标变化
- #109★ 788+1近 7 天星标变化
- #110
允许使用者搭配 OpenAI whisper 使用麦克风的项目。
★ 787+0近 7 天星标变化 - #111
🎤 在 Swift 中进行语音转文字的最简单方法
★ 785+0近 7 天星标变化 - #112
一个 100% 私密的 AI 语音转文字应用程序,支持 100 多种语言的语音转文字。使用 Compose Multiplatform 为 Android 和 iOS 开发,并基于 Whisper AI —— 无需上传云端,所有处理皆在设备端完成,确保完整隐私。
★ 782+4近 7 天星标变化 - #113★ 767+1近 7 天星标变化
- #114★ 763-1近 7 天星标变化
- #115
基于 PaddlePaddle 实现的语音识别,中文语音识别。项目完善,识别效果佳。支持 Windows、Linux 下训练与预测,并支持 Nvidia Jetson 开发板预测。
★ 763+1近 7 天星标变化 - #116★ 755+1近 7 天星标变化
- #117
在本地机器的 Unity3d 中运行语音转文字模型 (whisper.cpp)。
★ 751+1近 7 天星标变化 - #118
Allosaurus 是一个预先训练的通用语音识别器,支持超过 2000 种语言
★ 746+4近 7 天星标变化 - #119
适用于 Android 的隐私且端侧的语音识别键盘与服务。
★ 745+2近 7 天星标变化 - #120
Pytorch实现的流式与非流式的自动语音识别框架,同时兼容在线和离线识别,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多种数据增强方法。
★ 727+0近 7 天星标变化