speech-to-text
标记 speech-to-text 主题、收录中的开源项目,按星标数排序。
- #91
⚡ TensorFlowASR:Tensorflow 2 中几乎达 SOTA 的自动语音识别。支持使用字符或子字的语言
★ 1,010+0近 7 天星标变化 - #92★ 1,008-1近 7 天星标变化
- #93
Whisper-Flow 是一个旨在利用 OpenAI 的 Whisper 模型实现音频内容实时转录的框架。Whisper-Flow 不会在上传后处理整个文件(“批处理模式”),而是接收连续的音频片段流并立即产生渐进式的转录文本。
★ 968+25近 7 天星标变化 - #94
使用自托管 Whisper 与 WebSocket 在 Python/JS 中实现近即时音频转录。
★ 960+0近 7 天星标变化 - #95
Botium 语音处理
★ 943+0近 7 天星标变化 - #96
Whisper.net。使用 Whisper Models 轻松实现语音转文字
★ 942+1近 7 天星标变化 - #97★ 927+2近 7 天星标变化
- #98
.NET MAUI 示例集
★ 915+0近 7 天星标变化 - #99★ 911+2近 7 天星标变化
- #100
针对流式传输与设备端使用优化的 Whisper 模型
★ 897-1近 7 天星标变化 - #101★ 896+4近 7 天星标变化
- #102
基于 PaddlePaddle 实现端到端中文语音识别,从入门到实战,超简单的入门案例,超实用的企业项目。支持当前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型
★ 869-1近 7 天星标变化 - #103
为你的 React 应用加入语音识别功能💬
★ 842+0近 7 天星标变化 - #104
使用 OpenAI 的 Whisper 建立实时语音转文字网页应用程序 https://openai.com/blog/whisper/
★ 835+0近 7 天星标变化 - #105★ 823-1近 7 天星标变化
- #106
适用于 Linux 的免费、开源、100% 离线语音听写工具。通过 whisper.cpp、Whisper 与 VOSK 引擎支持随处语音输入,具备 GPU 加速,支持 X11 与 Wayland!
★ 816+17近 7 天星标变化 - #107★ 811+3近 7 天星标变化
- #108
语音转文字再转语音。歌曲正在播放中。将文本作为 OSC 消息发送至 VRChat 以显示在虚拟化身上。(STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 805+5近 7 天星标变化 - #109★ 805-1近 7 天星标变化
- #110★ 788+1近 7 天星标变化
- #111
允许使用者搭配 OpenAI whisper 使用麦克风的项目。
★ 787+0近 7 天星标变化 - #112
🎤 在 Swift 中进行语音转文字的最简单方法
★ 785+0近 7 天星标变化 - #113
一个 100% 私密的 AI 语音转文字应用程序,支持 100 多种语言的语音转文字。使用 Compose Multiplatform 为 Android 和 iOS 开发,并基于 Whisper AI —— 无需上传云端,所有处理皆在设备端完成,确保完整隐私。
★ 782+4近 7 天星标变化 - #114
说点啥(BiBi Keyboard):一个基于 Kotlin 的 Android 平台 LLM 与 ASR 语音输入法键盘应用程序
★ 778+15近 7 天星标变化 - #115
一个用于在 Apple Silicon 上通过 MLX 进行音频处理的模块化 Swift SDK。
★ 774+5近 7 天星标变化 - #116
基于 PaddlePaddle 实现的语音识别,中文语音识别。项目完善,识别效果佳。支持 Windows、Linux 下训练与预测,并支持 Nvidia Jetson 开发板预测。
★ 763+1近 7 天星标变化 - #117★ 755+1近 7 天星标变化
- #118
在本地机器的 Unity3d 中运行语音转文字模型 (whisper.cpp)。
★ 751+1近 7 天星标变化 - #119
适用于 Android 的隐私且端侧的语音识别键盘与服务。
★ 745+2近 7 天星标变化 - #120
大型语言模型(LLMs)在音频 AI 应用之资源收集
★ 738+0近 7 天星标变化