speech-to-text
标记 speech-to-text 主题、收录中的开源项目,按星标数排序。
- #121
大型语言模型(LLMs)在音频 AI 应用之资源收集
★ 738+0近 7 天星标变化 - #122
Pytorch实现的流式与非流式的自动语音识别框架,同时兼容在线和离线识别,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多种数据增强方法。
★ 727+0近 7 天星标变化 - #123★ 726+4近 7 天星标变化
- #124★ 720+1近 7 天星标变化
- #125★ 718-1近 7 天星标变化
- #126
语音 API 示例。
★ 707-1近 7 天星标变化 - #127
语音转文字性能评测框架
★ 698+1近 7 天星标变化 - #128
一个免费的本地桌面应用程序,可从视频中提取字幕 (SRT) 并将其翻译成任何语言 —— 无限制使用、无需注册、无需云端。
★ 689+19近 7 天星标变化 - #129
适用于 React Native Expo 项目的语音识别
★ 678+4近 7 天星标变化 - #130★ 678+3近 7 天星标变化
- #131★ 671+0近 7 天星标变化
- #132★ 638+0近 7 天星标变化
- #133
建立用于线上监考自动化监控的软体
★ 634-1近 7 天星标变化 - #134
适用于 Apple Silicon Mac 的快速、隐私、本地优先语音应用程序,支持听写、文件/媒体转录、会议录音、转换功能及公开自动化 CLI。免费且开源。
★ 633+14近 7 天星标变化 - #135★ 621+1近 7 天星标变化
- #136
用于多语言 ASR 与 TTS 模型的 C++ ggml 运行时中心:包含 Cohere Transcribe、Parakeet TDT、Voxtral、Canary 1B v2 等,并支持通用强制对齐等功能。
★ 619+13近 7 天星标变化 - #137
使用 faster-whisper 进行实时语音转文字。
★ 614+0近 7 天星标变化 - #138★ 582+4近 7 天星标变化
- #139
使用 Playwright 解决 reCAPTCHA v2 与 v3 的 Python 库。
★ 579+3近 7 天星标变化 - #140
支持多种推理引擎的 Whisper 模型语音转文字优化流水线。
★ 578+0近 7 天星标变化 - #141★ 564+0近 7 天星标变化
- #142
🗣 一个在自定义 UI 中获取用户语音权限并将输入转为文本的覆盖界面
★ 557+1近 7 天星标变化 - #143
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 549+25近 7 天星标变化 - #144
韩语语音识别 STT API 列表及性能基准测试。
★ 547+0近 7 天星标变化 - #145
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 547+13近 7 天星标变化 - #146
通过 Vosk 的 WebAssembly 构建,可在浏览器中运行的语音识别库
★ 529+1近 7 天星标变化 - #147
Phonetisaurus G2P 语音转文字系统。
★ 521-1近 7 天星标变化 - #148
此工具使用 AI 来评估您的发音
★ 518+2近 7 天星标变化 - #149
Open-source AI voice typing for macOS, Windows, and Linux. Press a hotkey, speak naturally, get polished text in any app.
★ 516—近 7 天星标变化 - #150
开源音频与视频转录软件。
★ 515+0近 7 天星标变化