speech-to-text
标记 speech-to-text 主题、收录中的开源项目,按星标数排序。
- #31
开源语音 AI 平台。自托管替代 Vapi 和 Retell。可本地部署,BYOK,支持 Speech to Speech 或 LLM/STT/TTS,带视觉工作流程构建器,MCP 原生与电话线路支持。
★ 5,632+0近 7 天星标变化 - #32
开源 AI 视频本地化工具:自动完成 YouTube/Bilibili 视频下载、字幕识别与翻译、语音克隆配音、音轨混合与字幕压缩。
★ 5,404+0近 7 天星标变化 - #33★ 4,786+0近 7 天星标变化
- #34
JAX 版 OpenAI Whisper 模型实现,可在 TPU 上提升至 70 倍速度
★ 4,681+0近 7 天星标变化 - #35★ 4,623+0近 7 天星标变化
- #36★ 4,176+0近 7 天星标变化
- #37
基于 Windows LiveCaptions 的轻量且强大的实时音频/语音翻译工具
★ 3,686+0近 7 天星标变化 - #38★ 3,498+0近 7 天星标变化
- #39
OpenAI Whisper ASR 网络服务 API
★ 3,334+0近 7 天星标变化 - #40
适合不想折腾 Python 的用户的 Whisper 与 Faster-Whisper 独立可执行文件。
★ 3,176+0近 7 天星标变化 - #41
LLaMA-Omni 是一個基於 Llama-3.1-8B-Instruct 構建的低延遲、高質量端到端語音交互模型,旨在達到 GPT-4o 級別的語音能力。
★ 3,149+0近 7 天星标变化 - #42★ 3,105+0近 7 天星标变化
- #43★ 3,071+0近 7 天星标变化
- #44★ 2,864+0近 7 天星标变化
- #45
支持词级时间戳和置信度的多语言自动语音识别
★ 2,844+0近 7 天星标变化 - #46
录制屏幕,发布演示。免费且开源、GPU 加速、无水印、无订阅费。支持 Windows、macOS、Linux。持续积极维护中。
★ 2,779+0近 7 天星标变化 - #47
适用于 Google Meet、Microsoft Teams 与 Zoom 的开源会议转录 API。支持自动加入机器人、实时 WebSocket 转录、适用于 AI 代理的 MCP 服务器。可自行托管或使用托管的 SaaS。
★ 2,775+0近 7 天星标变化 - #48
在你的应用中使用前沿的 CoreML 音频模型——文字转语音、语音转文字、语音活动检测与发言者分离。使用 Swift 开发,由 SOTA 开源技术驱动。
★ 2,755+0近 7 天星标变化 - #49
Cluely 的开源替代方案 - 一款极速、注重隐私的 AI 助理,能在会议、面试和对话期间无缝运作且不被察觉。使用 Tauri 构建以获得原生性能,仅 10MB。在视频通话、画面共享和录制中完全无法被检测。
★ 2,644+0近 7 天星标变化 - #50★ 2,607+0近 7 天星标变化
- #51★ 2,567+0近 7 天星标变化
- #52★ 2,547+0近 7 天星标变化
- #53
🔊 Whisper 精彩资源列表 — 由 OpenAI 开发的开源 AI 语音识别系统
★ 2,378+0近 7 天星标变化 - #54★ 2,284+0近 7 天星标变化
- #55
ASR/STT 字幕生成器。使用 Qwen3-ASR、本地 LLM、Whisper、TEN-VAD。针对 JAV 具备抗噪能力
★ 2,227+0近 7 天星标变化 - #56
使用 tensorflow 深度学习框架与 sequence-to-sequence 神经网络的语音识别
★ 2,172+0近 7 天星标变化 - #57★ 2,172+0近 7 天星标变化
- #58★ 2,050+0近 7 天星标变化
- #59
支持 16 种以上模型家族的 ggml 语音转文本推理
★ 1,908+0近 7 天星标变化 - #60★ 1,893+0近 7 天星标变化