speech-to-text
标记 speech-to-text 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 speech-to-text 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 speech-to-text 主题的项目。
- #1★ 2,128
- #2
适用于 Windows、Linux 与 macOS 的无审查本地 AI 工作室。零设置图形界面,支持图像生成、GGUF LLM、文本转语音与语音转文本
★ 1,048 - #3
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 531 - #4
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 494 - #5
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 449
- #1
OpenAI Whisper 模型的 C/C++ 移植版
★ 53,286+193近 7 天星标变化 - #2★ 30,636+554近 7 天星标变化
- #3
以隐私为先的 AI 会议助理,具 4 倍更快的 Parakeet/Whisper 实时转录、说话者分离与基于 Rust 的 Ollama 摘要,100% 本地处理,无需云端。Meetily(Meetly Ai)是 macOS 与 Windows 上首屈一指的自托管、开源 AI 会议笔记工具。了解如何编写会议纪要
★ 30,057+325近 7 天星标变化 - #4★ 25,746+78近 7 天星标变化
- #5
使用 CTranslate2 的 Faster Whisper 转录
★ 25,135+108近 7 天星标变化 - #6★ 23,803+117近 7 天星标变化
- #7
YC (S26) | 开放电脑历史 | 本地持续录制屏幕并为您的代理(Claude、Codex、Openclaw、Hermes、Runner…)提供上下文信息
★ 21,296+133近 7 天星标变化 - #8★ 20,072+108近 7 天星标变化
- #9
将视频从一种语言翻译成另一种语言,并嵌入配音与字幕。
★ 18,833+65近 7 天星标变化 - #10★ 17,475+22近 7 天星标变化
- #11★ 15,471+7近 7 天星标变化
- #12★ 15,084+17近 7 天星标变化
- #13
使用次世代 Kaldi 与 onnxruntime 的语音转文字、文字转语音、说话者分离、语音增强、声源分离与 VAD,支持离线运行。支持嵌入式系统、Android、iOS、HarmonyOS、Raspberry Pi、RISC‑V、RK NPU、Axera NPU、Ascend NPU、x86_64 服务器、WebSocket 服务器/客户端,支持 12 种编程语言
★ 14,480+169近 7 天星标变化 - #14
使用开源模型构建语音代理
★ 12,933+180近 7 天星标变化 - #15
Gradio WebUI 为创作者与开发者提供关键 TTS(Edge‑TTS、kokoro)与零样本语音克隆(E2 & F5‑TTS、CosyVoice),并支持 Whisper 音频处理、YouTube 下载、Demucs 人声分离与多语言翻译
★ 12,676+100近 7 天星标变化 - #16
VoiceStudio 是开源、完全本地化的 ElevenLabs 替代方案——支持 646 种语言的语音克隆、语音设计、视频配音、口述、转录与有声书制作。
★ 11,955+853近 7 天星标变化 - #17
基于 PyTorch 的语音工具包
★ 11,792+22近 7 天星标变化 - #18
实时、本地语音转文字,支持流式 ASR、说话者分离、翻译,并兼容 OpenAI/Deepgram API。
★ 10,974+75近 7 天星标变化 - #19
具备先进语音活动检测、唤醒词激活和即时转录功能的高效、低延迟语音转文字库
★ 10,090+20近 7 天星标变化 - #20
开源 SenseVoiceSmall 模型,支持普通话、粤语、英语、日语和韩语的语音识别、语言识别、情绪识别和音频事件检测。
★ 9,172+51近 7 天星标变化 - #21
支持多种引擎与 API 的 Python 语音识别模块,支持在线与离线模式
★ 8,987+2近 7 天星标变化 - #22
基于深度学习的中文语音识别系统
★ 8,386+5近 7 天星标变化 - #23★ 7,803+31近 7 天星标变化
- #24★ 6,816+1近 7 天星标变化
- #25
Apple Silicon 上的本机语音 AI
★ 6,345+11近 7 天星标变化 - #26★ 6,197+25近 7 天星标变化
- #27
Silero 模型:让预训练文字转语音模型变得极度简单
★ 6,085+11近 7 天星标变化 - #28
具备本地(Nvidia Parakeet/Whisper)与云端模型(BYOK)的语音转文字应用程序,注重隐私,跨平台可用
★ 5,828+193近 7 天星标变化 - #29
基于 OpenAI Whisper 的自动语音识别与说话者分离
★ 5,633+7近 7 天星标变化 - #30
开源语音 AI 平台。自托管替代 Vapi 和 Retell。可本地部署,BYOK,支持 Speech to Speech 或 LLM/STT/TTS,带视觉工作流程构建器,MCP 原生与电话线路支持。
★ 5,523+64近 7 天星标变化