跳到主要内容
buildradar
登录
主题 · speech-to-text

speech-to-text

标记 speech-to-text 主题、收录中的开源项目,按星标数排序。

共 151 个项目
  • dograh@dograh-hq

    开源语音 AI 平台。自托管替代 Vapi 和 Retell。可本地部署,BYOK,支持 Speech to Speech 或 LLM/STT/TTS,带视觉工作流程构建器,MCP 原生与电话线路支持。

    5,632+0近 7 天星标变化
  • YouDub-webui@liuzhao1225

    开源 AI 视频本地化工具:自动完成 YouTube/Bilibili 视频下载、字幕识别与翻译、语音克隆配音、音轨混合与字幕压缩。

    5,404+0近 7 天星标变化
  • stt@jianchang512

    语音识别转文字工具 / 一个离线运行的本地音视频转字幕工具,输出 json、srt 字幕、纯文字格式

    4,786+0近 7 天星标变化
  • whisper-jax@sanchit-gandhi

    JAX 版 OpenAI Whisper 模型实现,可在 TPU 上提升至 70 倍速度

    4,681+0近 7 天星标变化
  • fastrtc@gradio-app

    Python 用于实时通信的库。

    4,623+0近 7 天星标变化
  • auto-subs@tmoroney

    设备端字幕生成工具,可直接连接 DaVinci Resolve、Premiere 和 After Effects。

    4,176+0近 7 天星标变化
  • 基于 Windows LiveCaptions 的轻量且强大的实时音频/语音翻译工具

    3,686+0近 7 天星标变化
  • openless@Open-Less

    按住快捷键说话,松开即得到经 AI 精炼的文字。开源语音输入,支持 macOS & Windows。

    3,498+0近 7 天星标变化
  • OpenAI Whisper ASR 网络服务 API

    3,334+0近 7 天星标变化
  • 适合不想折腾 Python 的用户的 Whisper 与 Faster-Whisper 独立可执行文件。

    3,176+0近 7 天星标变化
  • LLaMA-Omni@ictnlp

    LLaMA-Omni 是一個基於 Llama-3.1-8B-Instruct 構建的低延遲、高質量端到端語音交互模型,旨在達到 GPT-4o 級別的語音能力。

    3,149+0近 7 天星标变化
  • willow@HeyWillow

    开源、本地、可自托管的 Amazon Echo/Google Home 竞争性语音助手替代品

    3,105+0近 7 天星标变化
  • whishper@pluja

    通过网页 UI 100% 在本地将任何音频转录为文字、翻译并编辑字幕。由 whisper 模型驱动!

    3,071+0近 7 天星标变化
  • lingvo@tensorflow

    Lingvo

    2,864+0近 7 天星标变化
  • whisper-timestamped@linto-ai

    支持词级时间戳和置信度的多语言自动语音识别

    2,844+0近 7 天星标变化
  • openscreen@getopenscreen

    录制屏幕,发布演示。免费且开源、GPU 加速、无水印、无订阅费。支持 Windows、macOS、Linux。持续积极维护中。

    2,779+0近 7 天星标变化
  • vexa@Vexa-ai

    适用于 Google Meet、Microsoft Teams 与 Zoom 的开源会议转录 API。支持自动加入机器人、实时 WebSocket 转录、适用于 AI 代理的 MCP 服务器。可自行托管或使用托管的 SaaS。

    2,775+0近 7 天星标变化
  • FluidAudio@FluidInference

    在你的应用中使用前沿的 CoreML 音频模型——文字转语音、语音转文字、语音活动检测与发言者分离。使用 Swift 开发,由 SOTA 开源技术驱动。

    2,755+0近 7 天星标变化
  • pluely@iamsrikanthnani

    Cluely 的开源替代方案 - 一款极速、注重隐私的 AI 助理,能在会议、面试和对话期间无缝运作且不被察觉。使用 Tauri 构建以获得原生性能,仅 10MB。在视频通话、画面共享和录制中完全无法被检测。

    2,644+0近 7 天星标变化
  • STT@coqui-ai

    🐸STT - 用于语音转文字的深度学习工具包。训练与部署 STT 模型从未如此简单。

    2,607+0近 7 天星标变化
  • audio.cpp@0xShug0

    一款由 ggml 驱动的一体化纯 C++ 音频模型推理引擎。支持 TTS、STT、VAD、语音转换、音乐生成等功能,具备高度优化的性能,无 Python 依赖。

    2,567+0近 7 天星标变化
  • foundry-local@microsoft
    2,547+0近 7 天星标变化
  • awesome-whisper@sindresorhus

    🔊 Whisper 精彩资源列表 — 由 OpenAI 开发的开源 AI 语音识别系统

    2,378+0近 7 天星标变化
  • ququ@yan5xu

    开源免费的 Wispr Flow 替代方案 | 集成 FunASR 本地模型和可配置大语言模型的下一代中文桌面语音工作流

    2,284+0近 7 天星标变化
  • WhisperJAV@meizhong986

    ASR/STT 字幕生成器。使用 Qwen3-ASR、本地 LLM、Whisper、TEN-VAD。针对 JAV 具备抗噪能力

    2,227+0近 7 天星标变化
  • 使用 tensorflow 深度学习框架与 sequence-to-sequence 神经网络的语音识别

    2,172+0近 7 天星标变化
  • soloud@jarikomppa

    免费、简单且可移植的游戏音频引擎

    2,172+0近 7 天星标变化
  • vad@ricky0123

    具备简单 API 的浏览器语音活动检测器(VAD)

    2,050+0近 7 天星标变化
  • transcribe.cpp@handy-computer

    支持 16 种以上模型家族的 ggml 语音转文本推理

    1,908+0近 7 天星标变化
  • audapolis@bugbakery

    具备自动转录功能的语音音频编辑器

    1,893+0近 7 天星标变化
← 返回主题列表