跳到主要內容
buildradar
登入
主題 · speech-to-text

speech-to-text

標記 speech-to-text 主題、收錄中的開源專案,依星數排序。

共 152 個專案
  • dograh@dograh-hq

    開源語音 AI 平台。自託管替代 Vapi 和 Retell。可本地部署,BYOK,支援 Speech to Speech 或 LLM/STT/TTS,帶視覺工作流程建構器,MCP 原生與電話線路支援。

    5,568+0近 7 天星數變化
  • YouDub-webui@liuzhao1225

    開源 AI 視頻本地化工具:自動完成 YouTube/Bilibili 視頻下載、字幕識別與翻譯、語音克隆配音、音軌混合與字幕壓縮。

    5,404+0近 7 天星數變化
  • stt@jianchang512

    語音辨識轉文字工具 / 一個離線運行的本地音視頻轉字幕工具,輸出 json、srt 字幕、純文字格式

    4,780+0近 7 天星數變化
  • whisper-jax@sanchit-gandhi

    JAX 版 OpenAI Whisper 模型實作,可在 TPU 上提升至 70 倍速度

    4,679+0近 7 天星數變化
  • fastrtc@gradio-app

    Python 用於實時通信的庫。

    4,624+0近 7 天星數變化
  • auto-subs@tmoroney

    裝置端字幕生成工具,可直接連結 DaVinci Resolve、Premiere 與 After Effects。

    4,122+0近 7 天星數變化
  • 基於 Windows LiveCaptions 的輕量且強大的實時音訊/語音翻譯工具

    3,637+0近 7 天星數變化
  • openless@Open-Less

    按住快捷鍵說話,松開即得到經 AI 精煉的文字。開源語音輸入,支援 macOS & Windows。

    3,403+0近 7 天星數變化
  • OpenAI Whisper ASR 網路服務 API

    3,328+0近 7 天星數變化
  • 適合不想折騰 Python 的使用者的 Whisper 與 Faster-Whisper 獨立執行檔。

    3,171+0近 7 天星數變化
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni 是一個基於 Llama-3.1-8B-Instruct 構建的低延遲、高品質端到端語音互動模型,旨在達到 GPT-4o 級別的語音能力。

    3,147+0近 7 天星數變化
  • willow@HeyWillow

    開源、本地、可自託管的 Amazon Echo/Google Home 競爭性語音助手替代品

    3,101+0近 7 天星數變化
  • whishper@pluja

    透過網頁 UI 100% 在本地將任何音訊轉錄為文字、翻譯並編輯字幕。由 whisper 模型驅動!

    3,068+0近 7 天星數變化
  • lingvo@tensorflow

    Lingvo

    2,864+0近 7 天星數變化
  • whisper-timestamped@linto-ai

    支援字詞級時間戳記與信心度的多語言自動語音辨識

    2,842+0近 7 天星數變化
  • vexa@Vexa-ai

    適用於 Google Meet、Microsoft Teams 與 Zoom 的開源會議逐字稿 API。支援自動加入機器人、即時 WebSocket 逐字稿、適用於 AI 代理的 MCP 伺服器。可自行託管或使用託管的 SaaS。

    2,741+0近 7 天星數變化
  • FluidAudio@FluidInference

    在你的應用程式中使用前沿的 CoreML 音訊模型——文字轉語音、語音轉文字、語音活動偵測與發言者分離。使用 Swift 開發,由 SOTA 開源技術驅動。

    2,723+0近 7 天星數變化
  • pluely@iamsrikanthnani

    Cluely 的開源替代方案 - 一款極速、注重隱私的 AI 助理,能在會議、面試和對話期間無縫運作且不被察覺。使用 Tauri 建構以獲得原生效能,僅 10MB。在視訊通話、畫面分享和錄製中完全無法被偵測。

    2,619+0近 7 天星數變化
  • STT@coqui-ai

    🐸STT - 用於語音轉文字的深度學習工具組。訓練與部署 STT 模型從未如此簡單。

    2,606+0近 7 天星數變化
  • foundry-local@microsoft
    2,537+0近 7 天星數變化
  • awesome-whisper@sindresorhus

    🔊 Whisper 相關精彩資源列表 — 由 OpenAI 開發的開源 AI 語音辨識系統

    2,375+0近 7 天星數變化
  • openscreen@getopenscreen

    錄製螢幕,發佈展示。免費且開源、GPU 加速、無浮水印、無訂閱費。支援 Windows、macOS、Linux。持續積極維護中。

    2,287+0近 7 天星數變化
  • ququ@yan5xu

    開源免費的 Wispr Flow 替代方案 | 集成 FunASR 本地模型和可配置大語言模型的下一代中文桌面語音工作流

    2,278+0近 7 天星數變化
  • audio.cpp@0xShug0

    一款由 ggml 驅動的一體化純 C++ 音訊模型推理引擎。支援 TTS、STT、VAD、語音轉換、音樂生成等功能,具備高度優化的效能,無需依賴 Python。

    2,214+0近 7 天星數變化
  • WhisperJAV@meizhong986

    ASR/STT 字幕產生器。使用 Qwen3-ASR、本機 LLM、Whisper、TEN-VAD。針對 JAV 具備抗噪能力

    2,196+0近 7 天星數變化
  • 使用 tensorflow 深度學習框架與 sequence-to-sequence 神經網路的語音辨識

    2,173+0近 7 天星數變化
  • soloud@jarikomppa

    免費、簡單且可攜帶的遊戲音訊引擎

    2,170+0近 7 天星數變化
  • vad@ricky0123

    具備簡單 API 的瀏覽器語音活動偵測器(VAD)

    2,046+0近 7 天星數變化
  • audapolis@bugbakery

    具備自動轉錄功能的語音音訊編輯器

    1,892+0近 7 天星數變化
  • transcribe.cpp@handy-computer

    支援 16 種以上模型家族的 ggml 語音轉文字推理

    1,872+0近 7 天星數變化
← 返回主題列表