跳到主要內容
buildradar
登入
主題 · speech-to-text

speech-to-text

標記 speech-to-text 主題、收錄中的開源專案,依星數排序。

專案數
152
總星數
640,857
平均星數
4,216
佔比
0.03%

常跟 speech-to-text 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 speech-to-text 主題的專案。

  • audio.cpp@0xShug0

    一款由 ggml 驅動的一體化純 C++ 音訊模型推理引擎。支援 TTS、STT、VAD、語音轉換、音樂生成等功能,具備高度優化的效能,無需依賴 Python。

    2,214
  • LiveStream-Agent-Studio@HanyuanWang

    面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。

    1,018
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    547
  • Talkify@tornikegomareli

    Lightning-fast, free, local first voice dictation for macOS with on-device transcription

    544
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    502
  • whisper.cpp@ggml-org

    OpenAI Whisper 模型的 C/C++ 移植版

    53,389+0近 7 天星數變化
  • Handy@cjpais

    免費、開源且可擴充的語音轉文字應用程式,完全離線運作。

    30,916+0近 7 天星數變化
  • meetily@Zackriya-Solutions

    以隱私為先的 AI 會議助理,具 4 倍更快的 Parakeet/Whisper 即時轉錄、說話者分離與基於 Rust 的 Ollama 摘要,100% 本地處理,無需雲端。Meetily(Meetly Ai)是 macOS 與 Windows 上首屈一指的自託管、開源 AI 會議筆記工具。了解如何撰寫會議紀要

    30,252+0近 7 天星數變化
  • llamafile@mozilla-ai

    以單一檔案分發與執行大型語言模型(LLM)。

    25,859+0近 7 天星數變化
  • faster-whisper@SYSTRAN

    使用 CTranslate2 的 Faster Whisper 轉錄

    25,206+0近 7 天星數變化
  • whisperX@m-bain

    WhisperX:具備單字層級時間戳記(及說話者分割)的自動語音辨識

    23,864+0近 7 天星數變化
  • screenpipe@screenpipe

    YC (S26) | 開放電腦歷史 | 本地持續錄製螢幕並為您的代理(Claude、Codex、Openclaw、Hermes、Runner…)提供上下文資訊

    21,376+0近 7 天星數變化
  • FunASR@modelscope

    開源語音辨識工具包,支援訓練、推論、串流 ASR、VAD、標點、說話者分割流程,並提供相容 OpenAI / MCP 的服務介面

    20,136+0近 7 天星數變化
  • pyvideotrans@jianchang512

    將影片從一種語言翻譯成另一種語言,並嵌入配音與字幕。

    18,871+0近 7 天星數變化
  • leon@leon-ai

    🧠 Leon 是你的開源個人助理

    17,476+0近 7 天星數變化
  • kaldi@kaldi-asr

    kaldi-asr/kaldi 是 Kaldi 專案的官方位置。

    15,474+0近 7 天星數變化
  • vosk-api@alphacep

    支援 Android、iOS、Raspberry Pi 與伺服器的離線語音辨識 API,提供 Python、Java、C# 與 Node 介面

    15,101+0近 7 天星數變化
  • VoiceStudio@debpalash

    VoiceStudio 是開源、完全本地化的 ElevenLabs 替代方案——支援 646 種語言的語音克隆、語音設計、影片配音、口述、轉錄與有聲書製作。

    14,835+0近 7 天星數變化
  • sherpa-onnx@k2-fsa

    使用次世代 Kaldi 與 onnxruntime 的語音轉文字、文字轉語音、說話者分離、語音增強、聲源分離與 VAD,支援離線運行。支援嵌入式系統、Android、iOS、HarmonyOS、Raspberry Pi、RISC‑V、RK NPU、Axera NPU、Ascend NPU、x86_64 伺服器、WebSocket 伺服器/客戶端,支援 12 種程式語言

    14,575+0近 7 天星數變化
  • speech-to-speech@huggingface

    使用開源模型構建語音代理

    13,015+0近 7 天星數變化
  • voice-pro@abus-aikorea

    Gradio WebUI 為創作者與開發者提供關鍵 TTS(Edge‑TTS、kokoro)與零樣本語音克隆(E2 & F5‑TTS、CosyVoice),並支援 Whisper 音訊處理、YouTube 下載、Demucs 人聲分離與多語言翻譯

    12,730+0近 7 天星數變化
  • speechbrain@speechbrain

    基於 PyTorch 的語音工具包

    11,802+0近 7 天星數變化
  • WhisperLiveKit@QuentinFuxa

    即時、本地語音轉文字,支援串流 ASR、說話者分離、翻譯,並相容 OpenAI/Deepgram API。

    10,990+0近 7 天星數變化
  • RealtimeSTT@KoljaB

    具備先進語音活動偵測、喚醒詞觸發與即時轉錄功能的高效、低延遲語音轉文字函式庫

    10,108+0近 7 天星數變化
  • SenseVoice@QwenAudio

    開源 SenseVoiceSmall 模型,支援中文(普通話、粵語)、英文、日文與韓文的語音辨識、語言識別、情緒辨識與音訊事件偵測。

    9,209+0近 7 天星數變化
  • 支援多種引擎與 API 的 Python 語音辨識模組,支援線上與離線模式

    8,987+0近 7 天星數變化
  • 基於深度學習的中文語音識別系統

    8,386+0近 7 天星數變化
  • mlx-audio@Blaizzy

    一個基於 Apple MLX 框架的文字轉語音(TTS)、語音轉文字(STT)與語音轉語音(STS)函式庫,提供在 Apple Silicon 上高效的語音分析。

    7,826+0近 7 天星數變化
  • annyang@TalAter

    💬 你網站的語音識別

    6,815+0近 7 天星數變化
  • argmax-oss-swift@argmaxinc

    Apple Silicon 上的本機語音 AI

    6,353+0近 7 天星數變化
  • FunClip@modelscope

    基於 FunASR 的影片轉錄、字幕生成與 LLM 協助剪輯工具,配備本地 Gradio UI

    6,210+0近 7 天星數變化
  • openwhispr@OpenWhispr

    具備本地(Nvidia Parakeet/Whisper)與雲端模型(BYOK)的語音轉文字應用程式,注重隱私,跨平台可用

    6,133+0近 7 天星數變化
  • silero-models@snakers4

    Silero 模型:讓預訓練文字轉語音模型變得極度簡單

    6,084+0近 7 天星數變化
  • ODS@Osmantic

    將你的 PC、Mac 或 Linux 盒子變成 AI 伺服器。LLM 推理、聊天 UI、語音、代理、工作流程、RAG 與圖像生成

    5,931+0近 7 天星數變化
  • whisper-diarization@MahmoudAshraf97

    基於 OpenAI Whisper 的自動語音識別與說話者分離

    5,634+0近 7 天星數變化
← 返回主題列表