跳到主要內容
buildradar
登入
主題 · asr

asr

標記 asr 主題、收錄中的開源專案,依星數排序。

共 88 個專案
  • sherpa-ncnn@k2-fsa

    使用新一代 Kaldi 與 ncnn 在無網路連線下進行即時語音辨識與語音活動檢測(VAD)。支援 iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4A 等。

    1,777+0近 7 天星數變化
  • bailing@wwbin2017

    百聆是一個類似 GPT-4o 的語音對話機器人,透過 ASR+LLM+TTS 實現,整合 DeepSeek R1 等優秀大模型,接入 openClaw,真正的個人語音助理,延遲低至 800ms,Mac 等低配備裝置也可執行,支援中斷

    1,759+0近 7 天星數變化
  • dsnote@mkiol

    Speech Note Linux 應用程式。具備離線語音轉文字、文字轉語音以及機器翻譯的筆記、閱讀與翻譯功能。

    1,622+0近 7 天星數變化
  • video-analyzer@byjlw

    使用 LLM、電腦視覺和自動語音辨識來分析影片。

    1,570+0近 7 天星數變化
  • amical@amicalhq

    🎙️ AI 語音聽寫應用程式 - 開源且本機優先 ⚡ 輸入速度提升 3 倍,無需鍵盤。 🆓 基於開源模型驅動,可離線運作,快速且準確。

    1,520+0近 7 天星數變化
  • Fun-ASR@QwenAudio

    開源基於 LLM 的中文、方言、口音及多語種語音 ASR 模型家族,具備 FunASR、vLLM、串流與 llama.cpp 執行階段。

    1,512+0近 7 天星數變化
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge 是一個圍繞 TTS 生成模型開發的專案,實作了 API 伺服器與基於 Gradio 的 WebUI。

    1,418+0近 7 天星數變化
  • SoniTranslate@R3gm

    影片同步翻譯與影片配音

    1,413+0近 7 天星數變化
  • CrisperWhisper@nyrahealth

    可控制的轉錄。逐字(包含每個填補詞、停頓、口吃、聲音)或意圖(說話者想表達的意思,針對可讀性優化),並帶有單詞級別的時間戳記。

    1,371+0近 7 天星數變化
  • voicemode@mbailey

    與 Claude Code 進行自然語音對話

    1,347+0近 7 天星數變化
  • VideoChat@Henry-23

    即時互動數位人,可自訂形象與音色,支援音色複製,對話延遲低至 3 秒

    1,303+0近 7 天星數變化
  • StreamSpeech@ictnlp

    StreamSpeech 是一個用於離線與同步語音辨識、語音翻譯及語音合成的「一體化」無縫模型。

    1,288+0近 7 天星數變化
  • vosk-server@alphacep

    基於 Vosk 與 Kaldi 庫的 WebSocket、gRPC 和 WebRTC 語音辨識伺服器

    1,262+0近 7 天星數變化
  • Whisper-Finetune@yeyupiaoling

    微調 Whisper 語音辨識模型,支援無時間戳資料訓練、有時間戳資料訓練以及無語音資料訓練。加速推論並支援 Web 部署、Windows 桌面部署與 Android 部署

    1,222+0近 7 天星數變化
  • speech-swift@soniqo

    適用於 Apple Silicon 的 AI 語音工具組 — 由 MLX 與 CoreML 驅動的 ASR、TTS、語音轉語音、VAD 與說話者分段

    1,161+0近 7 天星數變化
  • Mega-ASR@xzf-thu

    專為真實世界打造的第一個基礎 ASR——具備 7 種原子級聲學條件、54 種複合情境、260 萬個樣本,在其他模型紛紛失效的環境下,效能比 SOTA 提升高達約 30%。**當其他模型在實戰中失敗時,你最後還是會回到 MEGA-ASR。⭐**

    1,136+0近 7 天星數變化
  • conformer@sooftware

    [非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 實作

    1,132+0近 7 天星數變化
  • sglang-omni@sgl-project

    SGLang-Omni 為 TTS、ASR、語音與全能模型提供高效能服務。

    1,118+56近 7 天星數變化
  • 使用 Vosk 函式庫為 Android 提供離線語音辨識。

    1,057+1近 7 天星數變化
  • violin@shang-zhu

    開源影片翻譯技能

    1,057+6近 7 天星數變化
  • murmure@Kieirra

    完全本地、隱私且跨平台的語音轉文字工具,並具備 LLM 後處理功能

    1,056+9近 7 天星數變化
  • pykaldi@pykaldi

    Kaldi 的 Python 包裝器

    1,040+1近 7 天星數變化
  • jonex@yuezhiai

    多合一多模態解析引擎,結合本體論與 LLM Wiki 驅動的 AI 就緒知識引擎

    1,022+63近 7 天星數變化
  • sherpa@k2-fsa

    基於新一代 Kaldi 的語音轉文字伺服器框架

    985+4近 7 天星數變化
  • espresso@freewym

    Espresso:一個快速的端到端神經語音辨識工具包

    939+0近 7 天星數變化
  • vocotype-cli@233stone

    VocoType 是一款運行在本地端側的隱私安全語音輸入工具,透過快捷鍵即可將語音實時轉換為文字並自動輸入到當前應用。支援語音轉文字 MCP、AI 優化文本、自定義替換詞典、錄音影片轉文字等功能,讓語音輸入更高效、更安全。

    930+10近 7 天星數變化
  • whisper.api@innovatorved

    此專案提供具備使用者層級存取支援的 API,使用微調並處理過的 Whisper ASR 模型將語音轉為文字。

    914+0近 7 天星數變化
  • SmartJavaAI@geekwenjie

    🔥🔥🔥Java免費離線AI演算法工具箱,支援人臉識別、活體檢測、表情識別、目標檢測、實例分割、行人檢測、OCR文字識別、車牌識別、表格識別、ASR+TTS、機器翻譯等功能,Maven引用即可使用。支援PyTorch、Tensorflow,已整合 Mtcnn、InsightFace、SeetaFace6、YOLOv8~v12、PaddleOCR(PPOCRv5)、Whisper等主流模型

    910+4近 7 天星數變化
  • Easy-Voice-Toolkit@Spr-Aachen

    一個使用者友善的語音辨識、轉錄、轉換等工具箱 | 简单易用的语音工具箱

    873+0近 7 天星數變化
  • PPASR@yeyupiaoling

    基於 PaddlePaddle 實現端到端中文語音識別,從入門到實戰,超簡單的入門案例,超實用的企業專案。支援當前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型

    870-1近 7 天星數變化
← 返回主題列表