asr
標記 asr 主題、收錄中的開源專案,依星數排序。
- #31
使用新一代 Kaldi 與 ncnn 在無網路連線下進行即時語音辨識與語音活動檢測(VAD)。支援 iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4A 等。
★ 1,777+0近 7 天星數變化 - #32
百聆是一個類似 GPT-4o 的語音對話機器人,透過 ASR+LLM+TTS 實現,整合 DeepSeek R1 等優秀大模型,接入 openClaw,真正的個人語音助理,延遲低至 800ms,Mac 等低配備裝置也可執行,支援中斷
★ 1,759+0近 7 天星數變化 - #33★ 1,622+0近 7 天星數變化
- #34
使用 LLM、電腦視覺和自動語音辨識來分析影片。
★ 1,570+0近 7 天星數變化 - #35★ 1,520+0近 7 天星數變化
- #36★ 1,512+0近 7 天星數變化
- #37
🍦 Speech-AI-Forge 是一個圍繞 TTS 生成模型開發的專案,實作了 API 伺服器與基於 Gradio 的 WebUI。
★ 1,418+0近 7 天星數變化 - #38
影片同步翻譯與影片配音
★ 1,413+0近 7 天星數變化 - #39
可控制的轉錄。逐字(包含每個填補詞、停頓、口吃、聲音)或意圖(說話者想表達的意思,針對可讀性優化),並帶有單詞級別的時間戳記。
★ 1,371+0近 7 天星數變化 - #40★ 1,347+0近 7 天星數變化
- #41★ 1,303+0近 7 天星數變化
- #42
StreamSpeech 是一個用於離線與同步語音辨識、語音翻譯及語音合成的「一體化」無縫模型。
★ 1,288+0近 7 天星數變化 - #43
基於 Vosk 與 Kaldi 庫的 WebSocket、gRPC 和 WebRTC 語音辨識伺服器
★ 1,262+0近 7 天星數變化 - #44
微調 Whisper 語音辨識模型,支援無時間戳資料訓練、有時間戳資料訓練以及無語音資料訓練。加速推論並支援 Web 部署、Windows 桌面部署與 Android 部署
★ 1,222+0近 7 天星數變化 - #45
適用於 Apple Silicon 的 AI 語音工具組 — 由 MLX 與 CoreML 驅動的 ASR、TTS、語音轉語音、VAD 與說話者分段
★ 1,161+0近 7 天星數變化 - #46
專為真實世界打造的第一個基礎 ASR——具備 7 種原子級聲學條件、54 種複合情境、260 萬個樣本,在其他模型紛紛失效的環境下,效能比 SOTA 提升高達約 30%。**當其他模型在實戰中失敗時,你最後還是會回到 MEGA-ASR。⭐**
★ 1,136+0近 7 天星數變化 - #47
[非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 實作
★ 1,132+0近 7 天星數變化 - #48
SGLang-Omni 為 TTS、ASR、語音與全能模型提供高效能服務。
★ 1,118+56近 7 天星數變化 - #49
使用 Vosk 函式庫為 Android 提供離線語音辨識。
★ 1,057+1近 7 天星數變化 - #50★ 1,057+6近 7 天星數變化
- #51★ 1,056+9近 7 天星數變化
- #52★ 1,040+1近 7 天星數變化
- #53★ 1,022+63近 7 天星數變化
- #54★ 985+4近 7 天星數變化
- #55★ 939+0近 7 天星數變化
- #56
VocoType 是一款運行在本地端側的隱私安全語音輸入工具,透過快捷鍵即可將語音實時轉換為文字並自動輸入到當前應用。支援語音轉文字 MCP、AI 優化文本、自定義替換詞典、錄音影片轉文字等功能,讓語音輸入更高效、更安全。
★ 930+10近 7 天星數變化 - #57
此專案提供具備使用者層級存取支援的 API,使用微調並處理過的 Whisper ASR 模型將語音轉為文字。
★ 914+0近 7 天星數變化 - #58
🔥🔥🔥Java免費離線AI演算法工具箱,支援人臉識別、活體檢測、表情識別、目標檢測、實例分割、行人檢測、OCR文字識別、車牌識別、表格識別、ASR+TTS、機器翻譯等功能,Maven引用即可使用。支援PyTorch、Tensorflow,已整合 Mtcnn、InsightFace、SeetaFace6、YOLOv8~v12、PaddleOCR(PPOCRv5)、Whisper等主流模型
★ 910+4近 7 天星數變化 - #59
一個使用者友善的語音辨識、轉錄、轉換等工具箱 | 简单易用的语音工具箱
★ 873+0近 7 天星數變化 - #60
基於 PaddlePaddle 實現端到端中文語音識別,從入門到實戰,超簡單的入門案例,超實用的企業專案。支援當前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型
★ 870-1近 7 天星數變化