speech-recognition
標記 speech-recognition 主題、收錄中的開源專案,依星數排序。
- #91
語音 AI 研究中樞:涵蓋語音 LLM、語音識別、TTS、音樂與語音生成的論文、開源模型、基準測試與資料集。
★ 953+2近 7 天星數變化 - #92
開箱即用的自架離線轉錄與語者識別服務,並附帶 LLM 摘要
★ 948+1近 7 天星數變化 - #93
Whisper.net。使用 Whisper Models 輕鬆實現語音轉文字
★ 942+1近 7 天星數變化 - #94★ 939+0近 7 天星數變化
- #95
一個基於 Python 的桌面語音助理,能夠執行系統級指令、整合語音辨識與文字轉語音,並處理非同步的使用者互動。
★ 922+11近 7 天星數變化 - #96
針對串流與裝置端使用優化的 Whisper 模型
★ 897-1近 7 天星數變化 - #97
一個無需網際網路即可在您自己的電腦上執行的會說話 LLM。
★ 891+1近 7 天星數變化 - #98★ 883+0近 7 天星數變化
- #99
基於 PaddlePaddle 實現端到端中文語音識別,從入門到實戰,超簡單的入門案例,超實用的企業專案。支援當前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型
★ 870-1近 7 天星數變化 - #100
為你的 React 應用程式加入語音辨識功能💬
★ 842+0近 7 天星數變化 - #101
Connectionist Temporal Classification (CTC) 解碼演算法:最佳路徑、Beam Search、詞典搜尋、字首搜尋與 Token Passing。以 Python 實作。
★ 836-1近 7 天星數變化 - #102
使用 OpenAI 的 Whisper 建立即時語音轉文字網頁應用程式 https://openai.com/blog/whisper/
★ 835+0近 7 天星數變化 - #103★ 823-1近 7 天星數變化
- #104
適用於 Linux 的免費、開源、100% 離線語音聽寫工具。透過 whisper.cpp、Whisper 與 VOSK 引擎支援隨處語音輸入,具備 GPU 加速,支援 X11 與 Wayland!
★ 809+17近 7 天星數變化 - #105★ 805-1近 7 天星數變化
- #106
語音轉文字再轉語音。歌曲正在播放中。將文字作為 OSC 訊息傳送至 VRChat 以顯示在虛擬化身上。(STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 804+5近 7 天星數變化 - #107
whisper.cpp 的 React Native 綁定。
★ 802+2近 7 天星數變化 - #108★ 790+13近 7 天星數變化
- #109★ 788+1近 7 天星數變化
- #110
允許使用者搭配 OpenAI whisper 使用麥克風的專案。
★ 787+0近 7 天星數變化 - #111
🎤 在 Swift 中進行語音轉文字的最簡單方法
★ 785+0近 7 天星數變化 - #112
一個 100% 私密的 AI 語音轉文字應用程式,支援 100 多種語言的語音轉文字。使用 Compose Multiplatform 為 Android 和 iOS 開發,並基於 Whisper AI —— 無需上傳雲端,所有處理皆在裝置端完成,確保完整隱私。
★ 779+4近 7 天星數變化 - #113★ 767+1近 7 天星數變化
- #114
基於 PaddlePaddle 實現的語音辨識,中文語音辨識。專案完善,辨識效果佳。支援 Windows、Linux 下訓練與預測,並支援 Nvidia Jetson 開發板預測。
★ 763+1近 7 天星數變化 - #115★ 762-1近 7 天星數變化
- #116★ 754+1近 7 天星數變化
- #117
在本地機器的 Unity3d 中執行語音轉文字模型 (whisper.cpp)。
★ 751+1近 7 天星數變化 - #118
Allosaurus 是一個預先訓練的通用語音辨識器,支援超過 2000 種語言
★ 746+4近 7 天星數變化 - #119
適用於 Android 的隱私且裝置端的語音辨識鍵盤與服務。
★ 745+2近 7 天星數變化 - #120
Pytorch實現的流式與非流式的自動語音識別框架,同時兼容在線和離線識別,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多種數據增強方法。
★ 727+0近 7 天星數變化