speech
標記 speech 主題、收錄中的開源專案,依星數排序。
- #31★ 2,818+1近 7 天星數變化
- #32★ 2,750-1近 7 天星數變化
- #33★ 2,628+0近 7 天星數變化
- #34★ 2,256+7近 7 天星數變化
- #35
支援超過 7000 種語言、可控制且快速的文字轉語音!
★ 2,207-1近 7 天星數變化 - #36★ 2,170+3近 7 天星數變化
- #37
免費、高品質的文字轉語音 API 端點,可替代 OpenAI、Azure 或 ElevenLabs
★ 2,075+5近 7 天星數變化 - #38
Praat:用電腦進行語音學研究
★ 1,970+1近 7 天星數變化 - #39★ 1,935+1近 7 天星數變化
- #40
從事音訊與音樂技術 AI 領域的新創公司社群清單
★ 1,769+1近 7 天星數變化 - #41★ 1,521+3近 7 天星數變化
- #42
通用語音還原
★ 1,375+0近 7 天星數變化 - #43
可控制的轉錄。逐字(包含每個填補詞、停頓、口吃、聲音)或意圖(說話者想表達的意思,針對可讀性優化),並帶有單詞級別的時間戳記。
★ 1,371+13近 7 天星數變化 - #44★ 1,333+1近 7 天星數變化
- #45★ 1,305+5近 7 天星數變化
- #46
StreamSpeech 是一個用於離線與同步語音辨識、語音翻譯及語音合成的「一體化」無縫模型。
★ 1,288+0近 7 天星數變化 - #47
用於理解深度學習的影片、筆記與實驗。
★ 1,198+0近 7 天星數變化 - #48★ 1,149-1近 7 天星數變化
- #49
[非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 實作
★ 1,132+1近 7 天星數變化 - #50★ 1,040+1近 7 天星數變化
- #51
一個由 LLM 驅動的開源基礎 TTS 系統
★ 919+1近 7 天星數變化 - #52
基於 CNN 的音訊分割工具包。可用於偵測語音、音樂、噪音與發話者性別,專為基於各性別發話時間的大規模兩性平等研究而設計。
★ 910+1近 7 天星數變化 - #53★ 884+0近 7 天星數變化
- #54★ 881-1近 7 天星數變化
- #55
基於 PaddlePaddle 實現端到端中文語音識別,從入門到實戰,超簡單的入門案例,超實用的企業專案。支援當前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型
★ 870-1近 7 天星數變化 - #56
在原生環境與瀏覽器中執行的 Voxtral ASR 與 TTS。使用 Burn ML 框架實作的 Mistral Voxtral mini 即時 ASR / TTS 的 Rust 版本
★ 819+2近 7 天星數變化 - #57
一個基於 LiveKit 建構的即時互動 Omni Avatar,讓你能夠無縫整合任何開源 Avatar 元件(即時模型、視覺、語音、記憶、搜尋等)。
★ 813+4近 7 天星數變化 - #58★ 771+0近 7 天星數變化
- #59★ 756+9近 7 天星數變化
- #60
Allosaurus 是一個預先訓練的通用語音辨識器,支援超過 2000 種語言
★ 746+4近 7 天星數變化