跳到主要內容
buildradar
Sign in
主題 · speech

speech

標記 speech 主題、收錄中的開源專案,依星數排序。

共 74 個專案
  • MARS5-TTS@Camb-ai

    來自 CAMB.AI 的 MARS5 語音模型 (TTS)

    2,818+1近 7 天星數變化
  • speechgpt@hahahumble

    💬 SpeechGPT 是一個讓你與 ChatGPT 對話的網頁應用程式。

    2,750-1近 7 天星數變化
  • gTTS@pndurette

    用於介接 Google Translate 文字轉語音 API 的 Python 函式庫與 CLI 工具。

    2,628+0近 7 天星數變化
  • ten-vad@TEN-framework

    語音活動偵測(VAD):低延遲、高效能且輕量

    2,256+7近 7 天星數變化
  • IMS-Toucan@DigitalPhonetics

    支援超過 7000 種語言、可控制且快速的文字轉語音!

    2,207-1近 7 天星數變化
  • soloud@jarikomppa

    免費、簡單且可攜帶的遊戲音訊引擎

    2,170+3近 7 天星數變化
  • openai-edge-tts@travisvn

    免費、高品質的文字轉語音 API 端點,可替代 OpenAI、Azure 或 ElevenLabs

    2,075+5近 7 天星數變化
  • Praat:用電腦進行語音學研究

    1,970+1近 7 天星數變化
  • julius@julius-speech

    開源的大詞彙量連續語音辨識引擎

    1,935+1近 7 天星數變化
  • 從事音訊與音樂技術 AI 領域的新創公司社群清單

    1,769+1近 7 天星數變化
  • SALMONN@bytedance

    SALMONN 系列:一套先進的多模態 LLM

    1,521+3近 7 天星數變化
  • voicefixer@haoheliu

    通用語音還原

    1,375+0近 7 天星數變化
  • CrisperWhisper@nyrahealth

    可控制的轉錄。逐字(包含每個填補詞、停頓、口吃、聲音)或意圖(說話者想表達的意思,針對可讀性優化),並帶有單詞級別的時間戳記。

    1,371+13近 7 天星數變化
  • nlp-paper@DengBoCong

    自然語言處理領域下的相關論文(附閱讀筆記),復現模型以及資料處理等(程式碼含 TensorFlow 和 PyTorch 兩版本)

    1,333+1近 7 天星數變化
  • MTools@HG-ha

    MTools 是一個功能強大的多功能桌面應用程式,集成了音視頻處理、圖片編輯、文本操作和編碼工具,內置AI增強功能。旨在簡化您的工作流程,提升生產效率

    1,305+5近 7 天星數變化
  • StreamSpeech@ictnlp

    StreamSpeech 是一個用於離線與同步語音辨識、語音翻譯及語音合成的「一體化」無縫模型。

    1,288+0近 7 天星數變化
  • Deep-Learning-Experiments@roatienza

    用於理解深度學習的影片、筆記與實驗。

    1,198+0近 7 天星數變化
  • lhotse@lhotse-speech

    用於在機器學習專案中處理多模態資料的工具。

    1,149-1近 7 天星數變化
  • conformer@sooftware

    [非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 實作

    1,132+1近 7 天星數變化
  • pykaldi@pykaldi

    Kaldi 的 Python 包裝器

    1,040+1近 7 天星數變化
  • FireRedTTS@FireRedTeam

    一個由 LLM 驅動的開源基礎 TTS 系統

    919+1近 7 天星數變化
  • inaSpeechSegmenter@ina-foss

    基於 CNN 的音訊分割工具包。可用於偵測語音、音樂、噪音與發話者性別,專為基於各性別發話時間的大規模兩性平等研究而設計。

    910+1近 7 天星數變化
  • diffwave@lmnt-com

    DiffWave 是一個快速、高品質的神經聲碼器與波形合成器。

    884+0近 7 天星數變化
  • AnyGPT@OpenMOSS

    「AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling」的程式碼

    881-1近 7 天星數變化
  • PPASR@yeyupiaoling

    基於 PaddlePaddle 實現端到端中文語音識別,從入門到實戰,超簡單的入門案例,超實用的企業專案。支援當前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型

    870-1近 7 天星數變化
  • 在原生環境與瀏覽器中執行的 Voxtral ASR 與 TTS。使用 Burn ML 框架實作的 Mistral Voxtral mini 即時 ASR / TTS 的 Rust 版本

    819+2近 7 天星數變化
  • AlphaAvatar@AlphaAvatar

    一個基於 LiveKit 建構的即時互動 Omni Avatar,讓你能夠無縫整合任何開源 Avatar 元件(即時模型、視覺、語音、記憶、搜尋等)。

    813+4近 7 天星數變化
  • XR3Player@goxr3plus

    🎧 🎼 最先進的 JavaFX 媒體播放器

    771+0近 7 天星數變化
  • cboard@cboard-org

    為瀏覽器提供文字轉語音功能的輔助與替代溝通(AAC)系統

    756+9近 7 天星數變化
  • allosaurus@xinjli

    Allosaurus 是一個預先訓練的通用語音辨識器,支援超過 2000 種語言

    746+4近 7 天星數變化
← 返回主題列表