跳到主要內容
buildradar
主題 · audio-generation

audio-generation

標記 audio-generation 主題、收錄中的開源專案,依星數排序。

專案數
22
總星數
118,649
平均星數
5,393
佔比
0.01%

常跟 audio-generation 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 audio-generation 主題的專案。

  • flatkey-cli@flatkey-ai

    用於圖像、影片、音訊、文字、製作名單與模型探索的 Flatkey 媒體生成 CLI

    634
  • LocalAI@mudler

    LocalAI 為開源 AI 引擎,可在任何硬體上執行任意模型(LLM、視覺、語音、圖像、影片),無需 GPU

    48,749+135近 7 天星數變化
  • CosyVoice@QwenAudio

    多語言大型語音生成模型,提供推論、訓練與部署全端能力

    23,067+215近 7 天星數變化
  • Amphion@open-mmlab

    Amphion(/æmˈfaɪən/)是一套音訊、音樂與語音生成工具箱,旨在支援可重現的研究,協助初學者與工程師快速進入音訊、音樂與語音生成的研發領域。

    10,275+17近 7 天星數變化
  • vllm-omni@vllm-project

    高效模型推理框架,支援全模態模型

    6,457+229近 7 天星數變化
  • YuE@multimodal-art-projection

    YuE:開放式全曲音樂生成基礎模型,類似 Suno.ai 但開源

    6,408+14近 7 天星數變化
  • TTS-WebUI@rsxdalv

    單一 Gradio + React WebUI,整合 ACE-Step、OmniVoice、Kimi Audio、Piper TTS、GPT-SoVITS、CosyVoice、XTTSv2、DIA、Kokoro、OpenVoice、ParlerTTS、Stable Audio、MMS、StyleTTS2、MAGNet、AudioGen、MusicGen、Tortoise、RVC、Vocos、Demucs、SeamlessM4T 與 Bark 的擴充功能!

    3,245+5近 7 天星數變化
  • AudioLDM@haoheliu

    AudioLDM:利用文字生成語音、音效、音樂等內容。

    2,908+2近 7 天星數變化
  • AudioLDM2@haoheliu

    文字轉語音/音樂生成

    2,639+1近 7 天星數變化
  • 音訊生成最新 AI 模型的時間軸,始於 2023 年!

    1,904+0近 7 天星數變化
  • soundstorm-pytorch@lucidrains

    在 Pytorch 中實作 Google Deepmind 的 SoundStorm(高效平行音訊生成)

    1,547+1近 7 天星數變化
  • 自架強大的 Chatterbox TTS 模型。此伺服器提供使用者友善的 Web UI、靈活的 API 端點(包含相容 OpenAI)、預定義語音、語音複製,以及大型有聲書規模的文字處理。可在 NVIDIA (CUDA)、AMD (ROCm) 和 CPU 上加速執行。

    1,426+12近 7 天星數變化
  • tango@declare-lab

    用於文字轉語音生成的擴散模型系列。

    1,238+0近 7 天星數變化
  • BigVGAN@NVIDIA

    BigVGAN 官方 PyTorch 實現 (ICLR 2023)

    1,226+0近 7 天星數變化
  • TTS-Audio-Suite@diodiogod

    一個 ComfyUI 自訂節點整合套件,用於本機多引擎、多語言文字轉語音與語音轉換。支援:RVC、Echo-TTS、Qwen3-TTS、Cozy Voice 3、Step Audio EditX、IndexTTS-2、Chatterbox(經典與多語言)、F5-TTS、Higgs Audio 2、3 與 VibeVoice,具備無限文字長度、SRT 計時、角色支援及多種音訊工具

    1,184+9近 7 天星數變化
  • muapi-cli@SamurAIGPT

    muapi.ai 官方 CLI —— 從終端機產生影像、影片與音訊。具備 MCP 伺服器,包含 14 種 AI 模型,可透過 npm 與 pip 安裝。

    1,043+1近 7 天星數變化
  • sglang-omni@sgl-project

    SGLang-Omni 為 TTS、ASR、語音與全能模型提供高效能服務。

    978+70近 7 天星數變化
  • AI 音訊資料集 (AI-ADS) 🎵,包含語音、音樂與音效,可為生成式 AI、AIGC、AI 模型訓練、智慧音訊工具開發及音訊應用程式提供訓練資料。

    961+0近 7 天星數變化
  • audio-ai-hub@BinWang28

    語音 AI 研究中樞:涵蓋語音 LLM、語音識別、TTS、音樂與語音生成的論文、開源模型、基準測試與資料集。

    950+0近 7 天星數變化
  • vui@fluxions-ai

    即時語音助理 —— WebRTC 串流、faster-whisper ASR、本地 LLM、Vui Nano (300M) TTS。相容 OpenAI Realtime API。支援語音複製、插話打斷,在 4090 上約有 9 倍即時效能。採用 Apache 2.0 授權。

    748+0近 7 天星數變化
  • flatkey-cli@flatkey-ai

    用於圖像、影片、音訊、文字、製作名單與模型探索的 Flatkey 媒體生成 CLI

    634+89近 7 天星數變化
  • genblaze@backblaze-labs

    Genblaze 是一個開源 Python SDK,用於編排跨影片、音訊與影像供應商的生成式 AI 媒體管線,並為每個輸出提供內建的來源追蹤。

    559-1近 7 天星數變化
  • unified-audio@alibaba

    一個統一音訊處理與生成的開源專案。

    510+3近 7 天星數變化
← 返回主題列表