跳到主要内容
buildradar
Sign in
主题 · audio-generation

audio-generation

标记 audio-generation 主题、收录中的开源项目,按星标数排序。

项目数
24
总星标数
119,436
平均星标数
4,977
占比
0.01%

常跟 audio-generation 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 audio-generation 主题的项目。

  • flatkey-cli@flatkey-ai

    用于图像、视频、音频、文字、制作名单与模型探索的 Flatkey 媒体生成 CLI

    873
  • GameFactory-3A@OpenDCAI

    A comprehensive open-source 3A game-generation skill and asset framework.

    574
  • LocalAI@mudler

    LocalAI 为开源 AI 引擎,可在任何硬件上运行任意模型(LLM、视觉、语音、图像、视频),无需 GPU

    48,833+84近 7 天星标变化
  • CosyVoice@QwenAudio

    多语言大型语音生成模型,提供推理、训练与部署全栈能力

    23,426+359近 7 天星标变化
  • Amphion@open-mmlab

    Amphion(/æmˈfaɪən/)是一个音频、音乐和语音生成工具箱,旨在支持可重复研究,帮助初学者和工程师快速进入音频、音乐和语音生成的研发领域。

    10,276+1近 7 天星标变化
  • vllm-omni@vllm-project

    高效模型推理框架,支持全模态模型

    6,593+136近 7 天星标变化
  • YuE@multimodal-art-projection

    YuE:开放式全曲音乐生成基础模型,类似 Suno.ai 但开源

    6,416+8近 7 天星标变化
  • TTS-WebUI@rsxdalv

    单一 Gradio + React WebUI,整合 ACE-Step、OmniVoice、Kimi Audio、Piper TTS、GPT-SoVITS、CosyVoice、XTTSv2、DIA、Kokoro、OpenVoice、ParlerTTS、Stable Audio、MMS、StyleTTS2、MAGNet、AudioGen、MusicGen、Tortoise、RVC、Vocos、Demucs、SeamlessM4T 与 Bark 的扩展功能!

    3,250+5近 7 天星标变化
  • AudioLDM@haoheliu

    AudioLDM:利用文本生成语音、音效、音乐等内容。

    2,907-1近 7 天星标变化
  • AudioLDM2@haoheliu

    文本转语音/音乐生成

    2,640+1近 7 天星标变化
  • 音频生成最新 AI 模型的时间轴,始于 2023 年!

    1,903-2近 7 天星标变化
  • soundstorm-pytorch@lucidrains

    在 Pytorch 中实现 Google Deepmind 的 SoundStorm(高效并行音频生成)

    1,547+0近 7 天星标变化
  • 自架强大的 Chatterbox TTS 模型。此服务器提供用户友好的 Web UI、灵活的 API 端点(包含兼容 OpenAI)、预定义语音、语音克隆,以及大型有声书规模的文本处理。可在 NVIDIA (CUDA)、AMD (ROCm) 和 CPU 上加速运行。

    1,427+1近 7 天星标变化
  • tango@declare-lab

    用于文本转语音生成的扩散模型系列。

    1,238-1近 7 天星标变化
  • BigVGAN@NVIDIA

    BigVGAN 官方 PyTorch 实现 (ICLR 2023)

    1,227+1近 7 天星标变化
  • TTS-Audio-Suite@diodiogod

    一个 ComfyUI 自定义节点集成套件,用于本地多引擎、多语言文本转语音与语音转换。支持:RVC、Echo-TTS、Qwen3-TTS、Cozy Voice 3、Step Audio EditX、IndexTTS-2、Chatterbox(经典与多语言)、F5-TTS、Higgs Audio 2、3 与 VibeVoice,具备无限文本长度、SRT 计时、角色支持及多种音频工具

    1,187+7近 7 天星标变化
  • sglang-omni@sgl-project

    SGLang-Omni 为 TTS、ASR、语音与全能模型提供高性能服务。

    1,118+143近 7 天星标变化
  • MOVA@OpenMOSS

    MOVA:迈向可扩展且同步的音视频生成

    1,110+5近 7 天星标变化
  • awesome-agent-apis@Anil-matcha

    OpenClaw 资源、工具、技能、教程与文章的精选列表。OpenClaw(前称 Moltbot / Clawdbot)— 适用于 WhatsApp、Telegram、Discord 及 50 多种集成的开源自托管 AI agent。

    1,005+8近 7 天星标变化
  • AI 音频数据集 (AI-ADS) 🎵,包含语音、音乐与音效,可为生成式 AI、AIGC、AI 模型训练、智能音频工具开发及音频应用程序提供训练数据。

    965+2近 7 天星标变化
  • audio-ai-hub@BinWang28

    语音 AI 研究中枢:涵盖语音 LLM、语音识别、TTS、音乐与语音生成的论文、开源模型、基准测试与数据集。

    953+3近 7 天星标变化
  • flatkey-cli@flatkey-ai

    用于图像、视频、音频、文字、制作名单与模型探索的 Flatkey 媒体生成 CLI

    873+211近 7 天星标变化
  • vui@fluxions-ai

    实时语音助手 —— WebRTC 流式传输、faster-whisper ASR、本地 LLM、Vui Nano (300M) TTS。兼容 OpenAI Realtime API。支持语音克隆、插话打断,在 4090 上约有 9 倍实时性能。采用 Apache 2.0 许可证。

    759+10近 7 天星标变化
  • GameFactory-3A@OpenDCAI

    A comprehensive open-source 3A game-generation skill and asset framework.

    574近 7 天星标变化
  • genblaze@backblaze-labs

    Genblaze 是一个开源 Python SDK,用于编排跨视频、音频与图像供应商的生成式 AI 媒体流水线,并为每个输出提供内置的来源追踪。

    559+0近 7 天星标变化
  • unified-audio@alibaba

    一个统一音频处理与生成的开源项目。

    514+5近 7 天星标变化
← 返回主题列表