본문으로 건너뛰기
buildradar
Sign in
토픽 · audio-generation

audio-generation

audio-generation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
23
총 스타
119,436
평균 스타
5,193
비중
0.01%

같은 리포지토리에 audio-generation 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 audio-generation 태그가 달린 리포지토리예요.

  • flatkey-cli@flatkey-ai

    이미지, 비디오, 오디오, 텍스트, 크레딧 및 모델 검색을 위한 Flatkey 미디어 생성 CLI

    825
  • LocalAI@mudler

    LocalAI는 오픈소스 AI 엔진입니다. LLM, 비전, 음성, 이미지, 비디오 등 어떤 모델이든 하드웨어 제약 없이 실행하세요. GPU는 필요하지 않습니다.

    48,833+84최근 7일 스타 변화
  • CosyVoice@QwenAudio

    추론, 학습, 배포를 위한 풀스택 기능을 제공하는 다국어 대규모 음성 생성 모델

    23,426+359최근 7일 스타 변화
  • Amphion@open-mmlab

    Amphion(/æmˈfaɪən/)은 오디오, 음악 및 음성 생성을 위한 툴킷입니다. 재현 가능한 연구를 지원하고 초보 연구자와 엔지니어가 오디오, 음악 및 음성 생성 연구 및 개발 분야에 쉽게 입문할 수 있도록 돕는 것을 목적으로 합니다.

    10,276+1최근 7일 스타 변화
  • vllm-omni@vllm-project

    옴니 모달리티 모델을 위한 효율적인 모델 추론 프레임워크

    6,593+136최근 7일 스타 변화
  • YuE@multimodal-art-projection

    YuE: 오픈 풀송 음악 생성 파운데이션 모델, Suno.ai와 유사하지만 오픈소스임

    6,416+8최근 7일 스타 변화
  • TTS-WebUI@rsxdalv

    ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, Bark 등 다양한 확장 기능을 지원하는 단일 Gradio + React WebUI!

    3,250+5최근 7일 스타 변화
  • AudioLDM@haoheliu

    AudioLDM: 텍스트로 음성, 음향 효과, 음악 등을 생성합니다.

    2,907-1최근 7일 스타 변화
  • AudioLDM2@haoheliu

    텍스트 기반 오디오 및 음악 생성

    2,640+1최근 7일 스타 변화
  • 2023년부터 시작된 최신 오디오 생성 AI 모델 타임라인!

    1,903-2최근 7일 스타 변화
  • soundstorm-pytorch@lucidrains

    PyTorch로 구현한 Google Deepmind의 SoundStorm(효율적인 병렬 오디오 생성) 구현체

    1,547+0최근 7일 스타 변화
  • 강력한 Chatterbox TTS 모델을 자체 호스팅하세요. 이 서버는 사용자 친화적인 Web UI, 유연한 API 엔드포인트(OpenAI 호환 포함), 사전 정의된 목소리, 목소리 복제, 대규모 오디오북 수준의 텍스트 처리를 제공합니다. NVIDIA (CUDA), AMD (ROCm) 및 CPU에서 가속화되어 실행됩니다.

    1,427+1최근 7일 스타 변화
  • tango@declare-lab

    텍스트-오디오 생성을 위한 디퓨전 모델 패밀리.

    1,238-1최근 7일 스타 변화
  • BigVGAN@NVIDIA

    BigVGAN 공식 PyTorch 구현 (ICLR 2023)

    1,227+1최근 7일 스타 변화
  • TTS-Audio-Suite@diodiogod

    로컬 다중 엔진 다국어 텍스트 음성 변환(TTS) 및 음성 변환을 위한 ComfyUI 커스텀 노드 통합입니다. RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox, F5-TTS, Higgs Audio 2/3, VibeVoice를 지원하며 무제한 텍스트 길이, SRT 타이밍, 캐릭터 지원 및 다양한 오디오 도구를 제공합니다.

    1,187+7최근 7일 스타 변화
  • MOVA@OpenMOSS

    MOVA: 확장 가능하고 동기화된 비디오-오디오 생성을 향하여

    1,108+3최근 7일 스타 변화
  • sglang-omni@sgl-project

    SGLang-Omni는 TTS, ASR, 음성 및 옴니 모델을 위한 고성능 서빙을 지원합니다.

    1,105+130최근 7일 스타 변화
  • awesome-agent-apis@Anil-matcha

    OpenClaw 리소스, 도구, 스킬, 튜토리얼 및 아티클 큐레이션 목록. OpenClaw(구 Moltbot / Clawdbot) — WhatsApp, Telegram, Discord 및 50개 이상의 연동을 지원하는 오픈소스 자체 호스팅 AI 에이전트.

    1,004+7최근 7일 스타 변화
  • 생성형 AI, AIGC, AI 모델 학습, 지능형 오디오 도구 개발 및 오디오 애플리케이션에 학습 데이터를 제공할 수 있는 음성, 음악, 음향 효과를 포함한 AI 오디오 데이터셋(AI-ADS) 🎵

    963+1최근 7일 스타 변화
  • audio-ai-hub@BinWang28

    오디오 AI 연구 허브: 오디오 LLM, 음성 인식, TTS, 음악 및 오디오 생성을 아우르는 논문, 오픈 모델, 벤치마크 및 데이터셋

    953+3최근 7일 스타 변화
  • flatkey-cli@flatkey-ai

    이미지, 비디오, 오디오, 텍스트, 크레딧 및 모델 검색을 위한 Flatkey 미디어 생성 CLI

    825+176최근 7일 스타 변화
  • vui@fluxions-ai

    실시간 음성 비서로 WebRTC 스트리밍, faster-whisper ASR, 로컬 LLM, Vui Nano(300M) TTS를 지원합니다. OpenAI Realtime API와 호환되며 음성 복제, 끼어들기(barge-in) 기능을 제공하고 4090 환경에서 실시간 대비 약 9배 속도로 작동합니다. Apache 2.0 라이선스.

    757+9최근 7일 스타 변화
  • genblaze@backblaze-labs

    Genblaze는 비디오, 오디오, 이미지 제공업체 전반에서 생성형 AI 미디어 파이프라인을 오케스트레이션하기 위한 오픈 소스 Python SDK로, 모든 출력물에 대한 출처 추적 기능을 내장함

    558-1최근 7일 스타 변화
  • unified-audio@alibaba

    오디오 처리와 생성을 통합하기 위한 오픈소스 프로젝트

    512+1최근 7일 스타 변화
← 토픽 목록으로