audio-generation
audio-generation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 audio-generation 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 audio-generation 태그가 달린 리포지토리예요.
- #1
이미지, 비디오, 오디오, 텍스트, 크레딧 및 모델 검색을 위한 Flatkey 미디어 생성 CLI
★ 825
- #1
LocalAI는 오픈소스 AI 엔진입니다. LLM, 비전, 음성, 이미지, 비디오 등 어떤 모델이든 하드웨어 제약 없이 실행하세요. GPU는 필요하지 않습니다.
★ 48,833+84최근 7일 스타 변화 - #2★ 23,426+359최근 7일 스타 변화
- #3
Amphion(/æmˈfaɪən/)은 오디오, 음악 및 음성 생성을 위한 툴킷입니다. 재현 가능한 연구를 지원하고 초보 연구자와 엔지니어가 오디오, 음악 및 음성 생성 연구 및 개발 분야에 쉽게 입문할 수 있도록 돕는 것을 목적으로 합니다.
★ 10,276+1최근 7일 스타 변화 - #4★ 6,593+136최근 7일 스타 변화
- #5★ 6,416+8최근 7일 스타 변화
- #6
ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, Bark 등 다양한 확장 기능을 지원하는 단일 Gradio + React WebUI!
★ 3,250+5최근 7일 스타 변화 - #7★ 2,907-1최근 7일 스타 변화
- #8★ 2,640+1최근 7일 스타 변화
- #9
2023년부터 시작된 최신 오디오 생성 AI 모델 타임라인!
★ 1,903-2최근 7일 스타 변화 - #10
PyTorch로 구현한 Google Deepmind의 SoundStorm(효율적인 병렬 오디오 생성) 구현체
★ 1,547+0최근 7일 스타 변화 - #11
강력한 Chatterbox TTS 모델을 자체 호스팅하세요. 이 서버는 사용자 친화적인 Web UI, 유연한 API 엔드포인트(OpenAI 호환 포함), 사전 정의된 목소리, 목소리 복제, 대규모 오디오북 수준의 텍스트 처리를 제공합니다. NVIDIA (CUDA), AMD (ROCm) 및 CPU에서 가속화되어 실행됩니다.
★ 1,427+1최근 7일 스타 변화 - #12★ 1,238-1최근 7일 스타 변화
- #13★ 1,227+1최근 7일 스타 변화
- #14
로컬 다중 엔진 다국어 텍스트 음성 변환(TTS) 및 음성 변환을 위한 ComfyUI 커스텀 노드 통합입니다. RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox, F5-TTS, Higgs Audio 2/3, VibeVoice를 지원하며 무제한 텍스트 길이, SRT 타이밍, 캐릭터 지원 및 다양한 오디오 도구를 제공합니다.
★ 1,187+7최근 7일 스타 변화 - #15★ 1,108+3최근 7일 스타 변화
- #16
SGLang-Omni는 TTS, ASR, 음성 및 옴니 모델을 위한 고성능 서빙을 지원합니다.
★ 1,105+130최근 7일 스타 변화 - #17
OpenClaw 리소스, 도구, 스킬, 튜토리얼 및 아티클 큐레이션 목록. OpenClaw(구 Moltbot / Clawdbot) — WhatsApp, Telegram, Discord 및 50개 이상의 연동을 지원하는 오픈소스 자체 호스팅 AI 에이전트.
★ 1,004+7최근 7일 스타 변화 - #18
생성형 AI, AIGC, AI 모델 학습, 지능형 오디오 도구 개발 및 오디오 애플리케이션에 학습 데이터를 제공할 수 있는 음성, 음악, 음향 효과를 포함한 AI 오디오 데이터셋(AI-ADS) 🎵
★ 963+1최근 7일 스타 변화 - #19
오디오 AI 연구 허브: 오디오 LLM, 음성 인식, TTS, 음악 및 오디오 생성을 아우르는 논문, 오픈 모델, 벤치마크 및 데이터셋
★ 953+3최근 7일 스타 변화 - #20
이미지, 비디오, 오디오, 텍스트, 크레딧 및 모델 검색을 위한 Flatkey 미디어 생성 CLI
★ 825+176최근 7일 스타 변화 - #21
실시간 음성 비서로 WebRTC 스트리밍, faster-whisper ASR, 로컬 LLM, Vui Nano(300M) TTS를 지원합니다. OpenAI Realtime API와 호환되며 음성 복제, 끼어들기(barge-in) 기능을 제공하고 4090 환경에서 실시간 대비 약 9배 속도로 작동합니다. Apache 2.0 라이선스.
★ 757+9최근 7일 스타 변화 - #22
Genblaze는 비디오, 오디오, 이미지 제공업체 전반에서 생성형 AI 미디어 파이프라인을 오케스트레이션하기 위한 오픈 소스 Python SDK로, 모든 출력물에 대한 출처 추적 기능을 내장함
★ 558-1최근 7일 스타 변화 - #23
오디오 처리와 생성을 통합하기 위한 오픈소스 프로젝트
★ 512+1최근 7일 스타 변화