audio-generation
Repositori open source terpantau bertanda audio-generation, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan audio-generation di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda audio-generation.
- #1
CLI pembuatan media Flatkey untuk gambar, video, audio, teks, kredit, dan penemuan model.
★ 825
- #1
LocalAI adalah mesin AI sumber terbuka. Jalankan model apa pun - LLM, visi, suara, gambar, video - di perangkat keras apa pun. Tidak memerlukan GPU.
★ 48.833+84Perubahan bintang dalam 7 hari terakhir - #2
Model generasi suara besar multibahasa, menyediakan kemampuan full-stack untuk inferensi, pelatihan, dan penerapan.
★ 23.426+359Perubahan bintang dalam 7 hari terakhir - #3
Amphion (/æmˈfaɪən/) adalah toolkit untuk Pembuatan Audio, Musik, dan Ucapan. Tujuannya adalah untuk mendukung penelitian yang dapat direproduksi dan membantu para peneliti serta insinyur junior untuk memulai di bidang penelitian dan pengembangan pembuatan audio, musik, dan ucapan.
★ 10.276+1Perubahan bintang dalam 7 hari terakhir - #4★ 6.593+136Perubahan bintang dalam 7 hari terakhir
- #5
YuE: Model Fondasi Generasi Musik Lagu Penuh Terbuka, mirip dengan Suno.ai tetapi bersifat terbuka
★ 6.416+8Perubahan bintang dalam 7 hari terakhir - #6
Satu WebUI Gradio + React dengan ekstensi untuk ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, dan Bark.
★ 3.250+5Perubahan bintang dalam 7 hari terakhir - #7★ 2.907-1Perubahan bintang dalam 7 hari terakhir
- #8★ 2.640+1Perubahan bintang dalam 7 hari terakhir
- #9
Linimasa model AI terbaru untuk pembuatan audio, dimulai tahun 2023!
★ 1.903-2Perubahan bintang dalam 7 hari terakhir - #10
Implementasi SoundStorm, Efficient Parallel Audio Generation dari Google Deepmind, menggunakan PyTorch
★ 1.547+0Perubahan bintang dalam 7 hari terakhir - #11
Host sendiri model TTS Chatterbox yang kuat. Server ini menawarkan Web UI yang ramah pengguna, endpoint API yang fleksibel (termasuk kompatibel dengan OpenAI), suara prasetel, kloning suara, dan pemrosesan teks skala buku audio besar. Berjalan dipercepat di NVIDIA (CUDA), AMD (ROCm), dan CPU.
★ 1.427+1Perubahan bintang dalam 7 hari terakhir - #12★ 1.238-1Perubahan bintang dalam 7 hari terakhir
- #13★ 1.227+1Perubahan bintang dalam 7 hari terakhir
- #14
Integrasi node kustom ComfyUI untuk Text-to-Speech dan Konversi Suara multi-mesin multi-bahasa lokal. Mendukung: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (klasik dan multilingual), F5-TTS, Higgs Audio 2, 3, dan VibeVoice dengan panjang teks tak terbatas, penentuan waktu SRT, dukungan Karakter, dan banyak alat audio
★ 1.187+7Perubahan bintang dalam 7 hari terakhir - #15
SGLang-Omni mendukung penyajian berkinerja tinggi untuk model TTS, ASR, ucapan, dan omni.
★ 1.118+130Perubahan bintang dalam 7 hari terakhir - #16★ 1.110+3Perubahan bintang dalam 7 hari terakhir
- #17
Daftar kurasi sumber daya, alat, keahlian, tutorial & artikel OpenClaw. OpenClaw (sebelumnya Moltbot / Clawdbot) — agen AI open-source yang di-hosting sendiri untuk WhatsApp, Telegram, Discord & 50+ integrasi.
★ 1.005+7Perubahan bintang dalam 7 hari terakhir - #18
Dataset Audio AI (AI-ADS) 🎵, mencakup Ucapan, Musik, dan Efek Suara, yang dapat menyediakan data pelatihan untuk AI Generatif, AIGC, pelatihan model AI, pengembangan alat audio cerdas, dan aplikasi audio.
★ 964+1Perubahan bintang dalam 7 hari terakhir - #19
Pusat penelitian AI audio: makalah, model terbuka, tolok ukur, & dataset di seluruh LLM audio, pengenalan ucapan, TTS, musik & pembuatan audio.
★ 953+3Perubahan bintang dalam 7 hari terakhir - #20
CLI pembuatan media Flatkey untuk gambar, video, audio, teks, kredit, dan penemuan model.
★ 825+176Perubahan bintang dalam 7 hari terakhir - #21
Asisten suara waktu nyata — streaming WebRTC, faster-whisper ASR, LLM lokal, Vui Nano (300M) TTS. Kompatibel dengan OpenAI Realtime API. Kloning suara, barge-in, ~9x waktu nyata pada RTX 4090. Apache 2.0.
★ 757+9Perubahan bintang dalam 7 hari terakhir - #22
Genblaze adalah SDK Python sumber terbuka untuk mengorkestrasikan pipa media generative AI di seluruh penyedia video, audio, dan gambar dengan asal-usul bawaan untuk setiap keluaran.
★ 558-1Perubahan bintang dalam 7 hari terakhir - #23
Proyek Sumber Terbuka untuk Menyatukan Pemrosesan dan Pembuatan Audio
★ 512+1Perubahan bintang dalam 7 hari terakhir