audio-generation
Dépôts open source suivis étiquetés audio-generation, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de audio-generation sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés audio-generation.
- #1
CLI de génération de médias Flatkey pour images, vidéos, audio, texte, crédits et découverte de modèles.
★ 634
- #1
LocalAI est le moteur d'IA open source. Exécutez n'importe quel modèle - LLM, vision, voix, image, vidéo - sur n'importe quel matériel. Aucun GPU requis.
★ 48 749+135Évolution des étoiles sur les 7 derniers jours - #2
Modèle multilingue de génération vocale à grande échelle, offrant des capacités complètes d'inférence, d'entraînement et de déploiement.
★ 23 067+215Évolution des étoiles sur les 7 derniers jours - #3
Amphion est une boîte à outils pour la génération audio, musicale et vocale. Son objectif est de soutenir la recherche reproductible et d'aider les chercheurs et ingénieurs débutants à se lancer dans la recherche et le développement liés à la génération audio, musicale et vocale.
★ 10 275+17Évolution des étoiles sur les 7 derniers jours - #4★ 6 457+229Évolution des étoiles sur les 7 derniers jours
- #5
YuE : Modèle de fondation pour la génération de chansons complètes, similaire à Suno.ai mais en open source.
★ 6 408+14Évolution des étoiles sur les 7 derniers jours - #6
Une interface web unique Gradio + React avec des extensions pour ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T et Bark !
★ 3 245+5Évolution des étoiles sur les 7 derniers jours - #7
AudioLDM : Générez de la parole, des effets sonores, de la musique et plus encore, à partir de texte.
★ 2 908+2Évolution des étoiles sur les 7 derniers jours - #8★ 2 639+1Évolution des étoiles sur les 7 derniers jours
- #9
Chronologie des derniers modèles d'IA pour la génération audio, depuis 2023.
★ 1 904+0Évolution des étoiles sur les 7 derniers jours - #10
Implémentation en Pytorch de SoundStorm, le modèle de génération audio parallèle efficace de Google Deepmind.
★ 1 547+1Évolution des étoiles sur les 7 derniers jours - #11
Auto-hébergez le puissant modèle TTS Chatterbox. Ce serveur propose une interface Web conviviale, des points de terminaison API flexibles (compatibles OpenAI), des voix prédéfinies, le clonage vocal et le traitement de texte à grande échelle pour les livres audio. Fonctionne en mode accéléré sur NVIDIA (CUDA), AMD (ROCm) et CPU.
★ 1 426+12Évolution des étoiles sur les 7 derniers jours - #12★ 1 238+0Évolution des étoiles sur les 7 derniers jours
- #13★ 1 226+0Évolution des étoiles sur les 7 derniers jours
- #14
Intégration de nœuds personnalisés pour ComfyUI dédiée à la synthèse vocale (TTS) et à la conversion de voix multi-moteurs et multilingue. Supporte RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox, F5-TTS, Higgs Audio 2, 3 et VibeVoice avec gestion des durées illimitées, timing SRT et outils audio.
★ 1 184+9Évolution des étoiles sur les 7 derniers jours - #15
CLI officiel pour muapi.ai — générez des images, vidéos et audios depuis le terminal. Serveur MCP, 14 modèles d'IA, installable via npm et pip.
★ 1 043+1Évolution des étoiles sur les 7 derniers jours - #16
SGLang-Omni permet un service haute performance pour les modèles TTS, ASR, vocaux et omnimodaux.
★ 978+70Évolution des étoiles sur les 7 derniers jours - #17
Jeux de données audio IA (AI-ADS) incluant parole, musique et effets sonores, destinés à l'entraînement de modèles génératifs, à l'AIGC et au développement d'outils audio intelligents.
★ 961+0Évolution des étoiles sur les 7 derniers jours - #18
Le hub pour la recherche en IA audio : articles, modèles ouverts, benchmarks et jeux de données pour les LLM audio, la reconnaissance vocale, la synthèse vocale (TTS), ainsi que la génération de musique et d'audio.
★ 950+0Évolution des étoiles sur les 7 derniers jours - #19
Assistant vocal en temps réel — streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible avec l'API OpenAI Realtime. Clonage vocal, interruption (barge-in), ~9× temps réel sur une 4090. Licence Apache 2.0.
★ 748+0Évolution des étoiles sur les 7 derniers jours - #20
CLI de génération de médias Flatkey pour images, vidéos, audio, texte, crédits et découverte de modèles.
★ 634+89Évolution des étoiles sur les 7 derniers jours - #21
Genblaze est un SDK Python open source pour orchestrer des pipelines média d'IA générative à travers des fournisseurs de vidéo, audio et image, avec traçabilité intégrée pour chaque résultat.
★ 559-1Évolution des étoiles sur les 7 derniers jours - #22
Un projet open source pour unifier le traitement et la génération audio
★ 510+3Évolution des étoiles sur les 7 derniers jours