audio-generation
Erfasste Open-Source-Repos mit dem Tag audio-generation, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit audio-generation am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit audio-generation getaggt wurden.
- #1
Flatkey Media-Generierungs-CLI für Bilder, Videos, Audio, Text, Credits und Modellsuche.
★ 634
- #1
LocalAI ist das Open-Source AI-Engine. Führen Sie jedes Modell – LLMs, Vision, Voice, Image, Video – auf beliebiger Hardware aus. Keine GPU erforderlich.
★ 48.749+135Sterne-Änderung der letzten 7 Tage - #2
Multilingualer großflächiges Sprachgenerierungsmodell, das Inference, Training und Bereitstellung in vollem Stack ermöglicht.
★ 23.067+215Sterne-Änderung der letzten 7 Tage - #3
Amphion (/æmˈfaɪən/) ist ein Toolkit zur Audio-, Musik- und Sprachgenerierung. Sein Zweck ist es, reproduzierbare Forschung zu unterstützen und jüngeren Forschern sowie Ingenieuren den Einstieg in die Forschung und Entwicklung zur Audio-, Musik- und Sprachgenerierung zu erleichtern.
★ 10.275+17Sterne-Änderung der letzten 7 Tage - #4★ 6.457+229Sterne-Änderung der letzten 7 Tage
- #5
YuE: Open-Source-Grundlagenmodell zur Generierung vollständiger Songs, ähnlich wie Suno.ai, aber offen
★ 6.408+14Sterne-Änderung der letzten 7 Tage - #6
Eine einzige Gradio + React WebUI mit Erweiterungen für ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T und Bark!
★ 3.245+5Sterne-Änderung der letzten 7 Tage - #7★ 2.908+2Sterne-Änderung der letzten 7 Tage
- #8★ 2.639+1Sterne-Änderung der letzten 7 Tage
- #9
Eine Zeitleiste der neuesten KI-Modelle zur Audiogenerierung ab 2023!
★ 1.904+0Sterne-Änderung der letzten 7 Tage - #10
Implementierung von SoundStorm, effiziente parallele Audiogenerierung von Google DeepMind, in PyTorch
★ 1.547+1Sterne-Änderung der letzten 7 Tage - #11
Hosten Sie das leistungsstarke Chatterbox TTS-Modell selbst. Dieser Server bietet eine benutzerfreundliche Web-UI, flexible API-Endpunkte (inkl. OpenAI-Kompatibilität), vordefinierte Stimmen, Klonen von Stimmen und Textverarbeitung im Umfang großer Hörbücher. Läuft beschleunigt auf NVIDIA (CUDA), AMD (ROCm) und CPU.
★ 1.426+12Sterne-Änderung der letzten 7 Tage - #12★ 1.238+0Sterne-Änderung der letzten 7 Tage
- #13★ 1.226+0Sterne-Änderung der letzten 7 Tage
- #14
Eine ComfyUI-Custom-Node-Integration für lokales Multi-Engine- und Multi-Language-Text-to-Speech sowie Voice Conversion. Unterstützt: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (klassisch und multilingual), F5-TTS, Higgs Audio 2, 3 und VibeVoice mit unbegrenzter Textlänge, SRT-Timing, Charakter-Unterstützung und vielen Audiowerkzeugen
★ 1.184+9Sterne-Änderung der letzten 7 Tage - #15
Offizielle CLI für muapi.ai — Generieren Sie Bilder, Videos und Audio über das Terminal. MCP-Server, 14 KI-Modelle, über npm + pip installierbar.
★ 1.043+1Sterne-Änderung der letzten 7 Tage - #16
SGLang-Omni ermöglicht hochleistungsfähiges Serving für TTS-, ASR-, Sprach- und Omni-Modelle.
★ 978+70Sterne-Änderung der letzten 7 Tage - #17
KI-Audiodatensätze (AI-ADS) 🎵, einschließlich Sprache, Musik und Soundeffekten, die Trainingsdaten für generative KI, AIGC, KI-Modelltraining, die Entwicklung intelligenter Audiowerkzeuge und Audioanwendungen bereitstellen können.
★ 961+0Sterne-Änderung der letzten 7 Tage - #18
Das Zentrum für Audio-KI-Forschung: Arbeiten, offene Modelle, Benchmarks und Datensätze über Audio-LLMs, Spracherkennung, TTS, Musik und Audiogenerierung.
★ 950+0Sterne-Änderung der letzten 7 Tage - #19
Echtzeit-Sprachassistent — WebRTC-Streaming, faster-whisper ASR, lokales LLM, Vui Nano (300M) TTS. Kompatibel mit der OpenAI Realtime API. Sprachklonen, Barge-in, ca. 9-fache Echtzeit auf einer 4090. Apache 2.0.
★ 748+0Sterne-Änderung der letzten 7 Tage - #20
Flatkey Media-Generierungs-CLI für Bilder, Videos, Audio, Text, Credits und Modellsuche.
★ 634+89Sterne-Änderung der letzten 7 Tage - #21
Genblaze ist ein Open-Source-Python-SDK zur Orchestrierung generativer KI-Medienpipelines über Video-, Audio- und Bildanbieter hinweg, mit integrierter Herkunftsnachverfolgung für jeden Output.
★ 559-1Sterne-Änderung der letzten 7 Tage - #22
Ein Open-Source-Projekt zur Vereinheitlichung von Audioverarbeitung und -generierung
★ 510+3Sterne-Änderung der letzten 7 Tage