Zum Hauptinhalt springen
buildradar
Thema · audio-generation

audio-generation

Erfasste Open-Source-Repos mit dem Tag audio-generation, sortiert nach Sternen.

Repos
22
Sterne gesamt
118.649
Sterne im Schnitt
5.393
Anteil
0,01%

Themen, die häufig gemeinsam mit audio-generation am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit audio-generation getaggt wurden.

  • flatkey-cli@flatkey-ai

    Flatkey Media-Generierungs-CLI für Bilder, Videos, Audio, Text, Credits und Modellsuche.

    634
  • LocalAI@mudler

    LocalAI ist das Open-Source AI-Engine. Führen Sie jedes Modell – LLMs, Vision, Voice, Image, Video – auf beliebiger Hardware aus. Keine GPU erforderlich.

    48.749+135Sterne-Änderung der letzten 7 Tage
  • CosyVoice@QwenAudio

    Multilingualer großflächiges Sprachgenerierungsmodell, das Inference, Training und Bereitstellung in vollem Stack ermöglicht.

    23.067+215Sterne-Änderung der letzten 7 Tage
  • Amphion@open-mmlab

    Amphion (/æmˈfaɪən/) ist ein Toolkit zur Audio-, Musik- und Sprachgenerierung. Sein Zweck ist es, reproduzierbare Forschung zu unterstützen und jüngeren Forschern sowie Ingenieuren den Einstieg in die Forschung und Entwicklung zur Audio-, Musik- und Sprachgenerierung zu erleichtern.

    10.275+17Sterne-Änderung der letzten 7 Tage
  • vllm-omni@vllm-project

    Ein Framework für effiziente Modellinferenz mit Omnimodalitätsmodellen

    6.457+229Sterne-Änderung der letzten 7 Tage
  • YuE@multimodal-art-projection

    YuE: Open-Source-Grundlagenmodell zur Generierung vollständiger Songs, ähnlich wie Suno.ai, aber offen

    6.408+14Sterne-Änderung der letzten 7 Tage
  • TTS-WebUI@rsxdalv

    Eine einzige Gradio + React WebUI mit Erweiterungen für ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T und Bark!

    3.245+5Sterne-Änderung der letzten 7 Tage
  • AudioLDM@haoheliu

    AudioLDM: Generiere Sprache, Soundeffekte, Musik und mehr aus Text.

    2.908+2Sterne-Änderung der letzten 7 Tage
  • AudioLDM2@haoheliu

    Text-zu-Audio/Musik-Generierung

    2.639+1Sterne-Änderung der letzten 7 Tage
  • Eine Zeitleiste der neuesten KI-Modelle zur Audiogenerierung ab 2023!

    1.904+0Sterne-Änderung der letzten 7 Tage
  • soundstorm-pytorch@lucidrains

    Implementierung von SoundStorm, effiziente parallele Audiogenerierung von Google DeepMind, in PyTorch

    1.547+1Sterne-Änderung der letzten 7 Tage
  • Hosten Sie das leistungsstarke Chatterbox TTS-Modell selbst. Dieser Server bietet eine benutzerfreundliche Web-UI, flexible API-Endpunkte (inkl. OpenAI-Kompatibilität), vordefinierte Stimmen, Klonen von Stimmen und Textverarbeitung im Umfang großer Hörbücher. Läuft beschleunigt auf NVIDIA (CUDA), AMD (ROCm) und CPU.

    1.426+12Sterne-Änderung der letzten 7 Tage
  • tango@declare-lab

    Eine Familie von Diffusionsmodellen zur Generierung von Text zu Audio.

    1.238+0Sterne-Änderung der letzten 7 Tage
  • BigVGAN@NVIDIA

    Offizielle PyTorch-Implementierung von BigVGAN (ICLR 2023)

    1.226+0Sterne-Änderung der letzten 7 Tage
  • TTS-Audio-Suite@diodiogod

    Eine ComfyUI-Custom-Node-Integration für lokales Multi-Engine- und Multi-Language-Text-to-Speech sowie Voice Conversion. Unterstützt: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (klassisch und multilingual), F5-TTS, Higgs Audio 2, 3 und VibeVoice mit unbegrenzter Textlänge, SRT-Timing, Charakter-Unterstützung und vielen Audiowerkzeugen

    1.184+9Sterne-Änderung der letzten 7 Tage
  • muapi-cli@SamurAIGPT

    Offizielle CLI für muapi.ai — Generieren Sie Bilder, Videos und Audio über das Terminal. MCP-Server, 14 KI-Modelle, über npm + pip installierbar.

    1.043+1Sterne-Änderung der letzten 7 Tage
  • sglang-omni@sgl-project

    SGLang-Omni ermöglicht hochleistungsfähiges Serving für TTS-, ASR-, Sprach- und Omni-Modelle.

    978+70Sterne-Änderung der letzten 7 Tage
  • KI-Audiodatensätze (AI-ADS) 🎵, einschließlich Sprache, Musik und Soundeffekten, die Trainingsdaten für generative KI, AIGC, KI-Modelltraining, die Entwicklung intelligenter Audiowerkzeuge und Audioanwendungen bereitstellen können.

    961+0Sterne-Änderung der letzten 7 Tage
  • audio-ai-hub@BinWang28

    Das Zentrum für Audio-KI-Forschung: Arbeiten, offene Modelle, Benchmarks und Datensätze über Audio-LLMs, Spracherkennung, TTS, Musik und Audiogenerierung.

    950+0Sterne-Änderung der letzten 7 Tage
  • vui@fluxions-ai

    Echtzeit-Sprachassistent — WebRTC-Streaming, faster-whisper ASR, lokales LLM, Vui Nano (300M) TTS. Kompatibel mit der OpenAI Realtime API. Sprachklonen, Barge-in, ca. 9-fache Echtzeit auf einer 4090. Apache 2.0.

    748+0Sterne-Änderung der letzten 7 Tage
  • flatkey-cli@flatkey-ai

    Flatkey Media-Generierungs-CLI für Bilder, Videos, Audio, Text, Credits und Modellsuche.

    634+89Sterne-Änderung der letzten 7 Tage
  • genblaze@backblaze-labs

    Genblaze ist ein Open-Source-Python-SDK zur Orchestrierung generativer KI-Medienpipelines über Video-, Audio- und Bildanbieter hinweg, mit integrierter Herkunftsnachverfolgung für jeden Output.

    559-1Sterne-Änderung der letzten 7 Tage
  • unified-audio@alibaba

    Ein Open-Source-Projekt zur Vereinheitlichung von Audioverarbeitung und -generierung

    510+3Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen