Saltar al contenido principal
buildradar
Sign in
Tema · audio-generation

audio-generation

Repositorios de código abierto monitorizados etiquetados con audio-generation, ordenados por estrellas.

Repositorios
23
Estrellas totales
119.436
Estrellas de media
5193
Proporción
0,01%

Temas que aparecen con frecuencia junto a audio-generation en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con audio-generation.

  • flatkey-cli@flatkey-ai

    CLI de generación de medios Flatkey para imágenes, videos, audio, texto, créditos y descubrimiento de modelos

    825
  • LocalAI@mudler

    LocalAI es el motor de IA de código abierto. Ejecuta cualquier modelo (LLM, visión, voz, imagen, video) en cualquier hardware. No requiere GPU.

    48.833+84Variación de estrellas de los últimos 7 días
  • CosyVoice@QwenAudio

    Modelo de generación de voz grande multilingüe, que proporciona capacidad de pila completa para inferencia, entrenamiento y despliegue.

    23.426+359Variación de estrellas de los últimos 7 días
  • Amphion@open-mmlab

    Amphion (/æmˈfaɪən/) es un conjunto de herramientas para la generación de audio, música y voz. Su propósito es respaldar la investigación reproducible y ayudar a los investigadores y desarrolladores junior a iniciarse en el campo de la investigación y el desarrollo de la generación de audio, música y voz.

    10.276+1Variación de estrellas de los últimos 7 días
  • vllm-omni@vllm-project

    Un framework para la inferencia eficiente de modelos omnimodales.

    6593+136Variación de estrellas de los últimos 7 días
  • YuE@multimodal-art-projection

    YuE: Modelo fundacional de generación de canciones completas de código abierto, algo similar a Suno.ai pero abierto

    6416+8Variación de estrellas de los últimos 7 días
  • TTS-WebUI@rsxdalv

    Una WebUI única en Gradio + React con extensiones para ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T y Bark.

    3250+5Variación de estrellas de los últimos 7 días
  • AudioLDM@haoheliu

    AudioLDM: Genera voz, efectos de sonido, música y más a partir de texto.

    2907-1Variación de estrellas de los últimos 7 días
  • AudioLDM2@haoheliu

    Generación de texto a audio y música

    2640+1Variación de estrellas de los últimos 7 días
  • Una cronología de los modelos de IA más recientes para generación de audio, ¡a partir de 2023!

    1903-2Variación de estrellas de los últimos 7 días
  • soundstorm-pytorch@lucidrains

    Implementación en PyTorch de SoundStorm, la generación de audio en paralelo eficiente de Google DeepMind.

    1547+0Variación de estrellas de los últimos 7 días
  • Aloja localmente el potente modelo de TTS Chatterbox. Este servidor ofrece una interfaz web intuitiva, endpoints de API flexibles (compatibles con OpenAI), voces predefinidas, clonación de voz y procesamiento de texto a gran escala para audiolibros. Se ejecuta con aceleración en NVIDIA (CUDA), AMD (ROCm) y CPU.

    1427+1Variación de estrellas de los últimos 7 días
  • tango@declare-lab

    Una familia de modelos de difusión para la generación de texto a audio

    1238-1Variación de estrellas de los últimos 7 días
  • BigVGAN@NVIDIA

    Implementación oficial en PyTorch de BigVGAN (ICLR 2023).

    1227+1Variación de estrellas de los últimos 7 días
  • TTS-Audio-Suite@diodiogod

    Una integración de nodos personalizados para ComfyUI que permite el uso local de motores de conversión de texto a voz y voz a voz en múltiples idiomas. Soporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clásico y multilingüe), F5-TTS, Higgs Audio 2, 3 y VibeVoice, con longitud de texto ilimitada, temporización SRT, soporte de personajes y diversas herramientas de audio.

    1187+7Variación de estrellas de los últimos 7 días
  • sglang-omni@sgl-project

    SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.

    1118+130Variación de estrellas de los últimos 7 días
  • MOVA@OpenMOSS

    MOVA: Hacia la generación de video y audio escalable y sincronizada

    1110+3Variación de estrellas de los últimos 7 días
  • awesome-agent-apis@Anil-matcha

    Una lista curada de recursos, herramientas, habilidades, tutoriales y artículos sobre OpenClaw. OpenClaw (anteriormente Moltbot / Clawdbot) es un agente de IA de código abierto autohospedado para WhatsApp, Telegram, Discord y más de 50 integraciones.

    1005+7Variación de estrellas de los últimos 7 días
  • Conjuntos de datos de audio para IA (AI-ADS) 🎵, que incluyen voz, música y efectos de sonido, los cuales pueden proporcionar datos de entrenamiento para IA generativa, AIGC, entrenamiento de modelos de IA, desarrollo de herramientas de audio inteligentes y aplicaciones de audio.

    964+1Variación de estrellas de los últimos 7 días
  • audio-ai-hub@BinWang28

    Centro de investigación de IA de audio: artículos, modelos abiertos, puntos de referencia y conjuntos de datos sobre LLMs de audio, reconocimiento de voz, TTS, música y generación de audio.

    953+3Variación de estrellas de los últimos 7 días
  • flatkey-cli@flatkey-ai

    CLI de generación de medios Flatkey para imágenes, videos, audio, texto, créditos y descubrimiento de modelos

    825+176Variación de estrellas de los últimos 7 días
  • vui@fluxions-ai

    Asistente de voz en tiempo real: streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible con la API Realtime de OpenAI. Clonación de voz, interrupción (barge-in), ~9x tiempo real en una 4090. Licencia Apache 2.0.

    757+9Variación de estrellas de los últimos 7 días
  • genblaze@backblaze-labs

    Genblaze es un SDK de Python de código abierto para orquestar canales de medios de IA generativa a través de proveedores de video, audio e imagen, con procedencia integrada para cada salida.

    558-1Variación de estrellas de los últimos 7 días
  • unified-audio@alibaba

    Un proyecto de código abierto para unificar el procesamiento y la generación de audio.

    512+1Variación de estrellas de los últimos 7 días
← Volver a temas