audio-generation
Repositorios de código abierto monitorizados etiquetados con audio-generation, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a audio-generation en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con audio-generation.
- #1
CLI de generación de medios Flatkey para imágenes, videos, audio, texto, créditos y descubrimiento de modelos
★ 825
- #1
LocalAI es el motor de IA de código abierto. Ejecuta cualquier modelo (LLM, visión, voz, imagen, video) en cualquier hardware. No requiere GPU.
★ 48.833+84Variación de estrellas de los últimos 7 días - #2
Modelo de generación de voz grande multilingüe, que proporciona capacidad de pila completa para inferencia, entrenamiento y despliegue.
★ 23.426+359Variación de estrellas de los últimos 7 días - #3
Amphion (/æmˈfaɪən/) es un conjunto de herramientas para la generación de audio, música y voz. Su propósito es respaldar la investigación reproducible y ayudar a los investigadores y desarrolladores junior a iniciarse en el campo de la investigación y el desarrollo de la generación de audio, música y voz.
★ 10.276+1Variación de estrellas de los últimos 7 días - #4★ 6593+136Variación de estrellas de los últimos 7 días
- #5
YuE: Modelo fundacional de generación de canciones completas de código abierto, algo similar a Suno.ai pero abierto
★ 6416+8Variación de estrellas de los últimos 7 días - #6
Una WebUI única en Gradio + React con extensiones para ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T y Bark.
★ 3250+5Variación de estrellas de los últimos 7 días - #7★ 2907-1Variación de estrellas de los últimos 7 días
- #8★ 2640+1Variación de estrellas de los últimos 7 días
- #9
Una cronología de los modelos de IA más recientes para generación de audio, ¡a partir de 2023!
★ 1903-2Variación de estrellas de los últimos 7 días - #10
Implementación en PyTorch de SoundStorm, la generación de audio en paralelo eficiente de Google DeepMind.
★ 1547+0Variación de estrellas de los últimos 7 días - #11
Aloja localmente el potente modelo de TTS Chatterbox. Este servidor ofrece una interfaz web intuitiva, endpoints de API flexibles (compatibles con OpenAI), voces predefinidas, clonación de voz y procesamiento de texto a gran escala para audiolibros. Se ejecuta con aceleración en NVIDIA (CUDA), AMD (ROCm) y CPU.
★ 1427+1Variación de estrellas de los últimos 7 días - #12★ 1238-1Variación de estrellas de los últimos 7 días
- #13★ 1227+1Variación de estrellas de los últimos 7 días
- #14
Una integración de nodos personalizados para ComfyUI que permite el uso local de motores de conversión de texto a voz y voz a voz en múltiples idiomas. Soporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clásico y multilingüe), F5-TTS, Higgs Audio 2, 3 y VibeVoice, con longitud de texto ilimitada, temporización SRT, soporte de personajes y diversas herramientas de audio.
★ 1187+7Variación de estrellas de los últimos 7 días - #15
SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.
★ 1118+130Variación de estrellas de los últimos 7 días - #16★ 1110+3Variación de estrellas de los últimos 7 días
- #17
Una lista curada de recursos, herramientas, habilidades, tutoriales y artículos sobre OpenClaw. OpenClaw (anteriormente Moltbot / Clawdbot) es un agente de IA de código abierto autohospedado para WhatsApp, Telegram, Discord y más de 50 integraciones.
★ 1005+7Variación de estrellas de los últimos 7 días - #18
Conjuntos de datos de audio para IA (AI-ADS) 🎵, que incluyen voz, música y efectos de sonido, los cuales pueden proporcionar datos de entrenamiento para IA generativa, AIGC, entrenamiento de modelos de IA, desarrollo de herramientas de audio inteligentes y aplicaciones de audio.
★ 964+1Variación de estrellas de los últimos 7 días - #19
Centro de investigación de IA de audio: artículos, modelos abiertos, puntos de referencia y conjuntos de datos sobre LLMs de audio, reconocimiento de voz, TTS, música y generación de audio.
★ 953+3Variación de estrellas de los últimos 7 días - #20
CLI de generación de medios Flatkey para imágenes, videos, audio, texto, créditos y descubrimiento de modelos
★ 825+176Variación de estrellas de los últimos 7 días - #21
Asistente de voz en tiempo real: streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible con la API Realtime de OpenAI. Clonación de voz, interrupción (barge-in), ~9x tiempo real en una 4090. Licencia Apache 2.0.
★ 757+9Variación de estrellas de los últimos 7 días - #22
Genblaze es un SDK de Python de código abierto para orquestar canales de medios de IA generativa a través de proveedores de video, audio e imagen, con procedencia integrada para cada salida.
★ 558-1Variación de estrellas de los últimos 7 días - #23
Un proyecto de código abierto para unificar el procesamiento y la generación de audio.
★ 512+1Variación de estrellas de los últimos 7 días