voice-cloning
Repositorios de código abierto monitorizados etiquetados con voice-cloning, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a voice-cloning en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con voice-cloning.
- #1
¡1 minuto de datos de voz es suficiente para entrenar un buen modelo TTS! (clonación de voz con pocos ejemplos)
★ 61.476+138Variación de estrellas de los últimos 7 días - #2
Clona una voz en 5 segundos para generar voz arbitraria en tiempo real
★ 60.117-4Variación de estrellas de los últimos 7 días - #3
🐸💬 - Un conjunto de herramientas de aprendizaje profundo para texto a voz (TTS), probado en combate en investigación y producción
★ 45.985+18Variación de estrellas de los últimos 7 días - #4
VoxCPM2: TTS sin tokenizador para generación de voz multilingüe, diseño de voz creativo y clonación realista
★ 36.595+345Variación de estrellas de los últimos 7 días - #5
Modelo de generación de voz grande multilingüe, que proporciona capacidad de pila completa para inferencia, entrenamiento y despliegue.
★ 23.426+359Variación de estrellas de los últimos 7 días - #6
¡Genera audiolibros a partir de libros electrónicos, clonación de voz y más de 1158 idiomas!
★ 20.097+34Variación de estrellas de los últimos 7 días - #7
Corte, traducción, alineación e incluso doblaje de subtítulos al nivel de Netflix: un equipo de subtitulado de video con IA totalmente automatizado con un solo clic
★ 18.339+49Variación de estrellas de los últimos 7 días - #8
VoiceStudio es la alternativa a ElevenLabs de código abierto y totalmente local: clonación de voz, diseño de voz, doblaje de vídeo, dictado, transcripción y creación de audiolibros en 646 idiomas.
★ 14.835+2880Variación de estrellas de los últimos 7 días - #9
Gradio WebUI para creadores y desarrolladores, con TTS clave (Edge-TTS, kokoro) y clonación de voz zero-shot (E2 & F5-TTS, CosyVoice), procesamiento de audio con Whisper, descarga de YouTube, aislamiento vocal con Demucs y traducción multilingüe.
★ 12.730+54Variación de estrellas de los últimos 7 días - #10
Kit de herramientas de voz fácil de usar que incluye modelo de aprendizaje autosupervisado, ASR de transmisión/SOTA con puntuación, TTS de transmisión con interfaz de texto, sistema de verificación de hablantes, traducción de voz de extremo a extremo y detección de palabras clave. Ganador del premio al mejor demo en NAACL2022.
★ 12.676+5Variación de estrellas de los últimos 7 días - #11
YuE: Modelo fundacional de generación de canciones completas de código abierto, algo similar a Suno.ai pero abierto
★ 6416+8Variación de estrellas de los últimos 7 días - #12
Herramienta de localización de video con IA de código abierto: automatiza la descarga de videos de YouTube/Bilibili, reconocimiento y traducción de subtítulos, clonación de voz y doblaje, mezcla de pistas de audio y subtitulado integrado.
★ 5404+25Variación de estrellas de los últimos 7 días - #13
MOSS‑TTS Family es una familia de modelos de código abierto para la generación de voz y sonido de MOSI.AI y el equipo OpenMOSS. Está diseñada para escenarios del mundo real complejos, de alta fidelidad y gran expresividad, que abarcan voz larga y estable, diálogo multilocutor, diseño de voz y personajes, efectos de sonido ambiental y TTS en streaming en tiempo real.
★ 4058+18Variación de estrellas de los últimos 7 días - #14
Una herramienta de conversión de voz simple y de alta calidad, enfocada en la facilidad de uso y el rendimiento.
★ 3674+14Variación de estrellas de los últimos 7 días - #15★ 2818+1Variación de estrellas de los últimos 7 días
- #16
Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.
★ 2214+115Variación de estrellas de los últimos 7 días - #17★ 1760+3Variación de estrellas de los últimos 7 días
- #18
Servidor oficial del Protocolo de Contexto de Modelo (MCP) de MiniMax que permite la interacción con potentes API de texto a voz, generación de imágenes y generación de video.
★ 1573+2Variación de estrellas de los últimos 7 días - #19
Una integración completa de ComfyUI para el modelo de texto a voz VibeVoice de Microsoft, que permite la síntesis de voz de alta calidad para uno o varios hablantes directamente dentro de tus flujos de trabajo de ComfyUI.
★ 1555+4Variación de estrellas de los últimos 7 días - #20
Una aplicación de Python/Pytorch para sintetizar voces humanas fácilmente
★ 1440+0Variación de estrellas de los últimos 7 días - #21
Aloja localmente el potente modelo de TTS Chatterbox. Este servidor ofrece una interfaz web intuitiva, endpoints de API flexibles (compatibles con OpenAI), voces predefinidas, clonación de voz y procesamiento de texto a gran escala para audiolibros. Se ejecuta con aceleración en NVIDIA (CUDA), AMD (ROCm) y CPU.
★ 1427+1Variación de estrellas de los últimos 7 días - #22
Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.
★ 1399+0Variación de estrellas de los últimos 7 días - #23
Generador de podcasts con IA para episodios bilingües, multilingüe y con múltiples voces; alternativa a NotebookLLM
★ 1289-1Variación de estrellas de los últimos 7 días - #24
Interfaz web para diversas redes neuronales relacionadas con audio.
★ 1246+0Variación de estrellas de los últimos 7 días - #25
Modelo de texto a voz basado en Flow Matching con control de estilo mediante emojis.
★ 1228+4Variación de estrellas de los últimos 7 días - #26
Una integración de nodos personalizados para ComfyUI que permite el uso local de motores de conversión de texto a voz y voz a voz en múltiples idiomas. Soporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clásico y multilingüe), F5-TTS, Higgs Audio 2, 3 y VibeVoice, con longitud de texto ilimitada, temporización SRT, soporte de personajes y diversas herramientas de audio.
★ 1187+7Variación de estrellas de los últimos 7 días - #27
Servidor de inferencia LLM nativo para Apple Silicon. Compatible con la API de OpenAI y Anthropic. Sin Python. Incluye la aplicación MLX Core para macOS con chat, modo agente y llamada a herramientas.
★ 1115+245Variación de estrellas de los últimos 7 días - #28
Generador de audiolibros multivoz impulsado por IA: anotación de guiones con LLM, clonación de voz, diseño de voz, entrenamiento LoRA, control de estilo por línea y exportación a MP3, M4B con capítulos o multipista de Audacity. Construido sobre Qwen3-TTS.
★ 996+17Variación de estrellas de los últimos 7 días - #29
Un potente modelo de edición de audio basado en aprendizaje por refuerzo y LLM de 3B de parámetros, excelente para editar emociones, estilos de habla y paralingüística, con capacidades robustas de texto a voz zero-shot.
★ 971+1Variación de estrellas de los últimos 7 días - #30
Motor de texto a voz (TTS) ligero y offline para Android que permite la clonación de voz a nivel de sistema y una lectura de alta fidelidad.
★ 803+2Variación de estrellas de los últimos 7 días