Saltar al contenido principal
buildradar
Iniciar sesión
Tema · text-to-speech

text-to-speech

Repositorios de código abierto monitorizados etiquetados con text-to-speech, ordenados por estrellas.

150 repositorios
  • TTS-Audio-Suite@diodiogod

    Una integración de nodos personalizados para ComfyUI que permite el uso local de motores de conversión de texto a voz y voz a voz en múltiples idiomas. Soporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clásico y multilingüe), F5-TTS, Higgs Audio 2, 3 y VibeVoice, con longitud de texto ilimitada, temporización SRT, soporte de personajes y diversas herramientas de audio.

    1187+0Variación de estrellas de los últimos 7 días
  • Laboratorio práctico para construir, probar y evaluar aplicaciones con el framework de modelos fundacionales de Apple.

    1178+0Variación de estrellas de los últimos 7 días
  • dia2@nari-labs

    Modelo de TTS capaz de transmitir audio conversacional en tiempo real.

    1173+0Variación de estrellas de los últimos 7 días
  • speech-swift@soniqo

    Kit de herramientas de voz con IA para Apple Silicon: ASR, TTS, voz a voz, VAD y diarización impulsados por MLX y CoreML

    1161+0Variación de estrellas de los últimos 7 días
  • El sistema de autocodificación para su aplicación: Alan AI SDK para Cordova.

    1132+0Variación de estrellas de los últimos 7 días
  • sglang-omni@sgl-project

    SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.

    1118+56Variación de estrellas de los últimos 7 días
  • Uncensored-Local-Studio@techjarves

    Estudio de IA local sin censura para Windows, Linux y macOS. Interfaz gráfica sin configuración para generación de imágenes, LLMs GGUF, conversión de texto a voz y de voz a texto.

    1118+13Variación de estrellas de los últimos 7 días
  • Patter@PatterAI

    SDK de voz con IA de código abierto. La alternativa a Vapi/Retell para desarrolladores que desean ser dueños de su stack. Asigna un número de teléfono a tu agente de IA en 4 líneas: Python y TypeScript, bajo licencia MIT, compatible con Twilio, Telnyx y Plivo.

    1051+7Variación de estrellas de los últimos 7 días
  • Cognitive-Speech-TTS@Azure-Samples

    Código de ejemplo de la API de Text-to-Speech de Microsoft en varios lenguajes, parte de Cognitive Services.

    1014+1Variación de estrellas de los últimos 7 días
  • alexandria-audiobook@Finrandojin

    Generador de audiolibros multivoz impulsado por IA: anotación de guiones con LLM, clonación de voz, diseño de voz, entrenamiento LoRA, control de estilo por línea y exportación a MP3, M4B con capítulos o multipista de Audacity. Construido sobre Qwen3-TTS.

    1000+10Variación de estrellas de los últimos 7 días
  • Step-Audio-EditX@stepfun-ai

    Un potente modelo de edición de audio basado en aprendizaje por refuerzo y LLM de 3B de parámetros, excelente para editar emociones, estilos de habla y paralingüística, con capacidades robustas de texto a voz zero-shot.

    973+1Variación de estrellas de los últimos 7 días
  • NISQA@gabrielmittag

    NISQA - Evaluación no intrusiva de la calidad de voz y naturalitud de TTS

    972+4Variación de estrellas de los últimos 7 días
  • botium-speech-processing@codeforequity-at

    Procesamiento de voz Botium

    943+0Variación de estrellas de los últimos 7 días
  • Hacer que las voces naturales de Azure TTS sean accesibles para cualquier aplicación compatible con SAPI 5.

    934+7Variación de estrellas de los últimos 7 días
  • Cliente de la API REST de Vonage para PHP. Soporte para SMS, voz, texto a voz, números, verificación (2FA) y más.

    931-1Variación de estrellas de los últimos 7 días
  • FireRedTTS@FireRedTeam

    Un sistema TTS fundamental potenciado por LLM de código abierto

    919-1Variación de estrellas de los últimos 7 días
  • EDDiscovery@EDDiscovery

    Registro de capitán y mapa estelar 3D para Elite Dangerous.

    900+4Variación de estrellas de los últimos 7 días
  • diffwave@lmnt-com

    DiffWave es un vocoder neuronal y sintetizador de formas de onda rápido y de alta calidad.

    884-1Variación de estrellas de los últimos 7 días
  • bark.cpp@PABannier

    Modelo Bark de Suno AI en C/C++ para una generación rápida de texto a voz.

    868+2Variación de estrellas de los últimos 7 días
  • lue@paulilaaso

    Lector de libros electrónicos para terminal con conversión de texto a voz de calidad audiolibro. Soporta EPUB, PDF, DOCX, HTML, RTF, TXT y MD.

    805+1Variación de estrellas de los últimos 7 días
  • lobe-tts@lobehub

    🎤 Lobe TTS - Una biblioteca de TTS/STT confiable y de alta calidad para servidor y navegador

    805-1Variación de estrellas de los últimos 7 días
  • Conversión de voz a texto y de texto a voz. Envía texto como mensajes OSC a VRChat para mostrarlo en el avatar.

    804+5Variación de estrellas de los últimos 7 días
  • CloneTTS@sipeter

    Motor de texto a voz (TTS) ligero y offline para Android que permite la clonación de voz a nivel de sistema y una lectura de alta fidelidad.

    804+5Variación de estrellas de los últimos 7 días
  • ai-video-editor@MartinDelophy

    Editor de video de código abierto y local-first donde los creadores y agentes de IA editan la misma línea de tiempo real.

    798+82Variación de estrellas de los últimos 7 días
  • Confucius4-TTS@netease-youdao

    Confucius4-TTS: un motor de síntesis de voz (TTS) multilingüe y translingüe de disparo cero (zero-shot).

    794+6Variación de estrellas de los últimos 7 días
  • Herramienta de traducción de pantalla en tiempo real para Android sin necesidad de ROOT, ideal para juegos, novelas visuales y manga. Soporta OCR local y en la nube, LLM offline, múltiples servicios de traducción y síntesis de voz (TTS), con visualización directa sobre la pantalla.

    794+73Variación de estrellas de los últimos 7 días
  • june@mezbaul-h

    Chatbot de voz local para conversaciones atractivas, impulsado por Ollama, Hugging Face Transformers y Coqui TTS Toolkit

    788+1Variación de estrellas de los últimos 7 días
  • mlx-audio-swift@Blaizzy

    Un SDK modular de Swift para procesamiento de audio con MLX en Apple Silicon.

    774+5Variación de estrellas de los últimos 7 días
  • vui@fluxions-ai

    Asistente de voz en tiempo real: streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible con la API Realtime de OpenAI. Clonación de voz, interrupción (barge-in), ~9x tiempo real en una 4090. Licencia Apache 2.0.

    759+7Variación de estrellas de los últimos 7 días
  • cboard@cboard-org

    Sistema de comunicación aumentativa y alternativa (AAC) con conversión de texto a voz para el navegador.

    756+9Variación de estrellas de los últimos 7 días
← Volver a temas