Saltar al contenido principal
buildradar
Sign in
Tema · tts

tts

Repositorios de código abierto monitorizados etiquetados con tts, ordenados por estrellas.

189 repositorios
  • alexandria-audiobook@Finrandojin

    Generador de audiolibros multivoz impulsado por IA: anotación de guiones con LLM, clonación de voz, diseño de voz, entrenamiento LoRA, control de estilo por línea y exportación a MP3, M4B con capítulos o multipista de Audacity. Construido sobre Qwen3-TTS.

    996+17Variación de estrellas de los últimos 7 días
  • lobe-vidol@lobehub

    🧸 Lobe Vidol: haciendo que los ídolos virtuales sean accesibles para todos

    986+1Variación de estrellas de los últimos 7 días
  • Step-Audio-EditX@stepfun-ai

    Un potente modelo de edición de audio basado en aprendizaje por refuerzo y LLM de 3B de parámetros, excelente para editar emociones, estilos de habla y paralingüística, con capacidades robustas de texto a voz zero-shot.

    971+1Variación de estrellas de los últimos 7 días
  • NISQA@gabrielmittag

    NISQA - Evaluación no intrusiva de la calidad de voz y naturalitud de TTS

    970+2Variación de estrellas de los últimos 7 días
  • epub2tts@aedocw

    Convierta un archivo epub o de texto en un audiolibro

    955-1Variación de estrellas de los últimos 7 días
  • audio-ai-hub@BinWang28

    Centro de investigación de IA de audio: artículos, modelos abiertos, puntos de referencia y conjuntos de datos sobre LLMs de audio, reconocimiento de voz, TTS, música y generación de audio.

    953+3Variación de estrellas de los últimos 7 días
  • Hacer que las voces naturales de Azure TTS sean accesibles para cualquier aplicación compatible con SAPI 5.

    933+12Variación de estrellas de los últimos 7 días
  • FireRedTTS@FireRedTeam

    Un sistema TTS fundamental potenciado por LLM de código abierto

    920+1Variación de estrellas de los últimos 7 días
  • SmartJavaAI@geekwenjie

    Caja de herramientas de algoritmos de IA offline gratuita para Java, que admite reconocimiento facial, detección de vida, reconocimiento de expresiones, detección de objetos, segmentación de instancias, detección de peatones, OCR, reconocimiento de matrículas, reconocimiento de tablas, ASR+TTS, traducción automática y más. Se utiliza mediante Maven. Compatible con PyTorch y Tensorflow, e integra modelos como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) y Whisper.

    908+3Variación de estrellas de los últimos 7 días
  • mosec@mosecorg

    Un framework de alto rendimiento para servir modelos de ML, que ofrece procesamiento por lotes dinámico y pipelines de CPU/GPU para aprovechar al máximo su equipo de cómputo

    902+0Variación de estrellas de los últimos 7 días
  • xtts-webui@daswer123

    Interfaz web para usar XTTS y realizar su ajuste fino.

    895+0Variación de estrellas de los últimos 7 días
  • diffwave@lmnt-com

    DiffWave es un vocoder neuronal y sintetizador de formas de onda rápido y de alta calidad.

    885+0Variación de estrellas de los últimos 7 días
  • pdf-to-podcast@NVIDIA-AI-Blueprints

    Transforma archivos PDF en podcasts de IA para obtener contenido de audio atractivo sobre la marcha.

    875+1Variación de estrellas de los últimos 7 días
  • Easy-Voice-Toolkit@Spr-Aachen

    Un kit de herramientas fácil de usar para reconocimiento, transcripción y conversión de voz, entre otros

    873+0Variación de estrellas de los últimos 7 días
  • bark.cpp@PABannier

    Modelo Bark de Suno AI en C/C++ para una generación rápida de texto a voz.

    867+1Variación de estrellas de los últimos 7 días
  • esp-ai@wangzongming

    La solución de integración de IA más sencilla y de menor costo. Si te gusta este proyecto, por favor dale una estrella~

    856+2Variación de estrellas de los últimos 7 días
  • SumatraPDF fork: Chinese EPUB/MOBI, smart PDF dark mode, OCR, TTS, offline dictionary.

    828+15Variación de estrellas de los últimos 7 días
  • Voxtral ASR & TTS ejecutándose de forma nativa y en el navegador. Una implementación en Rust del ASR/TTS en tiempo real de Mistral Voxtral mini utilizando el framework Burn ML.

    819+2Variación de estrellas de los últimos 7 días
  • Kokoros@lucasjinreal

    Kokoro en Rust. https://huggingface.co/hexgrad/Kokoro-82M. TTS increíblemente rápido y en tiempo real con la mayor calidad disponible.

    817+1Variación de estrellas de los últimos 7 días
  • gitpodcast@BandarLabs

    Convierte cualquier repositorio de git en un podcast atractivo.

    814-1Variación de estrellas de los últimos 7 días
  • lue@paulilaaso

    Lector de libros electrónicos para terminal con conversión de texto a voz de calidad audiolibro. Soporta EPUB, PDF, DOCX, HTML, RTF, TXT y MD.

    806+2Variación de estrellas de los últimos 7 días
  • lobe-tts@lobehub

    🎤 Lobe TTS - Una biblioteca de TTS/STT confiable y de alta calidad para servidor y navegador

    805+1Variación de estrellas de los últimos 7 días
  • Conversión de voz a texto y de texto a voz. Envía texto como mensajes OSC a VRChat para mostrarlo en el avatar.

    803+4Variación de estrellas de los últimos 7 días
  • ZerolanLiveRobot@AkagawaTsurunaki

    VTuber con IA que utiliza LLM, ASR, TTS, OCR, CV y otras tecnologías para realizar transmisiones en vivo o jugar Minecraft contigo.

    803+5Variación de estrellas de los últimos 7 días
  • CloneTTS@sipeter

    Motor de texto a voz (TTS) ligero y offline para Android que permite la clonación de voz a nivel de sistema y una lectura de alta fidelidad.

    801+2Variación de estrellas de los últimos 7 días
  • Confucius4-TTS@netease-youdao

    Confucius4-TTS: un motor de síntesis de voz (TTS) multilingüe y translingüe de disparo cero (zero-shot).

    794+10Variación de estrellas de los últimos 7 días
  • mlx-audio-swift@Blaizzy

    Un SDK modular de Swift para procesamiento de audio con MLX en Apple Silicon.

    772+6Variación de estrellas de los últimos 7 días
  • Herramienta de traducción de pantalla en tiempo real para Android sin necesidad de ROOT, ideal para juegos, novelas visuales y manga. Soporta OCR local y en la nube, LLM offline, múltiples servicios de traducción y síntesis de voz (TTS), con visualización directa sobre la pantalla.

    768+82Variación de estrellas de los últimos 7 días
  • dla@markovka17

    Aprendizaje profundo para el procesamiento de audio

    763+1Variación de estrellas de los últimos 7 días
  • vui@fluxions-ai

    Asistente de voz en tiempo real: streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible con la API Realtime de OpenAI. Clonación de voz, interrupción (barge-in), ~9x tiempo real en una 4090. Licencia Apache 2.0.

    757+10Variación de estrellas de los últimos 7 días
← Volver a temas