Saltar al contenido principal
buildradar
Iniciar sesión
Tema · text-to-speech

text-to-speech

Repositorios de código abierto monitorizados etiquetados con text-to-speech, ordenados por estrellas.

150 repositorios
  • RHVoice@RHVoice

    Un sintetizador de voz libre y de código abierto para ruso y otros idiomas

    1836+0Variación de estrellas de los últimos 7 días
  • El sistema de autoprogramación para tu aplicación — Alan AI SDK para Android

    1807+0Variación de estrellas de los últimos 7 días
  • Genie-TTS@High-Logic

    Motor de inferencia y convertidor de modelos ONNX para GPT-SoVITS

    1760+0Variación de estrellas de los últimos 7 días
  • El sistema de autocodificación para tu aplicación: Alan AI SDK para Flutter.

    1756+0Variación de estrellas de los últimos 7 días
  • Traduce automáticamente el texto de un video según un archivo de subtítulos y luego utiliza servicios de voz con IA para crear una nueva pista de audio doblada y traducida con el habla sincronizada utilizando los tiempos de los subtítulos.

    1746+0Variación de estrellas de los últimos 7 días
  • read-aloud@ken107

    Una excelente extensión de navegador que lee en voz alta el contenido de las páginas web con un solo clic

    1737+0Variación de estrellas de los últimos 7 días
  • react-native-executorch@software-mansion

    Forma declarativa de ejecutar modelos de IA en React Native en el dispositivo, impulsada por ExecuTorch.

    1707+0Variación de estrellas de los últimos 7 días
  • alan-sdk-ionic@alan-ai

    El sistema de autocodificación para su aplicación: SDK de Alan AI para Ionic.

    1649+0Variación de estrellas de los últimos 7 días
  • ParallelWaveGAN@kan-bayashi

    Implementación no oficial de Parallel WaveGAN (+ MelGAN, Multi-band MelGAN, HiFi-GAN y StyleMelGAN) con Pytorch

    1646+0Variación de estrellas de los últimos 7 días
  • dsnote@mkiol

    Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.

    1622+0Variación de estrellas de los últimos 7 días
  • video-podcast-maker@Agents365-ai

    Tema → Video narrado en 4K para agentes de codificación. v4.0: todo el TTS a través del componente del motor ttsCN (11 plataformas incluyendo clonación de voz MiniMax, sincronización nativa de subtítulos a nivel de palabra), motor de activos basado en manifiestos, composición Remotion, generación de IA con control de costos.

    1599+0Variación de estrellas de los últimos 7 días
  • MiniMax-MCP@MiniMax-AI

    Servidor oficial del Protocolo de Contexto de Modelo (MCP) de MiniMax que permite la interacción con potentes API de texto a voz, generación de imágenes y generación de video.

    1573+0Variación de estrellas de los últimos 7 días
  • vllm-mlx@waybarrios

    Servidor de inferencia LLM de alto rendimiento compatible con OpenAI y Anthropic para Apple Silicon. Incluye MLX nativo, procesamiento por lotes continuo, modelos multimodales, llamadas a herramientas MCP y soporte para Claude Code.

    1557+0Variación de estrellas de los últimos 7 días
  • VibeVoice-ComfyUI@Enemyx-net

    Una integración completa de ComfyUI para el modelo de texto a voz VibeVoice de Microsoft, que permite la síntesis de voz de alta calidad para uno o varios hablantes directamente dentro de tus flujos de trabajo de ComfyUI.

    1555+0Variación de estrellas de los últimos 7 días
  • soprano@ekwek1

    Soprano: conversión de texto a voz instantánea y ultrarrealista

    1548+0Variación de estrellas de los últimos 7 días
  • RCLI@RunanywhereAI

    Habla con tu Mac, consulta tus documentos, sin necesidad de la nube. IA de voz en el dispositivo + RAG.

    1542+0Variación de estrellas de los últimos 7 días
  • TalkingHead@met4citizen

    Talking Head (3D): Una clase de JavaScript para sincronización de labios en tiempo real usando avatares 3D de cuerpo completo.

    1522+0Variación de estrellas de los últimos 7 días
  • Voice-Cloning-App@voice-cloning-app

    Una aplicación de Python/Pytorch para sintetizar voces humanas fácilmente

    1440+0Variación de estrellas de los últimos 7 días
  • OuteTTS@edwko

    Interfaz para modelos OuteTTS.

    1437+0Variación de estrellas de los últimos 7 días
  • Aloja localmente el potente modelo de TTS Chatterbox. Este servidor ofrece una interfaz web intuitiva, endpoints de API flexibles (compatibles con OpenAI), voces predefinidas, clonación de voz y procesamiento de texto a gran escala para audiolibros. Se ejecuta con aceleración en NVIDIA (CUDA), AMD (ROCm) y CPU.

    1427+0Variación de estrellas de los últimos 7 días
  • Speech-AI-Forge@lenML

    Speech-AI-Forge es un proyecto desarrollado en torno a un modelo de generación TTS, que implementa un servidor API y una interfaz web basada en Gradio.

    1418+0Variación de estrellas de los últimos 7 días
  • SoniTranslate@R3gm

    Traducción sincronizada para videos. Doblaje de video

    1413+0Variación de estrellas de los últimos 7 días
  • Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.

    1399+0Variación de estrellas de los últimos 7 días
  • mlx-tune@ARahim3

    Ajuste fino de LLM en tu Mac con Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding y ajuste fino de OCR, de forma nativa en MLX. API compatible con Unsloth.

    1398+0Variación de estrellas de los últimos 7 días
  • Matcha-TTS@shivammehta25

    [ICASSP 2024] 🍵 Matcha-TTS: Una arquitectura de TTS rápida con conditional flow matching.

    1353+0Variación de estrellas de los últimos 7 días
  • WavTokenizer@jishengpeng

    [ICLR 2025] Modelos de códec acústico discreto SOTA con 40/75 tokens por segundo para modelado de lenguaje de audio

    1317+0Variación de estrellas de los últimos 7 días
  • airunner@Capsize-Games

    Motor de inferencia offline para arte, conversaciones de voz en tiempo real, chatbots impulsados por LLM y flujos de trabajo automatizados

    1314+0Variación de estrellas de los últimos 7 días
  • StreamSpeech@ictnlp

    StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.

    1288+0Variación de estrellas de los últimos 7 días
  • audio-webui@gitmylo

    Interfaz web para diversas redes neuronales relacionadas con audio.

    1246+0Variación de estrellas de los últimos 7 días
  • Irodori-TTS@Aratako

    Modelo de texto a voz basado en Flow Matching con control de estilo mediante emojis.

    1228+0Variación de estrellas de los últimos 7 días
← Volver a temas