text-to-speech
Repositórios de código aberto acompanhados marcados com text-to-speech, ordenados por estrelas.
- #31★ 5.831+45Variação de estrelas nos últimos 7 dias
- #32
Plataforma de voz AI de código aberto. Alternativa auto-hospedada ao Vapi e Retell. On-prem, BYOK para Speech to Speech ou LLM/STT/TTS, com construtor visual de fluxo de trabalho, suporte nativo a MCP e telefonia.
★ 5.568+45Variação de estrelas nos últimos 7 dias - #33
Ferramenta de código aberto para localização de vídeos por IA: automatiza o download de vídeos do YouTube/Bilibili, reconhecimento e tradução de legendas, clonagem de voz, mixagem de áudio e gravação de legendas.
★ 5.404+25Variação de estrelas nos últimos 7 dias - #34
Wrapper compatível com OpenAI e empacotado em Docker para conversão de texto em fala Kokoro-82M com suporte multiplataforma para CPU, AMD, GPU NVIDIA PyTorch; vários locutores, mesclagem de voz, junção automática, carimbos de data/hora de legendas, SSML e interface web de leitura.
★ 5.399+19Variação de estrelas nos últimos 7 dias - #35
DiffSinger: Síntese de voz cantada via mecanismo de difusão superficial (SVS e TTS); AAAI 2022; código oficial
★ 4.855+3Variação de estrelas nos últimos 7 dias - #36★ 4.624+0Variação de estrelas nos últimos 7 dias
- #37
Uma implementação quase em tempo real do Whisper da OpenAI.
★ 4.246+3Variação de estrelas nos últimos 7 dias - #38
Modelo fundamental para TTS expressivo e semelhante ao humano.
★ 4.203-1Variação de estrelas nos últimos 7 dias - #39
A família MOSS‑TTS é uma família de modelos de geração de fala e som open source da MOSI.AI e da equipe OpenMOSS. Projetada para alta fidelidade, alta expressividade e cenários complexos do mundo real, cobrindo fala longa estável, diálogo multi-falante, design de voz/personagem, efeitos sonoros ambientais e TTS de streaming em tempo real.
★ 4.058+18Variação de estrelas nos últimos 7 dias - #40
Converte texto em fala em tempo real.
★ 4.021+2Variação de estrelas nos últimos 7 dias - #41
:stuck_out_tongue_closed_eyes: TensorFlowTTS: Síntese de fala de última geração em tempo real para o TensorFlow 2 (suporta inglês, francês, coreano, chinês, alemão e é fácil de adaptar para outros idiomas)
★ 3.996+0Variação de estrelas nos últimos 7 dias - #42
Uma ferramenta de conversão de voz simples e de alta qualidade, focada em facilidade de uso e desempenho.
★ 3.674+14Variação de estrelas nos últimos 7 dias - #43
Uma WebUI única em Gradio + React com extensões para ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T e Bark!
★ 3.250+5Variação de estrelas nos últimos 7 dias - #44
O SDK oficial em Python para a API do ElevenLabs.
★ 3.083+2Variação de estrelas nos últimos 7 dias - #45
[AutoArk] GPA (General Purpose Audio) pode realizar ASR, TTS e conversão de voz com um único modelo compacto!
★ 3.061+164Variação de estrelas nos últimos 7 dias - #46
aeneas é uma biblioteca em Python/C e um conjunto de ferramentas para sincronizar automaticamente áudio e texto (também conhecido como forced alignment)
★ 2.862+0Variação de estrelas nos últimos 7 dias - #47★ 2.818+1Variação de estrelas nos últimos 7 dias
- #48
Biblioteca Python e ferramenta CLI para interagir com a API de conversão de texto em fala do Google Translate
★ 2.628+0Variação de estrelas nos últimos 7 dias - #49
Implantação com um clique (incluindo pacote offline)! Baseado em ChatTTS, suporta saída em streaming, seleção de voz, geração de áudio longo e leitura por personagens. Simples e fácil de usar, sem necessidade de instalação complexa.
★ 2.593+0Variação de estrelas nos últimos 7 dias - #50
MARY TTS: um sistema de síntese de voz multilingue de código aberto escrito em Java puro
★ 2.583+0Variação de estrelas nos últimos 7 dias - #51★ 2.530+0Variação de estrelas nos últimos 7 dias
- #52
TTS em vietnamita com clonagem de voz instantânea • No dispositivo • Inferência de CPU em tempo real • Qualidade de áudio de 24kHz.
★ 2.468+21Variação de estrelas nos últimos 7 dias - #53
Um runtime de voz em tempo real que mantém agentes falando, trabalhando e presentes. Runtime de voz em tempo real para agentes de IA
★ 2.379+72Variação de estrelas nos últimos 7 dias - #54
HiFi-GAN: Redes Adversárias Generativas para síntese de fala eficiente e de alta fidelidade
★ 2.367+0Variação de estrelas nos últimos 7 dias - #55
Implementação em PyTorch do VALL-E (Text-To-Speech Zero-Shot), demo reproduzido em https://lifeiteng.github.io/valle/index.html
★ 2.215+0Variação de estrelas nos últimos 7 dias - #56
Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.
★ 2.214+115Variação de estrelas nos últimos 7 dias - #57
Conversão de texto em fala rápida e controlável para mais de 7000 idiomas!
★ 2.207-1Variação de estrelas nos últimos 7 dias - #58
Endpoint de API de conversão de texto em fala gratuito e de alta qualidade para substituir OpenAI, Azure ou ElevenLabs
★ 2.075+5Variação de estrelas nos últimos 7 dias - #59
IA multimodal em tempo real executada no dispositivo, com recursos semelhantes ao GPT-Live.
★ 2.048+7Variação de estrelas nos últimos 7 dias - #60
Kit de ferramentas de produção de vídeo nativo em IA para Claude Code.
★ 2.036+15Variação de estrelas nos últimos 7 dias