tts
Repositórios de código aberto acompanhados marcados com tts, ordenados por estrelas.
- #91
🍦 Speech-AI-Forge é um projeto desenvolvido em torno de modelos de geração TTS, implementando um servidor de API e uma interface web baseada em Gradio.
★ 1.418+0Variação de estrelas nos últimos 7 dias - #92
Tradução sincronizada para vídeos. Dublagem de vídeo
★ 1.413+2Variação de estrelas nos últimos 7 dias - #93
Uma lista de corpora de fala acessíveis para ASR, TTS e outras tecnologias de fala.
★ 1.399+0Variação de estrelas nos últimos 7 dias - #94
Restauração geral de fala.
★ 1.375+0Variação de estrelas nos últimos 7 dias - #95
Uma ferramenta (para Windows) que grava a síntese de voz (TTS) do Microsoft Edge e a exporta como áudio .wav.
★ 1.370+1Variação de estrelas nos últimos 7 dias - #96
[ICASSP 2024] 🍵 Matcha-TTS: Uma arquitetura de TTS rápida com conditional flow matching
★ 1.353+3Variação de estrelas nos últimos 7 dias - #97★ 1.347+6Variação de estrelas nos últimos 7 dias
- #98
Plataforma de gerenciamento empresarial Java para ESP32 Xiaozhi, oferecendo uma solução integrada de front-end, back-end e servidor para monitoramento de dispositivos, personalização de voz, troca de personagens e gerenciamento de histórico de conversas.
★ 1.337+1Variação de estrelas nos últimos 7 dias - #99
Tradução ao passar o mouse para qualquer idioma - Extensão para Chrome: Tradutor de PDF, EBOOK, EPUB, OCR, TTS, NETFLIX, YOUTUBE DUAL SUBTITLES, GOOGLE DOCS, IA, VIEWER, GMAIL, WRITING, IMAGE, DUAL SUBS, MANGA, HOVER, DICTIONARY, WEBTOON, EDGE, JAPONÊS, INGLÊS.
★ 1.305+4Variação de estrelas nos últimos 7 dias - #100
Humano digital interativo em tempo real, com aparência e voz personalizáveis, suporte a clonagem de voz e latência de resposta inicial de até 3s.
★ 1.303-1Variação de estrelas nos últimos 7 dias - #101
StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.
★ 1.288+0Variação de estrelas nos últimos 7 dias - #102
Tradução de voz em tempo real — macOS e Windows, TTS gratuito, sem servidor, usando apenas suas chaves de API.
★ 1.278+2Variação de estrelas nos últimos 7 dias - #103
Uma WebUI para diferentes redes neurais relacionadas a áudio
★ 1.246+0Variação de estrelas nos últimos 7 dias - #104
Um modelo de conversão de texto em fala baseado em Flow Matching com controle de estilo via emoji
★ 1.228+4Variação de estrelas nos últimos 7 dias - #105
TTS de melhores práticas baseado em BERT e VITS com alguns recursos de Natural Speech da Microsoft; suporte a streaming ONNX!
★ 1.226+0Variação de estrelas nos últimos 7 dias - #106★ 1.211+0Variação de estrelas nos últimos 7 dias
- #107
Uma integração de nó personalizado do ComfyUI para conversão de texto em fala e voz local com múltiplos motores e idiomas. Suporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clássico e multilíngue), F5-TTS, Higgs Audio 2, 3 e VibeVoice com comprimento de texto ilimitado, temporização SRT, suporte a personagens e muitas ferramentas de áudio
★ 1.187+7Variação de estrelas nos últimos 7 dias - #108
Tradução de voz bidirecional em tempo real para reuniões bilíngues — detecta automaticamente o idioma falado e traduz em ambas as direções, via nuvem ou totalmente offline no dispositivo. Desktop (Windows · macOS · Linux) + extensão de navegador (Chrome · Edge) para Zoom, Meet, Teams e qualquer aplicativo.
★ 1.186+40Variação de estrelas nos últimos 7 dias - #109
Toolkit de fala de IA para Apple Silicon — ASR, TTS, speech-to-speech, VAD e diarização alimentados por MLX e CoreML
★ 1.161+4Variação de estrelas nos últimos 7 dias - #110
Irina - assistente de voz em russo para uso offline. Suporta habilidades via plugins.
★ 1.153+0Variação de estrelas nos últimos 7 dias - #111
Biblioteca de inferência em C++ para múltiplos SVC/TTS
★ 1.128-1Variação de estrelas nos últimos 7 dias - #112
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 1.118+143Variação de estrelas nos últimos 7 dias - #113
AI Vtuber para streaming no YouTube/Twitch
★ 1.116+1Variação de estrelas nos últimos 7 dias - #114
NobodyWho é um mecanismo de inferência que permite executar LLMs localmente e de forma eficiente em qualquer dispositivo.
★ 1.094+13Variação de estrelas nos últimos 7 dias - #115
GLM-TTS: TTS zero-shot controlável e com expressão emocional usando aprendizado por reforço com múltiplas recompensas.
★ 1.063+7Variação de estrelas nos últimos 7 dias - #116
API gratuita de conversão de texto em fala (TTS) online.
★ 1.058+4Variação de estrelas nos últimos 7 dias - #117
Com um único comando, crie um audiolivro com som natural a partir de vários formatos de entrada (epub, mobi, txt, PDF, HTML e mais!)
★ 1.057+1Variação de estrelas nos últimos 7 dias - #118
YourTTS: Rumo a TTS multi-falante Zero-Shot e conversão de voz Zero-Shot para todos.
★ 1.053+0Variação de estrelas nos últimos 7 dias - #119
Uma API HTTP simples de VITS, desenvolvida estendendo o Moegoe com recursos adicionais.
★ 1.051-1Variação de estrelas nos últimos 7 dias - #120
Código de exemplo da API de conversão de texto em fala da Microsoft em várias linguagens, parte dos Cognitive Services.
★ 1.014+3Variação de estrelas nos últimos 7 dias