Pular para o conteúdo principal
buildradar
Entrar
Tópico · text-to-speech

text-to-speech

Repositórios de código aberto acompanhados marcados com text-to-speech, ordenados por estrelas.

150 repositórios
  • TTS-Audio-Suite@diodiogod

    Uma integração de nó personalizado do ComfyUI para conversão de texto em fala e voz local com múltiplos motores e idiomas. Suporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clássico e multilíngue), F5-TTS, Higgs Audio 2, 3 e VibeVoice com comprimento de texto ilimitado, temporização SRT, suporte a personagens e muitas ferramentas de áudio

    1.187+0Variação de estrelas nos últimos 7 dias
  • Um laboratório prático para construir, testar e avaliar aplicativos com o framework de modelos de fundação da Apple.

    1.178+0Variação de estrelas nos últimos 7 dias
  • dia2@nari-labs

    Modelo de TTS capaz de transmitir áudio conversacional em tempo real.

    1.173+0Variação de estrelas nos últimos 7 dias
  • speech-swift@soniqo

    Toolkit de fala de IA para Apple Silicon — ASR, TTS, speech-to-speech, VAD e diarização alimentados por MLX e CoreML

    1.161+0Variação de estrelas nos últimos 7 dias
  • O sistema de auto-codificação para seu aplicativo — SDK Alan AI para Cordova.

    1.132+0Variação de estrelas nos últimos 7 dias
  • Uncensored-Local-Studio@techjarves

    Estúdio de IA local sem censura para Windows, Linux e macOS. Interface gráfica de configuração zero para geração de imagens, LLMs GGUF, conversão de texto em fala e de fala em texto

    1.118+13Variação de estrelas nos últimos 7 dias
  • sglang-omni@sgl-project

    O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.

    1.118+56Variação de estrelas nos últimos 7 dias
  • Patter@PatterAI

    SDK de IA de voz open-source. A alternativa ao Vapi/Retell para desenvolvedores que desejam ser donos da stack. Dê ao seu agente de IA um número de telefone em 4 linhas — Python e TypeScript, licenciado sob MIT, com suporte a Twilio, Telnyx e Plivo.

    1.051+7Variação de estrelas nos últimos 7 dias
  • Cognitive-Speech-TTS@Azure-Samples

    Código de exemplo da API de conversão de texto em fala da Microsoft em várias linguagens, parte dos Cognitive Services.

    1.014+1Variação de estrelas nos últimos 7 dias
  • alexandria-audiobook@Finrandojin

    Gerador de audiolivros com múltiplas vozes impulsionado por IA — anotação de script por LLM, clonagem de voz, design de voz, treinamento LoRA, controle de estilo por linha e exportação para MP3, M4B com capítulos ou multifaixa para Audacity. Construído sobre o Qwen3-TTS.

    1.000+10Variação de estrelas nos últimos 7 dias
  • Step-Audio-EditX@stepfun-ai

    Um poderoso modelo de áudio de aprendizado por reforço baseado em LLM de 3B parâmetros que se destaca na edição de Emoção, estilo de fala e paralinguística, e apresenta robusta conversão de texto em fala zero-shot

    973+1Variação de estrelas nos últimos 7 dias
  • NISQA@gabrielmittag

    NISQA - Avaliação não intrusiva da qualidade de fala e naturalidade de TTS.

    972+4Variação de estrelas nos últimos 7 dias
  • botium-speech-processing@codeforequity-at

    Processamento de Fala Botium

    943+0Variação de estrelas nos últimos 7 dias
  • Tornar as vozes TTS naturais do Azure acessíveis a qualquer aplicativo compatível com SAPI 5.

    934+7Variação de estrelas nos últimos 7 dias
  • Cliente da API REST da Vonage para PHP. Suporte de API para SMS, Voz, Text-to-Speech, Números, Verificação (2FA) e mais.

    931-1Variação de estrelas nos últimos 7 dias
  • FireRedTTS@FireRedTeam

    Um sistema TTS de base potencializado por LLM de código aberto

    919-1Variação de estrelas nos últimos 7 dias
  • EDDiscovery@EDDiscovery

    Registro de capitão e mapa estelar 3D para Elite Dangerous

    900+4Variação de estrelas nos últimos 7 dias
  • diffwave@lmnt-com

    DiffWave é um vocoder neural rápido e de alta qualidade e sintetizador de formas de onda.

    884-1Variação de estrelas nos últimos 7 dias
  • bark.cpp@PABannier

    Modelo Bark da Suno AI em C/C++ para geração rápida de texto para fala.

    868+2Variação de estrelas nos últimos 7 dias
  • lobe-tts@lobehub

    🎤 Lobe TTS - Uma biblioteca TTS/STT confiável e de alta qualidade para servidor e navegador.

    805-1Variação de estrelas nos últimos 7 dias
  • lue@paulilaaso

    Leitor de eBook no terminal com conversão de texto em fala de qualidade de audiolivro — Suporta EPUB, PDF, DOCX, HTML, RTF, TXT e MD.

    805+1Variação de estrelas nos últimos 7 dias
  • CloneTTS@sipeter

    Um motor de Text-to-Speech (TTS) leve e offline para Android, que permite clonagem de voz integrada em todo o sistema e leitura de texto em alta fidelidade.

    804+5Variação de estrelas nos últimos 7 dias
  • Fala para Texto para Fala. Música tocando agora. Envia texto como mensagens OSC para o VRChat para exibir no avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)

    804+5Variação de estrelas nos últimos 7 dias
  • ai-video-editor@MartinDelophy

    Editor de vídeo open-source e local-first onde criadores e agentes de IA editam a mesma linha do tempo real.

    798+82Variação de estrelas nos últimos 7 dias
  • Confucius4-TTS@netease-youdao

    Confucius4-TTS: um mecanismo de TTS multilíngue e interlíngue do tipo zero-shot

    794+6Variação de estrelas nos últimos 7 dias
  • Ferramenta de tradução de tela em tempo real para Android de código aberto e sem root, ideal para jogos, romances visuais e mangás. Suporta OCR local e em nuvem, LLMs offline, vários serviços de tradução e conversão de texto em fala (TTS), com traduções exibidas diretamente na tela.

    794+73Variação de estrelas nos últimos 7 dias
  • june@mezbaul-h

    Chatbot de voz local para conversas envolventes, utilizando Ollama, Hugging Face Transformers e Coqui TTS Toolkit.

    788+1Variação de estrelas nos últimos 7 dias
  • mlx-audio-swift@Blaizzy

    Um SDK modular em Swift para processamento de áudio com MLX em Apple Silicon

    774+5Variação de estrelas nos últimos 7 dias
  • vui@fluxions-ai

    Assistente de voz em tempo real — streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatível com a API Realtime da OpenAI. Clonagem de voz, interrupção (barge-in), ~9× em tempo real em uma 4090. Apache 2.0.

    759+7Variação de estrelas nos últimos 7 dias
  • cboard@cboard-org

    Sistema de Comunicação Aumentativa e Alternativa (CAA) com conversão de texto em fala para o navegador.

    756+9Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos