tts
Repositórios de código aberto acompanhados marcados com tts, ordenados por estrelas.
- #61
Leitor de e-books multiplataforma com IA, busca semântica, chat RAG, armazenamento vetorial local, notas, TTS e sincronização via WebDAV.
★ 2.305+24Variação de estrelas nos últimos 7 dias - #62
Ferramenta open-source de conversão de texto em fala (TTS), suporta textos longos e múltiplas vozes.
★ 2.296+7Variação de estrelas nos últimos 7 dias - #63
Implementação em PyTorch do VALL-E (Text-To-Speech Zero-Shot), demo reproduzido em https://lifeiteng.github.io/valle/index.html
★ 2.215+0Variação de estrelas nos últimos 7 dias - #64
Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.
★ 2.214+115Variação de estrelas nos últimos 7 dias - #65
Conversão de texto em fala rápida e controlável para mais de 7000 idiomas!
★ 2.207-1Variação de estrelas nos últimos 7 dias - #66
Endpoint de API de conversão de texto em fala gratuito e de alta qualidade para substituir OpenAI, Azure ou ElevenLabs
★ 2.075+5Variação de estrelas nos últimos 7 dias - #67
Conversor de EPUB para audiolivro, otimizado para Audiobookshelf, com interface web incluída.
★ 2.064+1Variação de estrelas nos últimos 7 dias - #68
Brinquedos de IA de voz em tempo real com mais de 100 modelos no Arduino ESP32, com WebSockets seguros e Edge Functions para companheiros e dispositivos de IA.
★ 1.938+5Variação de estrelas nos últimos 7 dias - #69
Gerenciamento do Yandex Station e outros dispositivos de casa inteligente com Alice a partir do Home Assistant
★ 1.917-1Variação de estrelas nos últimos 7 dias - #70★ 1.912+1Variação de estrelas nos últimos 7 dias
- #71
Workflow-to-APP, ScreenShare & FloatingVideo, GPT & 3D, SpeechRecognition & TTS
★ 1.861-2Variação de estrelas nos últimos 7 dias - #72★ 1.836+1Variação de estrelas nos últimos 7 dias
- #73
Uma ferramenta CLI de conversão de texto em fala usando o modelo Kokoro, suportando múltiplos idiomas, vozes (com mesclagem) e vários formatos de entrada, incluindo livros EPUB e documentos PDF.
★ 1.835+14Variação de estrelas nos últimos 7 dias - #74★ 1.760+3Variação de estrelas nos últimos 7 dias
- #75
Bailing é um robô de diálogo por voz semelhante ao GPT-4o, implementado via ASR+LLM+TTS, integrado com grandes modelos como o DeepSeek R1 e openClaw. Um verdadeiro assistente de voz pessoal com latência de até 800ms, capaz de rodar em dispositivos de baixa configuração como Mac e com suporte a interrupções.
★ 1.759+2Variação de estrelas nos últimos 7 dias - #76
Funcionário de geração de vídeo totalmente automatizado por IA | Seu primeiro colega de trabalho AIGC. Converse uma ideia. Obtenha um filme.
★ 1.749+14Variação de estrelas nos últimos 7 dias - #77
Traduz automaticamente o texto de um vídeo com base em um arquivo de legenda e utiliza serviços de voz por IA para criar uma nova trilha de áudio dublada e traduzida, sincronizada com o tempo das legendas.
★ 1.746-1Variação de estrelas nos últimos 7 dias - #78
Transforme um tópico em um vídeo explicativo ou publicitário estilo Vox com colagem de papel — automatizado de ponta a ponta no Atlas Cloud + ffmpeg. Uma habilidade de agente.
★ 1.698+67Variação de estrelas nos últimos 7 dias - #79★ 1.687+4Variação de estrelas nos últimos 7 dias
- #80
Conheça Ava, o agente para WhatsApp
★ 1.675+2Variação de estrelas nos últimos 7 dias - #81
Implementação não oficial de Parallel WaveGAN (+ MelGAN, Multi-band MelGAN, HiFi-GAN e StyleMelGAN) com Pytorch.
★ 1.646+1Variação de estrelas nos últimos 7 dias - #82
Aplicativo Speech Note para Linux. Tomada de notas, leitura e tradução com conversão de fala em texto, texto em fala e tradução automática offline.
★ 1.622+8Variação de estrelas nos últimos 7 dias - #83
Amica é uma interface de código aberto para comunicação interativa com personagens 3D, utilizando síntese de voz e reconhecimento de fala.
★ 1.591-2Variação de estrelas nos últimos 7 dias - #84
Uma integração abrangente do ComfyUI para o modelo de conversão de texto em fala VibeVoice da Microsoft, permitindo síntese de voz de alta qualidade para um ou vários locutores diretamente nos seus fluxos de trabalho do ComfyUI.
★ 1.555+4Variação de estrelas nos últimos 7 dias - #85★ 1.548+60Variação de estrelas nos últimos 7 dias
- #86
Aplicativo assistente Dicio para Android.
★ 1.463+3Variação de estrelas nos últimos 7 dias - #87
Execute LLMs locais como llama, deepseek-distill, kokoro e outros dentro do seu navegador
★ 1.449+1Variação de estrelas nos últimos 7 dias - #88
Um aplicativo Python/Pytorch para sintetizar vozes humanas facilmente
★ 1.440+0Variação de estrelas nos últimos 7 dias - #89★ 1.437+0Variação de estrelas nos últimos 7 dias
- #90
Auto-hospede o poderoso modelo de TTS Chatterbox. Este servidor oferece uma interface web amigável, endpoints de API flexíveis (incluindo compatibilidade com OpenAI), vozes predefinidas, clonagem de voz e processamento de texto em escala de audiolivros. Executa com aceleração em NVIDIA (CUDA), AMD (ROCm) e CPU.
★ 1.427+1Variação de estrelas nos últimos 7 dias