tts
Repositórios de código aberto acompanhados marcados com tts, ordenados por estrelas.
- #121
Gerador de audiolivros com múltiplas vozes impulsionado por IA — anotação de script por LLM, clonagem de voz, design de voz, treinamento LoRA, controle de estilo por linha e exportação para MP3, M4B com capítulos ou multifaixa para Audacity. Construído sobre o Qwen3-TTS.
★ 995+16Variação de estrelas nos últimos 7 dias - #122
🧸 Lobe Vidol - Tornando ídolos virtuais acessíveis a todos
★ 986+1Variação de estrelas nos últimos 7 dias - #123
Um poderoso modelo de áudio de aprendizado por reforço baseado em LLM de 3B parâmetros que se destaca na edição de Emoção, estilo de fala e paralinguística, e apresenta robusta conversão de texto em fala zero-shot
★ 972+2Variação de estrelas nos últimos 7 dias - #124★ 970+2Variação de estrelas nos últimos 7 dias
- #125★ 955-1Variação de estrelas nos últimos 7 dias
- #126
O hub para pesquisa de IA de áudio: artigos, modelos abertos, benchmarks e datasets sobre LLMs de áudio, reconhecimento de fala, TTS, música e geração de áudio.
★ 953+3Variação de estrelas nos últimos 7 dias - #127
Tornar as vozes TTS naturais do Azure acessíveis a qualquer aplicativo compatível com SAPI 5.
★ 933+12Variação de estrelas nos últimos 7 dias - #128
Um sistema TTS de base potencializado por LLM de código aberto
★ 921+2Variação de estrelas nos últimos 7 dias - #129
Caixa de ferramentas de algoritmos de IA offline gratuita em Java, suporta reconhecimento facial, deteção de vivacidade, reconhecimento de expressões, deteção de objetos, segmentação de instâncias, deteção de pedestres, reconhecimento de texto OCR, reconhecimento de matrículas, reconhecimento de tabelas, ASR+TTS, tradução automática e outras funções, disponível através de dependência Maven. Suporta PyTorch e TensorFlow, com modelos principais integrados como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) e Whisper
★ 908+3Variação de estrelas nos últimos 7 dias - #130
Um framework de atendimento de modelos ML de alto desempenho, oferece loteamento dinâmico e pipelines de CPU/GPU para explorar totalmente sua máquina de computação
★ 902+0Variação de estrelas nos últimos 7 dias - #131
Interface web para usar o XTTS e realizar seu ajuste fino.
★ 895+0Variação de estrelas nos últimos 7 dias - #132
DiffWave é um vocoder neural rápido e de alta qualidade e sintetizador de formas de onda.
★ 885+0Variação de estrelas nos últimos 7 dias - #133
Transforme PDFs em podcasts de IA para conteúdos de áudio envolventes em movimento.
★ 875+1Variação de estrelas nos últimos 7 dias - #134
Um kit de ferramentas amigável para reconhecimento/transcrição/conversão de voz, etc. | Caixa de ferramentas de voz simples e fácil de usar
★ 873+0Variação de estrelas nos últimos 7 dias - #135★ 867+1Variação de estrelas nos últimos 7 dias
- #136
A solução de integração de IA mais simples e de menor custo. Se você gosta deste projeto, por favor, dê uma estrela~
★ 856+2Variação de estrelas nos últimos 7 dias - #137
SumatraPDF fork: Chinese EPUB/MOBI, smart PDF dark mode, OCR, TTS, offline dictionary.
★ 825+12Variação de estrelas nos últimos 7 dias - #138
Voxtral ASR & TTS rodando nativamente e no navegador. Uma implementação em Rust do Voxtral mini realtime ASR / TTS do Mistral usando o framework Burn ML
★ 819+2Variação de estrelas nos últimos 7 dias - #139
🔥🔥 Kokoro em Rust. https://huggingface.co/hexgrad/Kokoro-82M TTS insanamente rápido em tempo real com a mais alta qualidade que você já viu.
★ 816+0Variação de estrelas nos últimos 7 dias - #140
Converta qualquer repositório git em um podcast envolvente
★ 815+0Variação de estrelas nos últimos 7 dias - #141
Leitor de eBook no terminal com conversão de texto em fala de qualidade de audiolivro — Suporta EPUB, PDF, DOCX, HTML, RTF, TXT e MD.
★ 806+2Variação de estrelas nos últimos 7 dias - #142
🎤 Lobe TTS - Uma biblioteca TTS/STT confiável e de alta qualidade para servidor e navegador.
★ 805+1Variação de estrelas nos últimos 7 dias - #143
Um motor de Text-to-Speech (TTS) leve e offline para Android, que permite clonagem de voz integrada em todo o sistema e leitura de texto em alta fidelidade.
★ 803+4Variação de estrelas nos últimos 7 dias - #144
AI VTuber com LLM, ASR, TTS, OCR, CV e mais tecnologias para fazer transmissão ao vivo ou jogar Minecraft com você.
★ 802+4Variação de estrelas nos últimos 7 dias - #145
Fala para Texto para Fala. Música tocando agora. Envia texto como mensagens OSC para o VRChat para exibir no avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 802+3Variação de estrelas nos últimos 7 dias - #146
Confucius4-TTS: um mecanismo de TTS multilíngue e interlíngue do tipo zero-shot
★ 793+9Variação de estrelas nos últimos 7 dias - #147
Um SDK modular em Swift para processamento de áudio com MLX em Apple Silicon
★ 772+6Variação de estrelas nos últimos 7 dias - #148★ 763+1Variação de estrelas nos últimos 7 dias
- #149
Ferramenta de tradução de tela em tempo real para Android de código aberto e sem root, ideal para jogos, romances visuais e mangás. Suporta OCR local e em nuvem, LLMs offline, vários serviços de tradução e conversão de texto em fala (TTS), com traduções exibidas diretamente na tela.
★ 757+71Variação de estrelas nos últimos 7 dias - #150
Assistente de voz em tempo real — streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatível com a API Realtime da OpenAI. Clonagem de voz, interrupção (barge-in), ~9× em tempo real em uma 4090. Apache 2.0.
★ 756+9Variação de estrelas nos últimos 7 dias