tts
Repositórios de código aberto acompanhados marcados com tts, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de tts no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com tts.
- #1
Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.
★ 2.214 - #2
Transforme um tópico em um vídeo explicativo ou publicitário estilo Vox com colagem de papel — automatizado de ponta a ponta no Atlas Cloud + ffmpeg. Uma habilidade de agente.
★ 1.698 - #3
SumatraPDF fork: Chinese EPUB/MOBI, smart PDF dark mode, OCR, TTS, offline dictionary.
★ 828 - #4
Ferramenta de tradução de tela em tempo real para Android de código aberto e sem root, ideal para jogos, romances visuais e mangás. Suporta OCR local e em nuvem, LLMs offline, vários serviços de tradução e conversão de texto em fala (TTS), com traduções exibidas diretamente na tela.
★ 768 - #5
Transforme seu agente de codificação em um estúdio de vídeo: descreva um vídeo em linguagem simples, e seu agente escreve a linha do tempo e produz o arquivo.
★ 525
- #1
Interface de usuário local para executar e treinar LLMs e modelos de difusão, incluindo Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX e muito mais.
★ 75.515+337Variação de estrelas nos últimos 7 dias - #2
1 minuto de dados de voz também pode ser usado para treinar um bom modelo de TTS! (clonagem de voz com poucos exemplos)
★ 61.476+138Variação de estrelas nos últimos 7 dias - #3
Clone uma voz em 5 segundos para gerar fala arbitrária em tempo real
★ 60.117-4Variação de estrelas nos últimos 7 dias - #4
LocalAI é o motor de IA de código aberto. Execute qualquer modelo - LLMs, visão, voz, imagem, vídeo - em qualquer hardware. Não é necessário GPU.
★ 48.833+84Variação de estrelas nos últimos 7 dias - #5
🐸💬 - um conjunto de ferramentas de deep learning para conversão de texto em fala (Text-to-Speech), testado em pesquisa e produção
★ 45.985+18Variação de estrelas nos últimos 7 dias - #6★ 39.814+9Variação de estrelas nos últimos 7 dias
- #7★ 37.419+61Variação de estrelas nos últimos 7 dias
- #8
🚀Clone uma voz em 5 segundos para gerar fala arbitrária em tempo real
★ 36.912+0Variação de estrelas nos últimos 7 dias - #9
VoxCPM2: TTS sem tokenizador para geração de fala multilíngue, design de voz criativo e clonagem realista
★ 36.595+345Variação de estrelas nos últimos 7 dias - #10
TTS de código aberto SOTA
★ 32.510+52Variação de estrelas nos últimos 7 dias - #11
🚀 Motor de vídeo curto totalmente automatizado por IA | AI Fully Automated Short Video Engine
★ 27.702+236Variação de estrelas nos últimos 7 dias - #12★ 27.657+96Variação de estrelas nos últimos 7 dias
- #13
Readest é um leitor de e-books moderno e rico em recursos, projetado para leitores ávidos, oferecendo acesso multiplataforma contínuo, ferramentas poderosas e uma interface intuitiva para elevar sua experiência de leitura.
★ 24.008+138Variação de estrelas nos últimos 7 dias - #14
Um Sistema de Conversão de Texto em Fala Zero-Shot Controlável e Eficiente em Nível Industrial
★ 23.686+109Variação de estrelas nos últimos 7 dias - #15
Modelo multilíngue de geração de voz de grande escala, oferecendo capacidade full-stack de inferência, treinamento e implantação.
★ 23.426+359Variação de estrelas nos últimos 7 dias - #16
Gere audiolivros a partir de e-books, com clonagem de voz e mais de 1158 idiomas!
★ 20.097+34Variação de estrelas nos últimos 7 dias - #17
Um software multiplataforma para tradução e reconhecimento de texto.
★ 19.408+28Variação de estrelas nos últimos 7 dias - #18
Um framework de IA generativa escalável criado para pesquisadores e desenvolvedores que trabalham com Grandes Modelos de Linguagem, Multimodal e IA de Voz (Reconhecimento Automático de Fala e Conversão de Texto em Fala)
★ 18.379+21Variação de estrelas nos últimos 7 dias - #19
VoiceStudio é a alternativa ao ElevenLabs de código aberto e totalmente local — clonagem de voz, design de voz, dublagem de vídeo, ditado, transcrição e criação de audiolivros em 646 idiomas.
★ 14.835+2.880Variação de estrelas nos últimos 7 dias - #20
TTS multilíngue, ultrarrápido e on-device, executado nativamente via ONNX.
★ 13.757+20Variação de estrelas nos últimos 7 dias - #21
Interface Web Gradio para criadores e desenvolvedores, apresentando TTS (Edge-TTS, kokoro) e clonagem de voz zero-shot (E2 & F5-TTS, CosyVoice), com processamento de áudio Whisper, download do YouTube, isolamento vocal Demucs e tradução multilíngue.
★ 12.730+54Variação de estrelas nos últimos 7 dias - #22
Kit de ferramentas de fala fácil de usar, incluindo modelo de aprendizado autossupervisionado, ASR SOTA/Streaming com pontuação, TTS de streaming com frontend de texto, sistema de verificação de locutor, tradução de fala de ponta a ponta e detecção de palavras-chave. Vencedor do prêmio NAACL2022 Best Demo.
★ 12.676+5Variação de estrelas nos últimos 7 dias - #23
Use o serviço de conversão de texto em fala online do Microsoft Edge a partir do Python, sem precisar do Microsoft Edge, Windows ou de uma chave de API.
★ 11.847+29Variação de estrelas nos últimos 7 dias - #24
Ferramenta de tradução e dublagem de vídeo por IA para humanos e agentes de IA, impulsionada por LLMs. Pipeline completo: download, transcrição, tradução, dublagem TTS, reformatação, geração de capa. Mais de 100 idiomas, otimizado para YouTube, TikTok, Bilibili, Douyin e outros.
★ 11.333+46Variação de estrelas nos últimos 7 dias - #25
Conversão de fala para texto, reconhecimento de intenção e conversão de texto para fala com latência muito baixa, para a criação de agentes e interfaces de voz
★ 10.997+33Variação de estrelas nos últimos 7 dias - #26
Plataforma de engenharia de agentes de IA construída sobre um framework de agentes de IA TypeScript de código aberto.
★ 10.529+80Variação de estrelas nos últimos 7 dias - #27
Backbone VITS2 com multilingual-bert
★ 8.794-3Variação de estrelas nos últimos 7 dias - #28
EmotiVoice 😊: um motor de TTS multivoz e controlado por prompt.
★ 8.522-1Variação de estrelas nos últimos 7 dias - #29★ 8.479+9Variação de estrelas nos últimos 7 dias
- #30
Open Vision Agents da Stream. Crie agentes de voz e visão rapidamente com qualquer modelo ou provedor de vídeo. Utiliza a rede de borda da Stream para latência ultrabaixa.
★ 8.113+9Variação de estrelas nos últimos 7 dias