voice-cloning
Repositórios de código aberto acompanhados marcados com voice-cloning, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de voice-cloning no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com voice-cloning.
- #1
1 minuto de dados de voz também pode ser usado para treinar um bom modelo de TTS! (clonagem de voz com poucos exemplos)
★ 61.476+138Variação de estrelas nos últimos 7 dias - #2
Clone uma voz em 5 segundos para gerar fala arbitrária em tempo real
★ 60.117-4Variação de estrelas nos últimos 7 dias - #3
🐸💬 - um conjunto de ferramentas de deep learning para conversão de texto em fala (Text-to-Speech), testado em pesquisa e produção
★ 45.985+18Variação de estrelas nos últimos 7 dias - #4
VoxCPM2: TTS sem tokenizador para geração de fala multilíngue, design de voz criativo e clonagem realista
★ 36.595+345Variação de estrelas nos últimos 7 dias - #5
Modelo multilíngue de geração de voz de grande escala, oferecendo capacidade full-stack de inferência, treinamento e implantação.
★ 23.426+359Variação de estrelas nos últimos 7 dias - #6
Gere audiolivros a partir de e-books, com clonagem de voz e mais de 1158 idiomas!
★ 20.097+34Variação de estrelas nos últimos 7 dias - #7
Corte, tradução, alinhamento e até dublagem de legendas em nível Netflix - equipe de legendagem de vídeo por IA totalmente automatizada com um clique
★ 18.339+49Variação de estrelas nos últimos 7 dias - #8
VoiceStudio é a alternativa ao ElevenLabs de código aberto e totalmente local — clonagem de voz, design de voz, dublagem de vídeo, ditado, transcrição e criação de audiolivros em 646 idiomas.
★ 14.835+2.880Variação de estrelas nos últimos 7 dias - #9
Interface Web Gradio para criadores e desenvolvedores, apresentando TTS (Edge-TTS, kokoro) e clonagem de voz zero-shot (E2 & F5-TTS, CosyVoice), com processamento de áudio Whisper, download do YouTube, isolamento vocal Demucs e tradução multilíngue.
★ 12.730+54Variação de estrelas nos últimos 7 dias - #10
Kit de ferramentas de fala fácil de usar, incluindo modelo de aprendizado autossupervisionado, ASR SOTA/Streaming com pontuação, TTS de streaming com frontend de texto, sistema de verificação de locutor, tradução de fala de ponta a ponta e detecção de palavras-chave. Vencedor do prêmio NAACL2022 Best Demo.
★ 12.676+5Variação de estrelas nos últimos 7 dias - #11
YuE: Modelo fundamental de geração de músicas completas, similar ao Suno.ai, porém aberto.
★ 6.416+8Variação de estrelas nos últimos 7 dias - #12
Ferramenta de código aberto para localização de vídeos por IA: automatiza o download de vídeos do YouTube/Bilibili, reconhecimento e tradução de legendas, clonagem de voz, mixagem de áudio e gravação de legendas.
★ 5.404+25Variação de estrelas nos últimos 7 dias - #13
A família MOSS‑TTS é uma família de modelos de geração de fala e som open source da MOSI.AI e da equipe OpenMOSS. Projetada para alta fidelidade, alta expressividade e cenários complexos do mundo real, cobrindo fala longa estável, diálogo multi-falante, design de voz/personagem, efeitos sonoros ambientais e TTS de streaming em tempo real.
★ 4.058+18Variação de estrelas nos últimos 7 dias - #14
Uma ferramenta de conversão de voz simples e de alta qualidade, focada em facilidade de uso e desempenho.
★ 3.674+14Variação de estrelas nos últimos 7 dias - #15★ 2.818+1Variação de estrelas nos últimos 7 dias
- #16
Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.
★ 2.214+115Variação de estrelas nos últimos 7 dias - #17★ 1.760+3Variação de estrelas nos últimos 7 dias
- #18
Servidor oficial do MiniMax Model Context Protocol (MCP) que permite a interação com poderosas APIs de conversão de texto em fala, geração de imagens e geração de vídeo.
★ 1.573+2Variação de estrelas nos últimos 7 dias - #19
Uma integração abrangente do ComfyUI para o modelo de conversão de texto em fala VibeVoice da Microsoft, permitindo síntese de voz de alta qualidade para um ou vários locutores diretamente nos seus fluxos de trabalho do ComfyUI.
★ 1.555+4Variação de estrelas nos últimos 7 dias - #20
Um aplicativo Python/Pytorch para sintetizar vozes humanas facilmente
★ 1.440+0Variação de estrelas nos últimos 7 dias - #21
Auto-hospede o poderoso modelo de TTS Chatterbox. Este servidor oferece uma interface web amigável, endpoints de API flexíveis (incluindo compatibilidade com OpenAI), vozes predefinidas, clonagem de voz e processamento de texto em escala de audiolivros. Executa com aceleração em NVIDIA (CUDA), AMD (ROCm) e CPU.
★ 1.427+1Variação de estrelas nos últimos 7 dias - #22
Uma lista de corpora de fala acessíveis para ASR, TTS e outras tecnologias de fala.
★ 1.399+0Variação de estrelas nos últimos 7 dias - #23
Gerador de podcasts com IA para episódios bilíngues, múltiplos idiomas, alternativa ao NotebookLLM.
★ 1.289-1Variação de estrelas nos últimos 7 dias - #24
Uma WebUI para diferentes redes neurais relacionadas a áudio
★ 1.246+0Variação de estrelas nos últimos 7 dias - #25
Um modelo de conversão de texto em fala baseado em Flow Matching com controle de estilo via emoji
★ 1.228+4Variação de estrelas nos últimos 7 dias - #26
Uma integração de nó personalizado do ComfyUI para conversão de texto em fala e voz local com múltiplos motores e idiomas. Suporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clássico e multilíngue), F5-TTS, Higgs Audio 2, 3 e VibeVoice com comprimento de texto ilimitado, temporização SRT, suporte a personagens e muitas ferramentas de áudio
★ 1.187+7Variação de estrelas nos últimos 7 dias - #27
Servidor de inferência LLM nativo para Apple Silicon. Compatível com a API da OpenAI e Anthropic. Sem Python. Inclui o aplicativo MLX Core para macOS com chat, modo agente e chamada de ferramentas.
★ 1.115+245Variação de estrelas nos últimos 7 dias - #28
Gerador de audiolivros com múltiplas vozes impulsionado por IA — anotação de script por LLM, clonagem de voz, design de voz, treinamento LoRA, controle de estilo por linha e exportação para MP3, M4B com capítulos ou multifaixa para Audacity. Construído sobre o Qwen3-TTS.
★ 999+17Variação de estrelas nos últimos 7 dias - #29
Um poderoso modelo de áudio de aprendizado por reforço baseado em LLM de 3B parâmetros que se destaca na edição de Emoção, estilo de fala e paralinguística, e apresenta robusta conversão de texto em fala zero-shot
★ 972+1Variação de estrelas nos últimos 7 dias - #30
Um motor de Text-to-Speech (TTS) leve e offline para Android, que permite clonagem de voz integrada em todo o sistema e leitura de texto em alta fidelidade.
★ 803+2Variação de estrelas nos últimos 7 dias