text-to-speech
Repositórios de código aberto acompanhados marcados com text-to-speech, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de text-to-speech no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com text-to-speech.
- #1
Um runtime de voz em tempo real que mantém agentes falando, trabalhando e presentes. Runtime de voz em tempo real para agentes de IA
★ 2.379 - #2
Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.
★ 2.214 - #3
Editor de vídeo open-source e local-first onde criadores e agentes de IA editam a mesma linha do tempo real.
★ 798 - #4
Ferramenta de tradução de tela em tempo real para Android de código aberto e sem root, ideal para jogos, romances visuais e mangás. Suporta OCR local e em nuvem, LLMs offline, vários serviços de tradução e conversão de texto em fala (TTS), com traduções exibidas diretamente na tela.
★ 794 - #5
Ditado por voz ultrarrápido, gratuito, local e com transcrição no próprio dispositivo para macOS
★ 544
- #1
Gere vídeos curtos em HD a partir de um tópico ou palavra-chave com um fluxo de trabalho automatizado de IA, utilizando modelos de IA de grande escala e automação.
★ 119.977+0Variação de estrelas nos últimos 7 dias - #2
Interface de usuário local para executar e treinar LLMs e modelos de difusão, incluindo Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX e muito mais.
★ 75.515+0Variação de estrelas nos últimos 7 dias - #3
1 minuto de dados de voz também pode ser usado para treinar um bom modelo de TTS! (clonagem de voz com poucos exemplos)
★ 61.476+0Variação de estrelas nos últimos 7 dias - #4
O primeiro sistema de produção de vídeo agêntico e de código aberto do mundo. 12 pipelines de produção, mais de 100 ferramentas, mais de 700 arquivos de habilidades de agentes e conhecimento de produção. Transforme seu assistente de codificação de IA em um estúdio completo de produção de vídeo.
★ 55.719+0Variação de estrelas nos últimos 7 dias - #5
🐸💬 - um conjunto de ferramentas de deep learning para conversão de texto em fala (Text-to-Speech), testado em pesquisa e produção
★ 45.985+0Variação de estrelas nos últimos 7 dias - #6★ 39.814+0Variação de estrelas nos últimos 7 dias
- #7★ 37.419+0Variação de estrelas nos últimos 7 dias
- #8
🚀Clone uma voz em 5 segundos para gerar fala arbitrária em tempo real
★ 36.912+0Variação de estrelas nos últimos 7 dias - #9
VoxCPM2: TTS sem tokenizador para geração de fala multilíngue, design de voz criativo e clonagem realista
★ 36.595+0Variação de estrelas nos últimos 7 dias - #10
Um Sistema de Conversão de Texto em Fala Zero-Shot Controlável e Eficiente em Nível Industrial
★ 23.686+0Variação de estrelas nos últimos 7 dias - #11
Modelo multilíngue de geração de voz de grande escala, oferecendo capacidade full-stack de inferência, treinamento e implantação.
★ 23.426+0Variação de estrelas nos últimos 7 dias - #12★ 19.387+0Variação de estrelas nos últimos 7 dias
- #13
Traduza vídeos de um idioma para outro e incorpore dublagem e legendas.
★ 18.871+0Variação de estrelas nos últimos 7 dias - #14★ 17.476+0Variação de estrelas nos últimos 7 dias
- #15
VoiceStudio é a alternativa ao ElevenLabs de código aberto e totalmente local — clonagem de voz, design de voz, dublagem de vídeo, ditado, transcrição e criação de audiolivros em 646 idiomas.
★ 14.835+0Variação de estrelas nos últimos 7 dias - #16
Speech-to-text, text-to-speech, diarização de locutor, aprimoramento de fala, separação de fontes e VAD usando a próxima geração do Kaldi com onnxruntime sem conexão com a Internet. Suporte a sistemas embarcados, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket e 12 linguagens de programação
★ 14.575+0Variação de estrelas nos últimos 7 dias - #17
TTS multilíngue, ultrarrápido e on-device, executado nativamente via ONNX.
★ 13.757+0Variação de estrelas nos últimos 7 dias - #18
Interface Web Gradio para criadores e desenvolvedores, apresentando TTS (Edge-TTS, kokoro) e clonagem de voz zero-shot (E2 & F5-TTS, CosyVoice), com processamento de áudio Whisper, download do YouTube, isolamento vocal Demucs e tradução multilíngue.
★ 12.730+0Variação de estrelas nos últimos 7 dias - #19
Use o serviço de conversão de texto em fala online do Microsoft Edge a partir do Python, sem precisar do Microsoft Edge, Windows ou de uma chave de API.
★ 11.847+0Variação de estrelas nos últimos 7 dias - #20
Amphion (/æmˈfaɪən/) é um kit de ferramentas para geração de áudio, música e fala. Seu objetivo é apoiar pesquisas reprodutíveis e ajudar pesquisadores e engenheiros iniciantes a começar na área de pesquisa e desenvolvimento de geração de áudio, música e fala.
★ 10.276+0Variação de estrelas nos últimos 7 dias - #21★ 9.949+0Variação de estrelas nos últimos 7 dias
- #22
EmotiVoice 😊: um motor de TTS multivoz e controlado por prompt.
★ 8.522+0Variação de estrelas nos últimos 7 dias - #23
Uma biblioteca de text-to-speech (TTS), speech-to-text (STT) e speech-to-speech (STS) construída sobre o framework MLX da Apple, oferecendo análise de fala eficiente em Apple Silicon.
★ 7.826+0Variação de estrelas nos últimos 7 dias - #24
Biblioteca de conversão de texto em fala multilíngue de alta qualidade da MyShell.ai. Suporta inglês, espanhol, francês, chinês, japonês e coreano.
★ 7.616+0Variação de estrelas nos últimos 7 dias - #25
eSpeak NG é um sintetizador de voz de código aberto que suporta mais de cem idiomas e sotaques.
★ 6.802+0Variação de estrelas nos últimos 7 dias - #26
IA de fala executada localmente no dispositivo para Apple Silicon
★ 6.353+0Variação de estrelas nos últimos 7 dias - #27
StyleTTS 2: Rumo à conversão de texto em fala de nível humano através de difusão de estilo e treinamento adversarial com grandes modelos de linguagem de fala
★ 6.342+0Variação de estrelas nos últimos 7 dias - #28
Este repositório contém recursos selecionados manualmente para Prompt Engineering com foco em Generative Pre-trained Transformer (GPT), ChatGPT, PaLM, etc.
★ 6.306+0Variação de estrelas nos últimos 7 dias - #29
Silero Models: modelos de conversão de texto em fala pré-treinados feitos de forma extremamente simples
★ 6.084+0Variação de estrelas nos últimos 7 dias - #30
Transforme seu PC, Mac ou Linux em um servidor de IA. Inferência de LLM, interface de chat, voz, agentes, fluxos de trabalho, RAG e geração de imagens.
★ 5.931+0Variação de estrelas nos últimos 7 dias