tts
Repositórios de código aberto acompanhados marcados com tts, ordenados por estrelas.
- #31
Uma interface web nativa simples que usa o ChatTTS para sintetizar texto em fala, com suporte a interfaces de API externas.
★ 7.648+7Variação de estrelas nos últimos 7 dias - #32
Biblioteca de conversão de texto em fala multilíngue de alta qualidade da MyShell.ai. Suporta inglês, espanhol, francês, chinês, japonês e coreano.
★ 7.616+8Variação de estrelas nos últimos 7 dias - #33
🤖 wukong-robot é um projeto de robô de diálogo por voz/alto-falante inteligente simples, flexível e elegante, que suporta conversas de múltiplos turnos com ChatGPT e pode ser o primeiro projeto de alto-falante inteligente de código aberto a suportar interface cérebro-computador.
★ 7.126+1Variação de estrelas nos últimos 7 dias - #34
StyleTTS 2: Rumo à conversão de texto em fala de nível humano através de difusão de estilo e treinamento adversarial com grandes modelos de linguagem de fala
★ 6.342+6Variação de estrelas nos últimos 7 dias - #35
Rumo a uma fala com sonoridade humana
★ 6.324+10Variação de estrelas nos últimos 7 dias - #36
🎤 Ferramenta de síntese de voz da Microsoft, construída com Electron + Vue + ElementPlus + Vite.
★ 6.103+2Variação de estrelas nos últimos 7 dias - #37
Silero Models: modelos de conversão de texto em fala pré-treinados feitos de forma extremamente simples
★ 6.084+2Variação de estrelas nos últimos 7 dias - #38★ 5.831+59Variação de estrelas nos últimos 7 dias
- #39
Wrapper compatível com OpenAI e empacotado em Docker para conversão de texto em fala Kokoro-82M com suporte multiplataforma para CPU, AMD, GPU NVIDIA PyTorch; vários locutores, mesclagem de voz, junção automática, carimbos de data/hora de legendas, SSML e interface web de leitura.
★ 5.399+25Variação de estrelas nos últimos 7 dias - #40
Um motor de vídeo AIGC de propósito geral: do roteiro ao filme finalizado em um único pipeline — dramas, anúncios, vídeos de produtos, jogos otome e mais.
★ 4.900+537Variação de estrelas nos últimos 7 dias - #41
DiffSinger: Síntese de voz cantada via mecanismo de difusão superficial (SVS e TTS); AAAI 2022; código oficial
★ 4.855+4Variação de estrelas nos últimos 7 dias - #42
Um sistema de conversão de texto em fala de código aberto construído invertendo o Whisper.
★ 4.645+6Variação de estrelas nos últimos 7 dias - #43
Aplicativo TTS para Android com interface de demonstração da Microsoft, suporte a requisições HTTP personalizadas, importação de outros motores TTS locais, reconhecimento de narração/diálogo baseado em aspas chinesas, além de recursos como tentativas automáticas, configurações de backup e substituição de texto.
★ 4.488+6Variação de estrelas nos últimos 7 dias - #44
MOSS-TTS-Nano é um modelo de geração de fala multilíngue minúsculo e open source da MOSI.AI e da equipe OpenMOSS. Com apenas 0,1 bilhão de parâmetros, foi projetado para geração de fala em tempo real, pode rodar diretamente na CPU sem GPU e mantém a stack de implantação simples o suficiente para demonstrações locais, serviços web e integração leve em produtos.
★ 4.282+34Variação de estrelas nos últimos 7 dias - #45
Modelo fundamental para TTS expressivo e semelhante ao humano.
★ 4.203-2Variação de estrelas nos últimos 7 dias - #46
:stuck_out_tongue_closed_eyes: TensorFlowTTS: Síntese de fala de última geração em tempo real para o TensorFlow 2 (suporta inglês, francês, coreano, chinês, alemão e é fácil de adaptar para outros idiomas)
★ 3.996+1Variação de estrelas nos últimos 7 dias - #47
Streamer-Sales: um LLM para apresentadores de vendas ao vivo que explica produtos com base em suas características para estimular o desejo de compra do usuário. Inclui um fluxo detalhado de geração de dados e integra LMDeploy para aceleração de inferência, RAG para recuperação aumentada, TTS para conversão de texto em fala, geração de avatares digitais, agentes para consultas de informações em tempo real, ASR para transcrição de áudio, front-end em Vue, back-end em FastAPI e implantação via Docker-compose.
★ 3.764+3Variação de estrelas nos últimos 7 dias - #48
Uma ferramenta de conversão de voz simples e de alta qualidade, focada em facilidade de uso e desempenho.
★ 3.674+28Variação de estrelas nos últimos 7 dias - #49
Uma WebUI única em Gradio + React com extensões para ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T e Bark!
★ 3.250+6Variação de estrelas nos últimos 7 dias - #50
[AutoArk] GPA (General Purpose Audio) pode realizar ASR, TTS e conversão de voz com um único modelo compacto!
★ 3.061+283Variação de estrelas nos últimos 7 dias - #51
O openctp fornece interfaces compatíveis com CTP API para diversos canais, como CTP de opções de ações, XTP da Zhongtai Securities, TORA da Huaxin Securities, OST da Orient Securities, EMT da East Money, TWS da Interactive Brokers, TAP da Esunny e QDP da Quantdo, permitindo que programas CTP se conectem perfeitamente a várias corretoras. O openctp também oferece um ambiente de simulação baseado no sistema de negociação TTS, com suporte a futuros, opções, ações A, fundos e títulos, servindo como alternativa ao Simnow para desenvolvedores de trading quantitativo com ambiente 24/7.
★ 2.920+10Variação de estrelas nos últimos 7 dias - #52★ 2.864+0Variação de estrelas nos últimos 7 dias
- #53
aeneas é uma biblioteca em Python/C e um conjunto de ferramentas para sincronizar automaticamente áudio e texto (também conhecido como forced alignment)
★ 2.862-1Variação de estrelas nos últimos 7 dias - #54
FLUX, Stable Diffusion, SDXL, SD3, LoRA, Fine Tuning, DreamBooth, Treinamento, Automatic1111, Forge WebUI, SwarmUI, DeepFake, TTS, Animação, Texto para Vídeo, Tutoriais, Guias, Palestras, Cursos, ComfyUI, Google Colab, RunPod, Kaggle, NoteBooks, ControlNet, TTS, Clonagem de Voz, IA, Notícias de IA, ML, Notícias de ML, Notícias, Tecnologia, Notícias de Tecnologia, Kohya, Midjourney, RunPod
★ 2.762+3Variação de estrelas nos últimos 7 dias - #55
TTS com kokoro e onnx runtime
★ 2.694+12Variação de estrelas nos últimos 7 dias - #56
Biblioteca Python e ferramenta CLI para interagir com a API de conversão de texto em fala do Google Translate
★ 2.628+1Variação de estrelas nos últimos 7 dias - #57★ 2.586+2Variação de estrelas nos últimos 7 dias
- #58
MARY TTS: um sistema de síntese de voz multilingue de código aberto escrito em Java puro
★ 2.583+0Variação de estrelas nos últimos 7 dias - #59
TTS em vietnamita com clonagem de voz instantânea • No dispositivo • Inferência de CPU em tempo real • Qualidade de áudio de 24kHz.
★ 2.468+40Variação de estrelas nos últimos 7 dias - #60
HiFi-GAN: Redes Adversárias Generativas para síntese de fala eficiente e de alta fidelidade
★ 2.367+0Variação de estrelas nos últimos 7 dias