text-to-audio
Repositórios de código aberto acompanhados marcados com text-to-audio, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de text-to-audio no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com text-to-audio.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Amphion (/æmˈfaɪən/) é um kit de ferramentas para geração de áudio, música e fala. Seu objetivo é apoiar pesquisas reprodutíveis e ajudar pesquisadores e engenheiros iniciantes a começar na área de pesquisa e desenvolvimento de geração de áudio, música e fala.
★ 10.276+1Variação de estrelas nos últimos 7 dias - #2★ 5.831+45Variação de estrelas nos últimos 7 dias
- #3
[CVPR 2025] MMAudio: Dominando o treinamento conjunto multimodal para síntese de vídeo para áudio de alta qualidade.
★ 2.264+0Variação de estrelas nos últimos 7 dias - #4
[NeurIPS 2025] Implementação em PyTorch de [ThinkSound], uma estrutura unificada para gerar áudio a partir de qualquer modalidade, guiada por raciocínio Chain-of-Thought (CoT).
★ 1.378+0Variação de estrelas nos últimos 7 dias - #5
StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.
★ 1.288+0Variação de estrelas nos últimos 7 dias - #6
Uma WebUI para diferentes redes neurais relacionadas a áudio
★ 1.246+0Variação de estrelas nos últimos 7 dias - #7★ 1.238-1Variação de estrelas nos últimos 7 dias
- #8
HunyuanVideo-Foley: Difusão multimodal com alinhamento de representação para geração de áudio Foley de alta fidelidade.
★ 1.056+4Variação de estrelas nos últimos 7 dias - #9
[ICLR 2026] TangoFlux: Geração de texto para áudio super rápida e fiel com Flow Matching
★ 882+0Variação de estrelas nos últimos 7 dias - #10
Implementação em PyTorch do Make-An-Audio (ICML'23) com um Modelo Generativo de Texto para Áudio
★ 668+0Variação de estrelas nos últimos 7 dias - #11★ 631+1Variação de estrelas nos últimos 7 dias
- #12
🔥🔥🔥 Uma lista selecionada de artigos sobre geração multimodal baseada em LLMs (imagem, vídeo, 3D e áudio).
★ 552+0Variação de estrelas nos últimos 7 dias - #13
Um Projeto de Código Aberto para Unificar o Processamento e a Geração de Áudio
★ 512+1Variação de estrelas nos últimos 7 dias