audio-generation
Repositórios de código aberto acompanhados marcados com audio-generation, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de audio-generation no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com audio-generation.
- #1
CLI de geração de mídia Flatkey para imagens, vídeos, áudio, texto, créditos e descoberta de modelos.
★ 634
- #1
LocalAI é o motor de IA de código aberto. Execute qualquer modelo - LLMs, visão, voz, imagem, vídeo - em qualquer hardware. Não é necessário GPU.
★ 48.749+135Variação de estrelas nos últimos 7 dias - #2
Modelo multilíngue de geração de voz de grande escala, oferecendo capacidade full-stack de inferência, treinamento e implantação.
★ 23.067+215Variação de estrelas nos últimos 7 dias - #3
Amphion (/æmˈfaɪən/) é um kit de ferramentas para geração de áudio, música e fala. Seu objetivo é apoiar pesquisas reprodutíveis e ajudar pesquisadores e engenheiros iniciantes a começar na área de pesquisa e desenvolvimento de geração de áudio, música e fala.
★ 10.275+17Variação de estrelas nos últimos 7 dias - #4
Um framework para inferência eficiente de modelos com modelos de omnimodalidade
★ 6.457+229Variação de estrelas nos últimos 7 dias - #5
YuE: Modelo fundamental de geração de músicas completas, similar ao Suno.ai, porém aberto.
★ 6.408+14Variação de estrelas nos últimos 7 dias - #6
Uma WebUI única em Gradio + React com extensões para ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T e Bark!
★ 3.245+5Variação de estrelas nos últimos 7 dias - #7★ 2.908+2Variação de estrelas nos últimos 7 dias
- #8★ 2.639+1Variação de estrelas nos últimos 7 dias
- #9
Uma linha do tempo dos modelos de IA mais recentes para geração de áudio, começando em 2023!
★ 1.904+0Variação de estrelas nos últimos 7 dias - #10
Implementação do SoundStorm, geração de áudio paralela eficiente do Google Deepmind, em Pytorch
★ 1.547+1Variação de estrelas nos últimos 7 dias - #11
Auto-hospede o poderoso modelo de TTS Chatterbox. Este servidor oferece uma interface web amigável, endpoints de API flexíveis (incluindo compatibilidade com OpenAI), vozes predefinidas, clonagem de voz e processamento de texto em escala de audiolivros. Executa com aceleração em NVIDIA (CUDA), AMD (ROCm) e CPU.
★ 1.426+12Variação de estrelas nos últimos 7 dias - #12★ 1.238+0Variação de estrelas nos últimos 7 dias
- #13★ 1.226+0Variação de estrelas nos últimos 7 dias
- #14
Uma integração de nó personalizado do ComfyUI para conversão de texto em fala e voz local com múltiplos motores e idiomas. Suporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clássico e multilíngue), F5-TTS, Higgs Audio 2, 3 e VibeVoice com comprimento de texto ilimitado, temporização SRT, suporte a personagens e muitas ferramentas de áudio
★ 1.184+9Variação de estrelas nos últimos 7 dias - #15
CLI oficial para muapi.ai — gere imagens, vídeos e áudio a partir do terminal. Servidor MCP, 14 modelos de IA, instalável via npm e pip.
★ 1.043+1Variação de estrelas nos últimos 7 dias - #16
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 978+70Variação de estrelas nos últimos 7 dias - #17
Conjuntos de dados de áudio de IA (AI-ADS) 🎵, incluindo fala, música e efeitos sonoros, que podem fornecer dados de treinamento para IA generativa, AIGC, treinamento de modelos de IA, desenvolvimento de ferramentas de áudio inteligentes e aplicações de áudio.
★ 961+0Variação de estrelas nos últimos 7 dias - #18
O hub para pesquisa de IA de áudio: artigos, modelos abertos, benchmarks e datasets sobre LLMs de áudio, reconhecimento de fala, TTS, música e geração de áudio.
★ 950+0Variação de estrelas nos últimos 7 dias - #19
Assistente de voz em tempo real — streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatível com a API Realtime da OpenAI. Clonagem de voz, interrupção (barge-in), ~9× em tempo real em uma 4090. Apache 2.0.
★ 748+0Variação de estrelas nos últimos 7 dias - #20
CLI de geração de mídia Flatkey para imagens, vídeos, áudio, texto, créditos e descoberta de modelos.
★ 634+89Variação de estrelas nos últimos 7 dias - #21
O Genblaze é um SDK Python de código aberto para orquestrar pipelines de mídia de IA generativa em provedores de vídeo, áudio e imagem com procedência integrada para cada saída.
★ 559-1Variação de estrelas nos últimos 7 dias - #22
Um Projeto de Código Aberto para Unificar o Processamento e a Geração de Áudio
★ 510+3Variação de estrelas nos últimos 7 dias