Pular para o conteúdo principal
buildradar
Sign in
Tópico · audio-generation

audio-generation

Repositórios de código aberto acompanhados marcados com audio-generation, ordenados por estrelas.

Repositórios
22
Total de estrelas
118.649
Média de estrelas
5.393
Participação
0,01%

Tópicos que aparecem com frequência ao lado de audio-generation no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com audio-generation.

  • flatkey-cli@flatkey-ai

    CLI de geração de mídia Flatkey para imagens, vídeos, áudio, texto, créditos e descoberta de modelos.

    634
  • LocalAI@mudler

    LocalAI é o motor de IA de código aberto. Execute qualquer modelo - LLMs, visão, voz, imagem, vídeo - em qualquer hardware. Não é necessário GPU.

    48.749+135Variação de estrelas nos últimos 7 dias
  • CosyVoice@QwenAudio

    Modelo multilíngue de geração de voz de grande escala, oferecendo capacidade full-stack de inferência, treinamento e implantação.

    23.067+215Variação de estrelas nos últimos 7 dias
  • Amphion@open-mmlab

    Amphion (/æmˈfaɪən/) é um kit de ferramentas para geração de áudio, música e fala. Seu objetivo é apoiar pesquisas reprodutíveis e ajudar pesquisadores e engenheiros iniciantes a começar na área de pesquisa e desenvolvimento de geração de áudio, música e fala.

    10.275+17Variação de estrelas nos últimos 7 dias
  • vllm-omni@vllm-project

    Um framework para inferência eficiente de modelos com modelos de omnimodalidade

    6.457+229Variação de estrelas nos últimos 7 dias
  • YuE@multimodal-art-projection

    YuE: Modelo fundamental de geração de músicas completas, similar ao Suno.ai, porém aberto.

    6.408+14Variação de estrelas nos últimos 7 dias
  • TTS-WebUI@rsxdalv

    Uma WebUI única em Gradio + React com extensões para ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T e Bark!

    3.245+5Variação de estrelas nos últimos 7 dias
  • AudioLDM@haoheliu

    AudioLDM: Gere fala, efeitos sonoros, música e muito mais a partir de texto.

    2.908+2Variação de estrelas nos últimos 7 dias
  • AudioLDM2@haoheliu

    Geração de texto para áudio/música.

    2.639+1Variação de estrelas nos últimos 7 dias
  • Uma linha do tempo dos modelos de IA mais recentes para geração de áudio, começando em 2023!

    1.904+0Variação de estrelas nos últimos 7 dias
  • soundstorm-pytorch@lucidrains

    Implementação do SoundStorm, geração de áudio paralela eficiente do Google Deepmind, em Pytorch

    1.547+1Variação de estrelas nos últimos 7 dias
  • Auto-hospede o poderoso modelo de TTS Chatterbox. Este servidor oferece uma interface web amigável, endpoints de API flexíveis (incluindo compatibilidade com OpenAI), vozes predefinidas, clonagem de voz e processamento de texto em escala de audiolivros. Executa com aceleração em NVIDIA (CUDA), AMD (ROCm) e CPU.

    1.426+12Variação de estrelas nos últimos 7 dias
  • tango@declare-lab

    Uma família de modelos de difusão para geração de texto para áudio.

    1.238+0Variação de estrelas nos últimos 7 dias
  • BigVGAN@NVIDIA

    Implementação oficial em PyTorch do BigVGAN (ICLR 2023)

    1.226+0Variação de estrelas nos últimos 7 dias
  • TTS-Audio-Suite@diodiogod

    Uma integração de nó personalizado do ComfyUI para conversão de texto em fala e voz local com múltiplos motores e idiomas. Suporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clássico e multilíngue), F5-TTS, Higgs Audio 2, 3 e VibeVoice com comprimento de texto ilimitado, temporização SRT, suporte a personagens e muitas ferramentas de áudio

    1.184+9Variação de estrelas nos últimos 7 dias
  • muapi-cli@SamurAIGPT

    CLI oficial para muapi.ai — gere imagens, vídeos e áudio a partir do terminal. Servidor MCP, 14 modelos de IA, instalável via npm e pip.

    1.043+1Variação de estrelas nos últimos 7 dias
  • sglang-omni@sgl-project

    O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.

    978+70Variação de estrelas nos últimos 7 dias
  • Conjuntos de dados de áudio de IA (AI-ADS) 🎵, incluindo fala, música e efeitos sonoros, que podem fornecer dados de treinamento para IA generativa, AIGC, treinamento de modelos de IA, desenvolvimento de ferramentas de áudio inteligentes e aplicações de áudio.

    961+0Variação de estrelas nos últimos 7 dias
  • audio-ai-hub@BinWang28

    O hub para pesquisa de IA de áudio: artigos, modelos abertos, benchmarks e datasets sobre LLMs de áudio, reconhecimento de fala, TTS, música e geração de áudio.

    950+0Variação de estrelas nos últimos 7 dias
  • vui@fluxions-ai

    Assistente de voz em tempo real — streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatível com a API Realtime da OpenAI. Clonagem de voz, interrupção (barge-in), ~9× em tempo real em uma 4090. Apache 2.0.

    748+0Variação de estrelas nos últimos 7 dias
  • flatkey-cli@flatkey-ai

    CLI de geração de mídia Flatkey para imagens, vídeos, áudio, texto, créditos e descoberta de modelos.

    634+89Variação de estrelas nos últimos 7 dias
  • genblaze@backblaze-labs

    O Genblaze é um SDK Python de código aberto para orquestrar pipelines de mídia de IA generativa em provedores de vídeo, áudio e imagem com procedência integrada para cada saída.

    559-1Variação de estrelas nos últimos 7 dias
  • unified-audio@alibaba

    Um Projeto de Código Aberto para Unificar o Processamento e a Geração de Áudio

    510+3Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos