QwenAudio
Repositórios de código aberto acompanhados de QwenAudio, ordenados por estrelas.
- #1
Modelo multilíngue de geração de voz de grande escala, oferecendo capacidade full-stack de inferência, treinamento e implantação.
★ 23.426+359Variação de estrelas nos últimos 7 dias - #2
Modelo SenseVoiceSmall de código aberto para ASR em mandarim, cantonês, inglês, japonês e coreano, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio.
★ 9.209+37Variação de estrelas nos últimos 7 dias - #3
Um runtime de voz em tempo real que mantém agentes falando, trabalhando e presentes. Runtime de voz em tempo real para agentes de IA
★ 2.362+68Variação de estrelas nos últimos 7 dias - #4
Família de modelos ASR de código aberto baseados em LLM para chinês, dialetos, sotaques e fala multilíngue, com runtimes FunASR, vLLM, streaming e llama.cpp.
★ 1.512+10Variação de estrelas nos últimos 7 dias - #5
[NeurIPS 2025] Implementação em PyTorch de [ThinkSound], uma estrutura unificada para gerar áudio a partir de qualquer modalidade, guiada por raciocínio Chain-of-Thought (CoT).
★ 1.378+0Variação de estrelas nos últimos 7 dias - #6
Fun-Audio-Chat é um Large Audio Language Model construído para interações de voz naturais e de baixa latência.
★ 1.002+3Variação de estrelas nos últimos 7 dias