OpenMOSS
Repositórios de código aberto acompanhados de OpenMOSS, ordenados por estrelas.
- #1
Um modelo de linguagem conversacional de código aberto aumentado por ferramentas, desenvolvido pela Fudan University
★ 12.234+11Variação de estrelas nos últimos 7 dias - #2
MOSS-TTS-Nano é um modelo de geração de fala multilíngue minúsculo e open source da MOSI.AI e da equipe OpenMOSS. Com apenas 0,1 bilhão de parâmetros, foi projetado para geração de fala em tempo real, pode rodar diretamente na CPU sem GPU e mantém a stack de implantação simples o suficiente para demonstrações locais, serviços web e integração leve em produtos.
★ 4.279+51Variação de estrelas nos últimos 7 dias - #3
A família MOSS‑TTS é uma família de modelos de geração de fala e som open source da MOSI.AI e da equipe OpenMOSS. Projetada para alta fidelidade, alta expressividade e cenários complexos do mundo real, cobrindo fala longa estável, diálogo multi-falante, design de voz/personagem, efeitos sonoros ambientais e TTS de streaming em tempo real.
★ 4.056+24Variação de estrelas nos últimos 7 dias - #4
MOSS-Transcribe-Diarize 0.9B é um modelo de compreensão de áudio de ponta a ponta de código aberto para transcrição de longa duração com múltiplos falantes, diarização, carimbos de data/hora e reconhecimento de eventos acústicos.
★ 1.778+158Variação de estrelas nos últimos 7 dias - #5
MOSS-TTSD é um modelo de geração de diálogo falado projetado para síntese expressiva de múltiplos falantes. Ele apresenta modelagem de contexto longo, controle flexível de falante e suporte multilíngue, permitindo clonagem de voz zero-shot a partir de referências de áudio curtas.
★ 1.394+0Variação de estrelas nos últimos 7 dias - #6
Uma lista de leitura, blogs de artigos e recursos selecionados e atualizados continuamente sobre World Action Models (WAMs) em IA incorporada.
★ 1.369+47Variação de estrelas nos últimos 7 dias - #7★ 1.108+5Variação de estrelas nos últimos 7 dias
- #8★ 882+0Variação de estrelas nos últimos 7 dias
- #9
MOSS-Audio é um modelo de base de código aberto para compreensão unificada de áudio, permitindo fala, som, música, legendagem, QA e raciocínio em cenários do mundo real.
★ 654+8Variação de estrelas nos últimos 7 dias