OpenMOSS
Repositorios de código abierto monitorizados de OpenMOSS, ordenados por estrellas.
- #1
Un modelo de lenguaje conversacional de código abierto mejorado con herramientas de la Universidad de Fudan
★ 12.234+11Variación de estrellas de los últimos 7 días - #2
MOSS-TTS-Nano es un modelo de generación de voz multilingüe pequeño y de código abierto de MOSI.AI y el equipo de OpenMOSS. Con solo 0.1B de parámetros, está diseñado para la generación de voz en tiempo real, puede ejecutarse directamente en la CPU sin GPU y mantiene la pila de implementación lo suficientemente simple para demostraciones locales, servicios web y la integración de productos ligeros.
★ 4279+51Variación de estrellas de los últimos 7 días - #3
MOSS‑TTS Family es una familia de modelos de código abierto para la generación de voz y sonido de MOSI.AI y el equipo OpenMOSS. Está diseñada para escenarios del mundo real complejos, de alta fidelidad y gran expresividad, que abarcan voz larga y estable, diálogo multilocutor, diseño de voz y personajes, efectos de sonido ambiental y TTS en streaming en tiempo real.
★ 4056+24Variación de estrellas de los últimos 7 días - #4
MOSS-Transcribe-Diarize 0.9B es un modelo de comprensión de audio de código abierto SOTA de extremo a extremo para transcripción de formato largo con múltiples hablantes, diarización, marcas de tiempo y reconocimiento de eventos acústicos.
★ 1778+158Variación de estrellas de los últimos 7 días - #5
MOSS-TTSD es un modelo de generación de diálogos hablados diseñado para la síntesis expresiva de múltiples hablantes. Cuenta con modelado de contexto largo, control flexible de hablantes y soporte multilingüe, al tiempo que permite la clonación de voz zero-shot a partir de referencias de audio cortas.
★ 1394+0Variación de estrellas de los últimos 7 días - #6
Una lista de lectura curada y actualizada continuamente, blogs de artículos y recursos para World Action Models (WAMs) en IA encarnada.
★ 1358+47Variación de estrellas de los últimos 7 días - #7★ 1106+5Variación de estrellas de los últimos 7 días
- #8★ 882+0Variación de estrellas de los últimos 7 días
- #9
MOSS-Audio es un modelo base de código abierto para la comprensión unificada de audio, que permite el procesamiento de voz, sonido, música, subtitulado, QA y razonamiento en escenarios del mundo real.
★ 653+8Variación de estrellas de los últimos 7 días