kyutai-labs
Repositorios de código abierto monitorizados de kyutai-labs, ordenados por estrellas.
- #1
Moshi es un modelo base de voz a texto y un marco de diálogo hablado en dúplex completo. Utiliza Mimi, un códec de audio neural de última generación para transmisión continua.
★ 11.002+0Variación de estrellas de los últimos 7 días - #2
Un TTS que cabe en tu CPU (y en tu bolsillo)
★ 9335+0Variación de estrellas de los últimos 7 días - #3
Modelos de conversión de voz a texto y de texto a voz de Kyutai basados en el framework Delayed Streams Modeling.
★ 3021+0Variación de estrellas de los últimos 7 días - #4
Hibiki es un modelo para la traducción de voz en streaming (también conocida como traducción simultánea). A diferencia de la traducción offline, donde se espera al final de la locución original para empezar a traducir, Hibiki adapta su flujo para acumular solo el contexto necesario y producir una traducción correcta en tiempo real, fragmento a fragmento.
★ 1512+0Variación de estrellas de los últimos 7 días - #5★ 1508+0Variación de estrellas de los últimos 7 días