speech
Repositorios de código abierto monitorizados etiquetados con speech, ordenados por estrellas.
- #61
🐸 Colección de artículos de TTS
★ 734+1Variación de estrellas de los últimos 7 días - #62
Marco de trabajo de reconocimiento automático de voz (ASR) en PyTorch para modelos de transmisión y no transmisión, compatible con reconocimiento en línea y fuera de línea. Soporta modelos Conformer, Squeezeformer y DeepSpeech2, además de diversos métodos de aumento de datos.
★ 727+0Variación de estrellas de los últimos 7 días - #63★ 716+0Variación de estrellas de los últimos 7 días
- #64
Kit de herramientas de código abierto para reconocimiento de voz de extremo a extremo utilizando PyTorch-Lightning y Hydra.
★ 714+0Variación de estrellas de los últimos 7 días - #65★ 693+1Variación de estrellas de los últimos 7 días
- #66
API de texto a voz (TTS) local compatible con OpenAI que utiliza Chatterbox, permitiendo a los usuarios generar voz clonada en cualquier lugar donde se utilice la API de OpenAI (por ejemplo, Open WebUI, AnythingLLM, etc.).
★ 676+5Variación de estrellas de los últimos 7 días - #67
MOSS-Audio es un modelo base de código abierto para la comprensión unificada de audio, que permite el procesamiento de voz, sonido, música, subtitulado, QA y razonamiento en escenarios del mundo real.
★ 655+4Variación de estrellas de los últimos 7 días - #68★ 638+0Variación de estrellas de los últimos 7 días
- #69
Laboratorios, empresas, recursos y pasantías en el área de voz; se aceptan recomendaciones o autocandidaturas.
★ 610+1Variación de estrellas de los últimos 7 días - #70
Una lista de conjuntos de datos de respuesta al impulso de sala disponibles públicamente y scripts para descargarlos.
★ 607+1Variación de estrellas de los últimos 7 días - #71
SpeechIO Leaderboard: una plataforma de evaluación comparativa amplia, robusta y completa para el reconocimiento automático de voz.
★ 553+3Variación de estrellas de los últimos 7 días - #72
Muestras de audio que acompañan a publicaciones relacionadas con Tacotron, un modelo de síntesis de voz de extremo a extremo.
★ 539+0Variación de estrellas de los últimos 7 días - #73★ 524+1Variación de estrellas de los últimos 7 días
- #74
StarGANv2-VC: un marco de trabajo diverso, no supervisado y no paralelo para la conversión de voz con sonido natural.
★ 522+0Variación de estrellas de los últimos 7 días