speech
Repositorios de código abierto monitorizados etiquetados con speech, ordenados por estrellas.
- #31★ 2818+1Variación de estrellas de los últimos 7 días
- #32★ 2750-1Variación de estrellas de los últimos 7 días
- #33
Biblioteca de Python y herramienta de línea de comandos para interactuar con la API de conversión de texto a voz de Google Translate
★ 2628+0Variación de estrellas de los últimos 7 días - #34★ 2256+7Variación de estrellas de los últimos 7 días
- #35
¡Texto a voz controlable y rápido para más de 7000 idiomas!
★ 2207-1Variación de estrellas de los últimos 7 días - #36★ 2170+3Variación de estrellas de los últimos 7 días
- #37
Endpoint de API de texto a voz gratuito y de alta calidad para reemplazar OpenAI, Azure o ElevenLabs
★ 2075+5Variación de estrellas de los últimos 7 días - #38
Praat: Fonética por computadora
★ 1970+1Variación de estrellas de los últimos 7 días - #39
Motor de reconocimiento de voz continuo de vocabulario amplio de código abierto
★ 1935+1Variación de estrellas de los últimos 7 días - #40
Lista comunitaria de startups que trabajan con IA en tecnología de audio y música.
★ 1769+1Variación de estrellas de los últimos 7 días - #41★ 1521+3Variación de estrellas de los últimos 7 días
- #42
Restauración general de voz.
★ 1375+0Variación de estrellas de los últimos 7 días - #43
Transcripción controlable. Literal (incluyendo muletillas, pausas, tartamudeos, sonidos vocales) o intencionada (lo que el hablante quiso decir, optimizado para legibilidad) con marcas de tiempo a nivel de palabra.
★ 1371+13Variación de estrellas de los últimos 7 días - #44
Artículos relevantes en el campo del procesamiento de lenguaje natural (con notas de lectura), modelos de reproducción y procesamiento de datos (código disponible en versiones TensorFlow y PyTorch)
★ 1333+1Variación de estrellas de los últimos 7 días - #45
MTools es una potente aplicación de escritorio multifuncional que integra procesamiento de audio y vídeo, edición de imágenes, operaciones de texto y herramientas de codificación, con funciones de IA integradas. Diseñado para simplificar tu flujo de trabajo y mejorar la productividad.
★ 1305+5Variación de estrellas de los últimos 7 días - #46
StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.
★ 1288+0Variación de estrellas de los últimos 7 días - #47
Videos, notas y experimentos para comprender el aprendizaje profundo
★ 1198+0Variación de estrellas de los últimos 7 días - #48
Herramientas para gestionar datos multimodales en proyectos de machine learning.
★ 1149-1Variación de estrellas de los últimos 7 días - #49
Implementación no oficial en PyTorch de Conformer: Convolution-augmented Transformer for Speech Recognition (INTERSPEECH 2020).
★ 1132+1Variación de estrellas de los últimos 7 días - #50★ 1040+1Variación de estrellas de los últimos 7 días
- #51
Un sistema TTS fundamental potenciado por LLM de código abierto
★ 920+1Variación de estrellas de los últimos 7 días - #52
Kit de herramientas de segmentación de audio basado en CNN. Permite detectar voz, música, ruido y el género del hablante. Diseñado para estudios de igualdad de género a gran escala basados en el tiempo de habla por género.
★ 910+1Variación de estrellas de los últimos 7 días - #53
DiffWave es un vocoder neuronal y sintetizador de formas de onda rápido y de alta calidad.
★ 885+0Variación de estrellas de los últimos 7 días - #54★ 881-1Variación de estrellas de los últimos 7 días
- #55
Reconocimiento de voz en chino de extremo a extremo basado en PaddlePaddle, desde conceptos básicos hasta proyectos empresariales prácticos. Soporta modelos populares como DeepSpeech2, Conformer y Squeezeformer
★ 870-1Variación de estrellas de los últimos 7 días - #56
Voxtral ASR & TTS ejecutándose de forma nativa y en el navegador. Una implementación en Rust del ASR/TTS en tiempo real de Mistral Voxtral mini utilizando el framework Burn ML.
★ 819+2Variación de estrellas de los últimos 7 días - #57
Un Omni Avatar interactivo en tiempo real construido sobre LiveKit, que permite una integración fluida con cualquier componente de avatar de código abierto (modelo en tiempo real, visual, voz, memoria, búsqueda, etc.).
★ 813+4Variación de estrellas de los últimos 7 días - #58★ 771+0Variación de estrellas de los últimos 7 días
- #59
Sistema de comunicación aumentativa y alternativa (AAC) con conversión de texto a voz para el navegador.
★ 755+9Variación de estrellas de los últimos 7 días - #60
Allosaurus es un reconocedor fonético universal preentrenado para más de 2000 idiomas
★ 746+4Variación de estrellas de los últimos 7 días