speech-recognition
Repositorios de código abierto monitorizados etiquetados con speech-recognition, ordenados por estrellas.
- #91
Centro de investigación de IA de audio: artículos, modelos abiertos, puntos de referencia y conjuntos de datos sobre LLMs de audio, reconocimiento de voz, TTS, música y generación de audio.
★ 953+3Variación de estrellas de los últimos 7 días - #92
Servicio de transcripción y diarización offline autohospedado con resúmenes mediante LLM
★ 948+2Variación de estrellas de los últimos 7 días - #93
Whisper.net. Conversión de voz a texto simplificada mediante modelos Whisper.
★ 941+1Variación de estrellas de los últimos 7 días - #94
Espresso: un kit de herramientas rápido de reconocimiento de voz neuronal de extremo a extremo
★ 939+0Variación de estrellas de los últimos 7 días - #95
Un asistente de voz de escritorio basado en Python capaz de ejecutar comandos a nivel de sistema, integrar reconocimiento de voz y texto a voz, y manejar interacciones de usuario asíncronas.
★ 919+13Variación de estrellas de los últimos 7 días - #96
Modelos Whisper optimizados para streaming y uso en dispositivos.
★ 897+0Variación de estrellas de los últimos 7 días - #97
Un LLM conversacional que se ejecuta en su propia computadora sin necesidad de internet.
★ 891+2Variación de estrellas de los últimos 7 días - #98
SpeechPy: una biblioteca para el procesamiento y reconocimiento de voz: http://speechpy.readthedocs.io/en/latest/
★ 883+0Variación de estrellas de los últimos 7 días - #99
Reconocimiento de voz en chino de extremo a extremo basado en PaddlePaddle, desde conceptos básicos hasta proyectos empresariales prácticos. Soporta modelos populares como DeepSpeech2, Conformer y Squeezeformer
★ 870-1Variación de estrellas de los últimos 7 días - #100
💬 Reconocimiento de voz para tu aplicación React
★ 842+1Variación de estrellas de los últimos 7 días - #101
Algoritmos de decodificación de Clasificación Temporal Conexionista (CTC): ruta óptima, búsqueda de haz (beam search), búsqueda en léxico, búsqueda por prefijo y paso de tokens. Implementado en Python.
★ 836-1Variación de estrellas de los últimos 7 días - #102
Cree aplicaciones web de voz a texto en tiempo real utilizando Whisper de OpenAI https://openai.com/blog/whisper/
★ 835+0Variación de estrellas de los últimos 7 días - #103★ 823-1Variación de estrellas de los últimos 7 días
- #104
Dictado por voz gratuito, de código abierto y 100% offline para Linux. Habla y escribe en cualquier lugar mediante whisper.cpp, motores Whisper y VOSK, aceleración por GPU, funciona en X11 + Wayland.
★ 806+21Variación de estrellas de los últimos 7 días - #105
🎤 Lobe TTS - Una biblioteca de TTS/STT confiable y de alta calidad para servidor y navegador
★ 805+1Variación de estrellas de los últimos 7 días - #106
Conversión de voz a texto y de texto a voz. Envía texto como mensajes OSC a VRChat para mostrarlo en el avatar.
★ 803+4Variación de estrellas de los últimos 7 días - #107
Binding de React Native para whisper.cpp
★ 800-1Variación de estrellas de los últimos 7 días - #108
Chatbot de voz local para conversaciones atractivas, impulsado por Ollama, Hugging Face Transformers y Coqui TTS Toolkit
★ 788+1Variación de estrellas de los últimos 7 días - #109
Proyecto que permite utilizar un micrófono con OpenAI Whisper.
★ 787+0Variación de estrellas de los últimos 7 días - #110★ 786+17Variación de estrellas de los últimos 7 días
- #111
La forma más sencilla de transcribir audio en Swift
★ 785-1Variación de estrellas de los últimos 7 días - #112
Una aplicación de transcripción de voz por IA 100% privada que convierte voz a texto en más de 100 idiomas. Creada con Compose Multiplatform para Android e iOS usando Whisper AI; sin subidas a la nube, todo el procesamiento ocurre en el dispositivo para una privacidad total.
★ 777+1Variación de estrellas de los últimos 7 días - #113
Conversión rápida entre números chinos y números arábigos (características recientes: fracciones, fechas, temperaturas, etc.).
★ 766+0Variación de estrellas de los últimos 7 días - #114★ 763+1Variación de estrellas de los últimos 7 días
- #115
Reconocimiento de voz en chino implementado con PaddlePaddle. Proyecto completo con buenos resultados de reconocimiento. Soporta entrenamiento y predicción en Windows y Linux, además de predicción en placas Nvidia Jetson.
★ 762+0Variación de estrellas de los últimos 7 días - #116★ 754+2Variación de estrellas de los últimos 7 días
- #117
Ejecución de un modelo de voz a texto (whisper.cpp) en Unity3d en su máquina local.
★ 751+1Variación de estrellas de los últimos 7 días - #118
Allosaurus es un reconocedor fonético universal preentrenado para más de 2000 idiomas
★ 746+4Variación de estrellas de los últimos 7 días - #119
Teclado y servicio de reconocimiento de voz privado y local para Android.
★ 745+6Variación de estrellas de los últimos 7 días - #120
Marco de trabajo de reconocimiento automático de voz (ASR) en PyTorch para modelos de transmisión y no transmisión, compatible con reconocimiento en línea y fuera de línea. Soporta modelos Conformer, Squeezeformer y DeepSpeech2, además de diversos métodos de aumento de datos.
★ 727+0Variación de estrellas de los últimos 7 días