speech-recognition
Repositorios de código abierto monitorizados etiquetados con speech-recognition, ordenados por estrellas.
- #31
Implementación en JAX del modelo Whisper de OpenAI para una aceleración de hasta 70x en TPU.
★ 4679-1Variación de estrellas de los últimos 7 días - #32
Un pequeño reconocedor de voz
★ 4337+2Variación de estrellas de los últimos 7 días - #33
Variante destilada de Whisper para reconocimiento de voz. 6 veces más rápido, 50% más pequeño y con una tasa de error de palabras inferior al 1%.
★ 4114+2Variación de estrellas de los últimos 7 días - #34
API de servicio web para OpenAI Whisper ASR
★ 3328+2Variación de estrellas de los últimos 7 días - #35
Ejecutables independientes de Whisper y Faster-Whisper para quienes no quieren lidiar con Python.
★ 3171+2Variación de estrellas de los últimos 7 días - #36
Alternativa de asistente de voz de código abierto, local y autohospedada que compite con Amazon Echo y Google Home
★ 3101+1Variación de estrellas de los últimos 7 días - #37
Transcribe cualquier audio a texto, traduce y edita subtítulos 100% localmente con una interfaz de usuario web. ¡Impulsado por modelos whisper!
★ 3068+2Variación de estrellas de los últimos 7 días - #38★ 2864+0Variación de estrellas de los últimos 7 días
- #39
Reconocimiento automático del habla multilingüe con marcas de tiempo a nivel de palabra y puntuación de confianza
★ 2842+1Variación de estrellas de los últimos 7 días - #40
🐸STT - El kit de herramientas de aprendizaje profundo para conversión de voz a texto (Speech-to-Text). Entrenar y desplegar modelos STT nunca ha sido tan fácil.
★ 2606+1Variación de estrellas de los últimos 7 días - #41
Un tiempo de ejecución de voz en tiempo real que mantiene a los agentes hablando, trabajando y presentes. Tiempo de ejecución de voz en tiempo real para agentes de IA
★ 2362+72Variación de estrellas de los últimos 7 días - #42
🎙 Reconocimiento de voz utilizando el framework de aprendizaje profundo TensorFlow y redes neuronales sequence-to-sequence.
★ 2173+0Variación de estrellas de los últimos 7 días - #43
IA multimodal en tiempo real y en el dispositivo con funciones similares a GPT-Live
★ 2048+7Variación de estrellas de los últimos 7 días - #44
Modelos ASR de grado industrial de código abierto que admiten mandarín, dialectos chinos e inglés, logrando un nuevo SOTA en benchmarks públicos de ASR en mandarín, y ofreciendo además una capacidad excepcional de reconocimiento de letras de canciones.
★ 1975+2Variación de estrellas de los últimos 7 días - #45★ 1968+0Variación de estrellas de los últimos 7 días
- #46
Motor de reconocimiento de voz continuo de vocabulario amplio de código abierto
★ 1935+1Variación de estrellas de los últimos 7 días - #47
Una lista curada de excelentes artículos, librerías, conjuntos de datos y otros recursos sobre Speaker Diarization.
★ 1894+1Variación de estrellas de los últimos 7 días - #48
El sistema de autocodificación para tu app — Alan AI SDK para iOS
★ 1878-3Variación de estrellas de los últimos 7 días - #49
El sistema de autoprogramación para tu aplicación — Alan AI SDK para Android
★ 1807-1Variación de estrellas de los últimos 7 días - #50
Whisper multiplataforma acelerado por GPU 🏎️
★ 1794+0Variación de estrellas de los últimos 7 días - #51
Reconocimiento de voz en tiempo real y detección de actividad de voz (VAD) utilizando la nueva generación de Kaldi con ncnn sin conexión a Internet. Compatible con iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre otros.
★ 1777-1Variación de estrellas de los últimos 7 días - #52
El sistema de autocodificación para tu aplicación: Alan AI SDK para Flutter.
★ 1756-1Variación de estrellas de los últimos 7 días - #53
El sistema de autocodificación para su aplicación: SDK de Alan AI para Ionic.
★ 1649-1Variación de estrellas de los últimos 7 días - #54
Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.
★ 1622+8Variación de estrellas de los últimos 7 días - #55
Plugin de OBS para reconocimiento de voz y subtitulado local mediante IA.
★ 1597+8Variación de estrellas de los últimos 7 días - #56
Amica es una interfaz de código abierto para la comunicación interactiva con personajes 3D mediante síntesis de voz y reconocimiento de voz.
★ 1591-2Variación de estrellas de los últimos 7 días - #57
Nodos personalizados que amplían las capacidades de Comfyui
★ 1525+1Variación de estrellas de los últimos 7 días - #58★ 1521+3Variación de estrellas de los últimos 7 días
- #59
Familia de modelos ASR de código abierto basados en LLM para chino, dialectos, acentos y voz multilingüe, con motores de ejecución como FunASR, vLLM, streaming y llama.cpp.
★ 1512+10Variación de estrellas de los últimos 7 días - #60
Preentrenamiento de voz-texto modal unificado para procesamiento de lenguaje hablado
★ 1449+0Variación de estrellas de los últimos 7 días