asr
Repositorios de código abierto monitorizados etiquetados con asr, ordenados por estrellas.
- #31
Reconocimiento de voz en tiempo real y detección de actividad de voz (VAD) utilizando la nueva generación de Kaldi con ncnn sin conexión a Internet. Compatible con iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre otros.
★ 1777-1Variación de estrellas de los últimos 7 días - #32
Bailing es un robot de conversación por voz similar a GPT-4o, implementado mediante ASR+LLM+TTS, que integra modelos avanzados como DeepSeek R1 y openClaw. Es un asistente de voz personal real con una latencia de hasta 800 ms, ejecutable en equipos de bajos recursos como Mac y con soporte para interrupciones.
★ 1759+2Variación de estrellas de los últimos 7 días - #33
Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.
★ 1622+8Variación de estrellas de los últimos 7 días - #34
Analiza videos utilizando LLMs, visión artificial y reconocimiento automático de voz
★ 1570+8Variación de estrellas de los últimos 7 días - #35
🎙️ Aplicación de dictado por IA - Código abierto y local-first ⚡ Escribe 3 veces más rápido, sin necesidad de teclado. 🆓 Impulsada por modelos de código abierto, funciona sin conexión, rápida y precisa.
★ 1520+8Variación de estrellas de los últimos 7 días - #36
Familia de modelos ASR de código abierto basados en LLM para chino, dialectos, acentos y voz multilingüe, con motores de ejecución como FunASR, vLLM, streaming y llama.cpp.
★ 1512+10Variación de estrellas de los últimos 7 días - #37
Speech-AI-Forge es un proyecto desarrollado en torno a un modelo de generación TTS, que implementa un servidor API y una interfaz web basada en Gradio.
★ 1418+0Variación de estrellas de los últimos 7 días - #38
Traducción sincronizada para videos. Doblaje de video
★ 1413+2Variación de estrellas de los últimos 7 días - #39
Transcripción controlable. Literal (incluyendo muletillas, pausas, tartamudeos, sonidos vocales) o intencionada (lo que el hablante quiso decir, optimizado para legibilidad) con marcas de tiempo a nivel de palabra.
★ 1371+13Variación de estrellas de los últimos 7 días - #40★ 1347+6Variación de estrellas de los últimos 7 días
- #41
Humano digital interactivo en tiempo real, con apariencia y voz personalizables, soporte para clonación de voz y una latencia de respuesta de hasta 3 segundos.
★ 1303-1Variación de estrellas de los últimos 7 días - #42
StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.
★ 1288+0Variación de estrellas de los últimos 7 días - #43
Servidor de reconocimiento de voz WebSocket, gRPC y WebRTC basado en las bibliotecas Vosk y Kaldi
★ 1262+1Variación de estrellas de los últimos 7 días - #44
Ajuste fino del modelo de reconocimiento de voz Whisper para admitir entrenamiento sin datos de marcas de tiempo, con datos de marcas de tiempo y sin datos de voz. Acelera la inferencia y admite despliegue en la web, en escritorio con Windows y en Android
★ 1222-1Variación de estrellas de los últimos 7 días - #45
Kit de herramientas de voz con IA para Apple Silicon: ASR, TTS, voz a voz, VAD y diarización impulsados por MLX y CoreML
★ 1161+4Variación de estrellas de los últimos 7 días - #46
El primer ASR fundamental construido para el mundo real: 7 condiciones acústicas atómicas, 54 escenarios compuestos, 2.6 millones de muestras y hasta un ~30% de mejora sobre el estado del arte donde otros modelos fallan. Volverás a MEGA-ASR después de que los demás fallen en entornos reales.
★ 1136+3Variación de estrellas de los últimos 7 días - #47
Implementación no oficial en PyTorch de Conformer: Convolution-augmented Transformer for Speech Recognition (INTERSPEECH 2020).
★ 1132+1Variación de estrellas de los últimos 7 días - #48
SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.
★ 1118+143Variación de estrellas de los últimos 7 días - #49★ 1057+8Variación de estrellas de los últimos 7 días
- #50
Reconocimiento de voz sin conexión para Android con la biblioteca Vosk.
★ 1056+0Variación de estrellas de los últimos 7 días - #51
Conversión de voz a texto totalmente local, privada y multiplataforma con posprocesamiento mediante LLM
★ 1055+15Variación de estrellas de los últimos 7 días - #52★ 1040+1Variación de estrellas de los últimos 7 días
- #53
Motor de análisis multimodal todo en uno + motor de conocimiento listo para IA, basado en ontologías y wiki de LLM
★ 1014+166Variación de estrellas de los últimos 7 días - #54★ 984+4Variación de estrellas de los últimos 7 días
- #55
Espresso: un kit de herramientas rápido de reconocimiento de voz neuronal de extremo a extremo
★ 939+0Variación de estrellas de los últimos 7 días - #56
VocoType es una herramienta de entrada de voz local, privada y segura que permite convertir voz a texto en tiempo real mediante atajos de teclado e ingresarlo automáticamente en la aplicación actual. Admite MCP de voz a texto, optimización de texto por IA, diccionarios de reemplazo personalizados y transcripción de audio/video.
★ 929+9Variación de estrellas de los últimos 7 días - #57
Este proyecto proporciona una API con soporte de acceso a nivel de usuario para transcribir voz a texto utilizando un modelo Whisper ASR ajustado y procesado.
★ 914+0Variación de estrellas de los últimos 7 días - #58
Caja de herramientas de algoritmos de IA offline gratuita para Java, que admite reconocimiento facial, detección de vida, reconocimiento de expresiones, detección de objetos, segmentación de instancias, detección de peatones, OCR, reconocimiento de matrículas, reconocimiento de tablas, ASR+TTS, traducción automática y más. Se utiliza mediante Maven. Compatible con PyTorch y Tensorflow, e integra modelos como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) y Whisper.
★ 909+3Variación de estrellas de los últimos 7 días - #59
Un kit de herramientas fácil de usar para reconocimiento, transcripción y conversión de voz, entre otros
★ 873+0Variación de estrellas de los últimos 7 días - #60
Reconocimiento de voz en chino de extremo a extremo basado en PaddlePaddle, desde conceptos básicos hasta proyectos empresariales prácticos. Soporta modelos populares como DeepSpeech2, Conformer y Squeezeformer
★ 870-1Variación de estrellas de los últimos 7 días