asr
Repositorios de código abierto monitorizados etiquetados con asr, ordenados por estrellas.
- #61
GLM-ASR-Nano: un modelo de reconocimiento de voz robusto y de código abierto con 1.5B de parámetros
★ 854+3Variación de estrellas de los últimos 7 días - #62
Voxtral ASR & TTS ejecutándose de forma nativa y en el navegador. Una implementación en Rust del ASR/TTS en tiempo real de Mistral Voxtral mini utilizando el framework Burn ML.
★ 819+2Variación de estrellas de los últimos 7 días - #63
Asistente de voz inteligente que convierte el habla en texto limpio, acciones útiles y conocimiento estructurado. Ayuda a los usuarios a capturar ideas, comunicarse de forma natural, automatizar tareas repetitivas y mantener la productividad en diferentes aplicaciones y flujos de trabajo.
★ 807+5Variación de estrellas de los últimos 7 días - #64
VTuber con IA que utiliza LLM, ASR, TTS, OCR, CV y otras tecnologías para realizar transmisiones en vivo o jugar Minecraft contigo.
★ 803+5Variación de estrellas de los últimos 7 días - #65
BiBi Keyboard: Una aplicación de teclado para Android basada en Kotlin con LLM y entrada de voz ASR
★ 772+17Variación de estrellas de los últimos 7 días - #66
Conversión rápida entre números chinos y números arábigos (características recientes: fracciones, fechas, temperaturas, etc.).
★ 766+0Variación de estrellas de los últimos 7 días - #67
Reconocimiento de voz en chino implementado con PaddlePaddle. Proyecto completo con buenos resultados de reconocimiento. Soporta entrenamiento y predicción en Windows y Linux, además de predicción en placas Nvidia Jetson.
★ 763+0Variación de estrellas de los últimos 7 días - #68
Ejecución de un modelo de voz a texto (whisper.cpp) en Unity3d en su máquina local.
★ 751+1Variación de estrellas de los últimos 7 días - #69
Marco de trabajo de reconocimiento automático de voz (ASR) en PyTorch para modelos de transmisión y no transmisión, compatible con reconocimiento en línea y fuera de línea. Soporta modelos Conformer, Squeezeformer y DeepSpeech2, además de diversos métodos de aumento de datos.
★ 727+0Variación de estrellas de los últimos 7 días - #70
Kit de herramientas de código abierto para reconocimiento de voz de extremo a extremo utilizando PyTorch-Lightning y Hydra.
★ 714+0Variación de estrellas de los últimos 7 días - #71
Reconocimiento de voz sin conexión con OpenAI Whisper y TensorFlow Lite para Android
★ 688+0Variación de estrellas de los últimos 7 días - #72
Artículos de INTERSPEECH 2023-2024: Una colección completa de artículos de investigación influyentes y destacados de la conferencia INTERSPEECH 2023-24. Explora los últimos avances en procesamiento de voz y lenguaje. Incluye código.
★ 684+0Variación de estrellas de los últimos 7 días - #73★ 677+0Variación de estrellas de los últimos 7 días
- #74
Un sistema ASR integral de grado industrial con módulos ASR, VAD, LID y Punc. FireRedASR2 admite chino (mandarín, más de 20 dialectos/acentos), inglés, cambio de código, y reconocimiento de voz y canto. FireRedVAD admite voz/canto/música en más de 100 idiomas. FireRedLID admite más de 100 idiomas y más de 20 dialectos chinos. FireRedPunc admite chino e inglés.
★ 672+13Variación de estrellas de los últimos 7 días - #75
Motor de conversión de voz a texto en tiempo real ejecutado en el dispositivo mediante aprendizaje profundo.
★ 671+0Variación de estrellas de los últimos 7 días - #76
Traducción de audio en tiempo real, captura audio del sistema y micrófono, ejecuta ASR (Whisper/SenseVoice) y traduce mediante la API de LLM con visualización en streaming. Ideal para VTubers, streamers y consumo de contenido extranjero.
★ 626+38Variación de estrellas de los últimos 7 días - #77
Teoría, artículos y presentaciones sobre reconocimiento de voz
★ 618+0Variación de estrellas de los últimos 7 días - #78
🤗 Optimum Intel: Acelere la inferencia con herramientas de optimización de Intel
★ 617+1Variación de estrellas de los últimos 7 días - #79
Biblioteca de reconocimiento automático de voz de grado comercial, lista para usar, compatible con todas las plataformas y con reconocimiento mixto de chino e inglés. Implementación multiplataforma de inferencia ASR basada en ONNXRuntime y FunASR. Proporcionamos un conjunto de API más sencillas para invocar modelos ASR.
★ 611+0Variación de estrellas de los últimos 7 días - #80
Plataforma de agente de voz de código abierto.
★ 592+2Variación de estrellas de los últimos 7 días - #81
Una canalización optimizada de voz a texto para el modelo Whisper que admite múltiples motores de inferencia
★ 578+1Variación de estrellas de los últimos 7 días - #82
Un software multiplataforma de visualización de subtítulos en tiempo real.
★ 578+4Variación de estrellas de los últimos 7 días - #83
SpeechIO Leaderboard: una plataforma de evaluación comparativa amplia, robusta y completa para el reconocimiento automático de voz.
★ 553+3Variación de estrellas de los últimos 7 días - #84
Una biblioteca de reconocimiento de voz que se ejecuta en el navegador gracias a una compilación en WebAssembly de Vosk
★ 529+1Variación de estrellas de los últimos 7 días - #85
Artículos de ICASSP 2023-2024: Una colección completa de artículos de investigación influyentes y destacados de las conferencias ICASSP 2023-24. Explore los últimos avances en acústica, voz y procesamiento de señales. Código incluido. ¡Marque el repositorio con una estrella para apoyar el avance del procesamiento de audio y señales!
★ 526+1Variación de estrellas de los últimos 7 días - #86
Chatbot de IA de bolsillo construido con una RPI Zero 2w / 5.
★ 513+10Variación de estrellas de los últimos 7 días - #87
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501+7Variación de estrellas de los últimos 7 días