speech-recognition
Repositorios de código abierto monitorizados etiquetados con speech-recognition, ordenados por estrellas.
- #121★ 719+0Variación de estrellas de los últimos 7 días
- #122
Conversión de voz a texto y subtítulos mediante entrada de teclado para OBS, VRChat, chat de Twitch y Discord
★ 718+0Variación de estrellas de los últimos 7 días - #123
Kit de herramientas de código abierto para reconocimiento de voz de extremo a extremo utilizando PyTorch-Lightning y Hydra.
★ 714+0Variación de estrellas de los últimos 7 días - #124
Motor de conversión de voz a intención en el dispositivo impulsado por aprendizaje profundo.
★ 712+3Variación de estrellas de los últimos 7 días - #125
Ejemplos de API de voz.
★ 708+0Variación de estrellas de los últimos 7 días - #126
Framework de evaluación comparativa de voz a texto.
★ 697+0Variación de estrellas de los últimos 7 días - #127
Reconocimiento de voz sin conexión con OpenAI Whisper y TensorFlow Lite para Android
★ 688+0Variación de estrellas de los últimos 7 días - #128
Artículos de INTERSPEECH 2023-2024: Una colección completa de artículos de investigación influyentes y destacados de la conferencia INTERSPEECH 2023-24. Explora los últimos avances en procesamiento de voz y lenguaje. Incluye código.
★ 684+0Variación de estrellas de los últimos 7 días - #129
Un conjunto de datos de audio gratuito de dígitos hablados. Una versión de audio de MNIST.
★ 678+0Variación de estrellas de los últimos 7 días - #130
Reconocimiento de voz para proyectos de React Native Expo.
★ 678+6Variación de estrellas de los últimos 7 días - #131
Un sistema ASR integral de grado industrial con módulos ASR, VAD, LID y Punc. FireRedASR2 admite chino (mandarín, más de 20 dialectos/acentos), inglés, cambio de código, y reconocimiento de voz y canto. FireRedVAD admite voz/canto/música en más de 100 idiomas. FireRedLID admite más de 100 idiomas y más de 20 dialectos chinos. FireRedPunc admite chino e inglés.
★ 672+13Variación de estrellas de los últimos 7 días - #132
Motor de conversión de voz a texto en tiempo real ejecutado en el dispositivo mediante aprendizaje profundo.
★ 671+0Variación de estrellas de los últimos 7 días - #133
Interfaz de línea de comandos para las capacidades integradas de reconocimiento y transcripción de voz en macOS.
★ 669+0Variación de estrellas de los últimos 7 días - #134
¡ChatGPT en casa! Una mejor alternativa a los asistentes domésticos inteligentes comerciales, construida en Raspberry Pi usando LiteLLM y LangGraph.
★ 648+1Variación de estrellas de los últimos 7 días - #135★ 638+0Variación de estrellas de los últimos 7 días
- #136
Editor de método de entrada (IME) para Android basado en Whisper
★ 633+6Variación de estrellas de los últimos 7 días - #137
Traducción de audio en tiempo real, captura audio del sistema y micrófono, ejecuta ASR (Whisper/SenseVoice) y traduce mediante la API de LLM con visualización en streaming. Ideal para VTubers, streamers y consumo de contenido extranjero.
★ 626+38Variación de estrellas de los últimos 7 días - #138
Transcripción en tiempo real utilizando faster-whisper
★ 614+0Variación de estrellas de los últimos 7 días - #139
Runtime hub en C++ ggml para modelos ASR y TTS multilingües: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., además de alineación forzada universal y más
★ 611+20Variación de estrellas de los últimos 7 días - #140
Decodificador de Clasificación Temporal Conexionista (CTC) con diccionario y modelo de lenguaje.
★ 580+1Variación de estrellas de los últimos 7 días - #141
Una canalización optimizada de voz a texto para el modelo Whisper que admite múltiples motores de inferencia
★ 578+1Variación de estrellas de los últimos 7 días - #142
El sistema de autocodificación para tu aplicación: Alan AI SDK para React Native
★ 575+0Variación de estrellas de los últimos 7 días - #143
Un lenguaje de programación modular basado en nodos, creador de programas, sistema de animación, kit de herramientas, enrutador y depurador diseñado para VRChat.
★ 562-1Variación de estrellas de los últimos 7 días - #144
🗣 Una superposición que obtiene el permiso de voz del usuario y la entrada como texto en una interfaz de usuario personalizable
★ 557+1Variación de estrellas de los últimos 7 días - #145
SpeechIO Leaderboard: una plataforma de evaluación comparativa amplia, robusta y completa para el reconocimiento automático de voz.
★ 553+3Variación de estrellas de los últimos 7 días - #146
Lista de APIs de reconocimiento de voz (STT) en coreano con sus respectivos benchmarks de rendimiento.
★ 547+1Variación de estrellas de los últimos 7 días - #147
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541+14Variación de estrellas de los últimos 7 días - #148
Agente interactivo de voz a voz de alta calidad y con transmisión en continuo en un solo archivo.
★ 540+0Variación de estrellas de los últimos 7 días - #149
Motor de reconocimiento automático de voz (ASR) y texto a voz (TTS). Reconocimiento de voz en chino e inglés, síntesis de voz multi-rol, soporte multilingüe y alta precisión
★ 530+1Variación de estrellas de los últimos 7 días - #150
Una biblioteca de reconocimiento de voz que se ejecuta en el navegador gracias a una compilación en WebAssembly de Vosk
★ 529+1Variación de estrellas de los últimos 7 días