speech-to-text
Repositorios de código abierto monitorizados etiquetados con speech-to-text, ordenados por estrellas.
- #91
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 1018+424Variación de estrellas de los últimos 7 días - #92
:zap: TensorFlowASR: Reconocimiento automático de voz casi de última generación en TensorFlow 2. Idiomas compatibles que pueden usar caracteres o subpalabras
★ 1010+0Variación de estrellas de los últimos 7 días - #93★ 1006-1Variación de estrellas de los últimos 7 días
- #94
Whisper-Flow es un framework diseñado para permitir la transcripción en tiempo real de contenido de audio utilizando el modelo Whisper de OpenAI. En lugar de procesar archivos completos tras la carga ("modo por lotes"), Whisper-Flow acepta un flujo continuo de fragmentos de audio y produce transcripciones incrementales de inmediato.
★ 964+25Variación de estrellas de los últimos 7 días - #95
Transcripción de audio en tiempo casi real usando Whisper autohospedado y WebSocket en Python/JS.
★ 960+0Variación de estrellas de los últimos 7 días - #96
Procesamiento de voz Botium
★ 943+0Variación de estrellas de los últimos 7 días - #97
Whisper.net. Conversión de voz a texto simplificada mediante modelos Whisper.
★ 942+1Variación de estrellas de los últimos 7 días - #98
Evalúe su sistema de conversión de voz a texto con medidas de similitud como la tasa de error de palabras (WER)
★ 928+2Variación de estrellas de los últimos 7 días - #99
Ejemplos de .NET MAUI.
★ 915+0Variación de estrellas de los últimos 7 días - #100★ 911+2Variación de estrellas de los últimos 7 días
- #101
Modelos Whisper optimizados para streaming y uso en dispositivos.
★ 897-1Variación de estrellas de los últimos 7 días - #102
Aplicación de entrada de voz gratuita, de código abierto y centrada en la privacidad para macOS.
★ 896+4Variación de estrellas de los últimos 7 días - #103
Reconocimiento de voz en chino de extremo a extremo basado en PaddlePaddle, desde conceptos básicos hasta proyectos empresariales prácticos. Soporta modelos populares como DeepSpeech2, Conformer y Squeezeformer
★ 870-1Variación de estrellas de los últimos 7 días - #104
💬 Reconocimiento de voz para tu aplicación React
★ 842+0Variación de estrellas de los últimos 7 días - #105
Cree aplicaciones web de voz a texto en tiempo real utilizando Whisper de OpenAI https://openai.com/blog/whisper/
★ 835+0Variación de estrellas de los últimos 7 días - #106★ 823-1Variación de estrellas de los últimos 7 días
- #107
Software de generación de subtítulos totalmente automatizado: cubre todo el proceso de descarga, transcripción, traducción y codificación sin intervención humana.
★ 811+3Variación de estrellas de los últimos 7 días - #108
Dictado por voz gratuito, de código abierto y 100% offline para Linux. Habla y escribe en cualquier lugar mediante whisper.cpp, motores Whisper y VOSK, aceleración por GPU, funciona en X11 + Wayland.
★ 809+17Variación de estrellas de los últimos 7 días - #109
🎤 Lobe TTS - Una biblioteca de TTS/STT confiable y de alta calidad para servidor y navegador
★ 805-1Variación de estrellas de los últimos 7 días - #110
Conversión de voz a texto y de texto a voz. Envía texto como mensajes OSC a VRChat para mostrarlo en el avatar.
★ 804+5Variación de estrellas de los últimos 7 días - #111
Chatbot de voz local para conversaciones atractivas, impulsado por Ollama, Hugging Face Transformers y Coqui TTS Toolkit
★ 788+1Variación de estrellas de los últimos 7 días - #112
Proyecto que permite utilizar un micrófono con OpenAI Whisper.
★ 787+0Variación de estrellas de los últimos 7 días - #113
La forma más sencilla de transcribir audio en Swift
★ 785+0Variación de estrellas de los últimos 7 días - #114
Una aplicación de transcripción de voz por IA 100% privada que convierte voz a texto en más de 100 idiomas. Creada con Compose Multiplatform para Android e iOS usando Whisper AI; sin subidas a la nube, todo el procesamiento ocurre en el dispositivo para una privacidad total.
★ 779+4Variación de estrellas de los últimos 7 días - #115
Un SDK modular de Swift para procesamiento de audio con MLX en Apple Silicon.
★ 774+5Variación de estrellas de los últimos 7 días - #116
BiBi Keyboard: Una aplicación de teclado para Android basada en Kotlin con LLM y entrada de voz ASR
★ 774+15Variación de estrellas de los últimos 7 días - #117
Reconocimiento de voz en chino implementado con PaddlePaddle. Proyecto completo con buenos resultados de reconocimiento. Soporta entrenamiento y predicción en Windows y Linux, además de predicción en placas Nvidia Jetson.
★ 763+1Variación de estrellas de los últimos 7 días - #118★ 754+1Variación de estrellas de los últimos 7 días
- #119
Ejecución de un modelo de voz a texto (whisper.cpp) en Unity3d en su máquina local.
★ 751+1Variación de estrellas de los últimos 7 días - #120
Teclado y servicio de reconocimiento de voz privado y local para Android.
★ 745+2Variación de estrellas de los últimos 7 días