speech-to-text
Repositorios de código abierto monitorizados etiquetados con speech-to-text, ordenados por estrellas.
- #121
Colección de recursos sobre las aplicaciones de modelos de lenguaje (LLM) en IA de audio.
★ 738+0Variación de estrellas de los últimos 7 días - #122
Marco de trabajo de reconocimiento automático de voz (ASR) en PyTorch para modelos de transmisión y no transmisión, compatible con reconocimiento en línea y fuera de línea. Soporta modelos Conformer, Squeezeformer y DeepSpeech2, además de diversos métodos de aumento de datos.
★ 727+0Variación de estrellas de los últimos 7 días - #123
Rapida es una plataforma de orquestación de voz con IA de código abierto para crear agentes de voz conversacionales en tiempo real, con streaming de audio, STT, TTS, VAD, integración multicanal, gestión de estado del agente y observabilidad.
★ 723+4Variación de estrellas de los últimos 7 días - #124★ 720+1Variación de estrellas de los últimos 7 días
- #125
Conversión de voz a texto y subtítulos mediante entrada de teclado para OBS, VRChat, chat de Twitch y Discord
★ 718-1Variación de estrellas de los últimos 7 días - #126
Ejemplos de API de voz.
★ 707-1Variación de estrellas de los últimos 7 días - #127
Framework de evaluación comparativa de voz a texto.
★ 698+1Variación de estrellas de los últimos 7 días - #128
Una aplicación de escritorio local y gratuita para extraer subtítulos (SRT) de videos y traducirlos a cualquier idioma; uso ilimitado, sin registro, sin nube.
★ 688+19Variación de estrellas de los últimos 7 días - #129
Reconocimiento de voz para proyectos de React Native Expo.
★ 678+4Variación de estrellas de los últimos 7 días - #130★ 678+3Variación de estrellas de los últimos 7 días
- #131
Motor de conversión de voz a texto en tiempo real ejecutado en el dispositivo mediante aprendizaje profundo.
★ 671+0Variación de estrellas de los últimos 7 días - #132★ 638+0Variación de estrellas de los últimos 7 días
- #133
Creación de software para la supervisión automática en exámenes en línea.
★ 634-1Variación de estrellas de los últimos 7 días - #134
Aplicación de voz rápida, privada y local para Macs con Apple Silicon: dictado, transcripción de archivos/medios, grabación de reuniones, transformaciones y una CLI de automatización pública. Gratuita y de código abierto.
★ 633+14Variación de estrellas de los últimos 7 días - #135
Una aplicación nativa de dictado para la barra de menús de macOS que utiliza conversión de voz a texto local con WhisperKit.
★ 621+1Variación de estrellas de los últimos 7 días - #136
Runtime hub en C++ ggml para modelos ASR y TTS multilingües: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., además de alineación forzada universal y más
★ 619+13Variación de estrellas de los últimos 7 días - #137
Transcripción en tiempo real utilizando faster-whisper
★ 614+0Variación de estrellas de los últimos 7 días - #138
Un IME (teclado) de voz de código abierto que funciona en el dispositivo para Android, utilizando la biblioteca Vosk.
★ 582+4Variación de estrellas de los últimos 7 días - #139
Una biblioteca de Python para resolver reCAPTCHA v2 y v3 con Playwright.
★ 579+3Variación de estrellas de los últimos 7 días - #140
Una canalización optimizada de voz a texto para el modelo Whisper que admite múltiples motores de inferencia
★ 578+0Variación de estrellas de los últimos 7 días - #141
Un lenguaje de programación modular basado en nodos, creador de programas, sistema de animación, kit de herramientas, enrutador y depurador diseñado para VRChat.
★ 564+0Variación de estrellas de los últimos 7 días - #142
🗣 Una superposición que obtiene el permiso de voz del usuario y la entrada como texto en una interfaz de usuario personalizable
★ 557+1Variación de estrellas de los últimos 7 días - #143
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 549+25Variación de estrellas de los últimos 7 días - #144
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 547+13Variación de estrellas de los últimos 7 días - #145
Lista de APIs de reconocimiento de voz (STT) en coreano con sus respectivos benchmarks de rendimiento.
★ 547+0Variación de estrellas de los últimos 7 días - #146
Una biblioteca de reconocimiento de voz que se ejecuta en el navegador gracias a una compilación en WebAssembly de Vosk
★ 529+1Variación de estrellas de los últimos 7 días - #147
Phonetisaurus G2P
★ 521-1Variación de estrellas de los últimos 7 días - #148
Esta herramienta utiliza IA para evaluar tu pronunciación.
★ 518+2Variación de estrellas de los últimos 7 días - #149
Open-source AI voice typing for macOS, Windows, and Linux. Press a hotkey, speak naturally, get polished text in any app.
★ 516—Variación de estrellas de los últimos 7 días - #150
Software de transcripción de audio y video de código abierto
★ 515+0Variación de estrellas de los últimos 7 días