speech-to-text
Repositorios de código abierto monitorizados etiquetados con speech-to-text, ordenados por estrellas.
- #31
Plataforma de voz de IA de código abierto. Alternativa autohospedada a Vapi y Retell. En local (On Prem), BYOK para conversión de voz a voz o LLM/STT/TTS, con un creador visual de flujos de trabajo, compatibilidad nativa con MCP y telefonía
★ 5568+45Variación de estrellas de los últimos 7 días - #32
Herramienta de localización de video con IA de código abierto: automatiza la descarga de videos de YouTube/Bilibili, reconocimiento y traducción de subtítulos, clonación de voz y doblaje, mezcla de pistas de audio y subtitulado integrado.
★ 5404+25Variación de estrellas de los últimos 7 días - #33
Herramienta de reconocimiento de voz a texto / Una herramienta local fuera de línea para la conversión de audio y video a subtítulos, que genera formatos JSON, subtítulos SRT y texto plano
★ 4780+9Variación de estrellas de los últimos 7 días - #34
Implementación en JAX del modelo Whisper de OpenAI para una aceleración de hasta 70x en TPU.
★ 4679-1Variación de estrellas de los últimos 7 días - #35★ 4624+0Variación de estrellas de los últimos 7 días
- #36
Generación de subtítulos en el dispositivo que se conecta directamente con DaVinci Resolve, Premiere y After Effects.
★ 4122+20Variación de estrellas de los últimos 7 días - #37
Herramienta de traducción de audio/voz en tiempo real ligera y potente basada en Windows LiveCaptions.
★ 3637+33Variación de estrellas de los últimos 7 días - #38
Mantén presionada una tecla, habla, suelta: el texto optimizado por IA aparece en el cursor en cualquier aplicación. Entrada de voz de código abierto para macOS y Windows.
★ 3403+44Variación de estrellas de los últimos 7 días - #39
API de servicio web para OpenAI Whisper ASR
★ 3328+2Variación de estrellas de los últimos 7 días - #40
Ejecutables independientes de Whisper y Faster-Whisper para quienes no quieren lidiar con Python.
★ 3171+2Variación de estrellas de los últimos 7 días - #41
LLaMA-Omni es un modelo de interacción de voz de extremo a extremo de baja latencia y alta calidad construido sobre Llama-3.1-8B-Instruct, con el objetivo de lograr capacidades de voz al nivel de GPT-4o.
★ 3147+1Variación de estrellas de los últimos 7 días - #42
Alternativa de asistente de voz de código abierto, local y autohospedada que compite con Amazon Echo y Google Home
★ 3101+1Variación de estrellas de los últimos 7 días - #43
Transcribe cualquier audio a texto, traduce y edita subtítulos 100% localmente con una interfaz de usuario web. ¡Impulsado por modelos whisper!
★ 3068+2Variación de estrellas de los últimos 7 días - #44★ 2864+0Variación de estrellas de los últimos 7 días
- #45
Reconocimiento automático del habla multilingüe con marcas de tiempo a nivel de palabra y puntuación de confianza
★ 2842+1Variación de estrellas de los últimos 7 días - #46
API de transcripción de reuniones de código abierto para Google Meet, Microsoft Teams y Zoom. Bots de unión automática, transcripciones en tiempo real por WebSocket, servidor MCP para agentes de IA. Autohospedado o mediante SaaS.
★ 2741+15Variación de estrellas de los últimos 7 días - #47
Modelos de audio CoreML de vanguardia en tus aplicaciones: texto a voz, voz a texto, detección de actividad de voz y diarización de hablantes. En Swift, impulsado por código abierto SOTA.
★ 2723+13Variación de estrellas de los últimos 7 días - #48
La alternativa de código abierto a Cluely: un asistente de IA ultrarrápido y centrado en la privacidad que funciona sin problemas durante reuniones, entrevistas y conversaciones sin que nadie lo note. Construido con Tauri para un rendimiento nativo, de solo 10 MB. Completamente sigiloso en videollamadas, pantallas compartidas y grabaciones.
★ 2619+12Variación de estrellas de los últimos 7 días - #49
🐸STT - El kit de herramientas de aprendizaje profundo para conversión de voz a texto (Speech-to-Text). Entrenar y desplegar modelos STT nunca ha sido tan fácil.
★ 2606+1Variación de estrellas de los últimos 7 días - #50★ 2537+6Variación de estrellas de los últimos 7 días
- #51
🔊 Lista impresionante para Whisper, un sistema de reconocimiento de voz impulsado por IA de código abierto desarrollado por OpenAI
★ 2375+1Variación de estrellas de los últimos 7 días - #52
Graba tu pantalla, publica una demo. Gratis y de código abierto, acelerado por GPU, sin marcas de agua, sin suscripciones. Windows, macOS, Linux. Mantenimiento activo.
★ 2287+122Variación de estrellas de los últimos 7 días - #53
Alternativa abierta y gratuita a Wispr Flow | Flujo de trabajo de voz de escritorio en chino de próxima generación con integración del modelo local FunASR y modelos de lenguaje grande configurables
★ 2278+5Variación de estrellas de los últimos 7 días - #54
Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.
★ 2214+115Variación de estrellas de los últimos 7 días - #55
Generador de subtítulos ASR/STT. Utiliza Qwen3-ASR, LLM local, Whisper, TEN-VAD. Robusto frente al ruido para JAV
★ 2196+17Variación de estrellas de los últimos 7 días - #56
🎙 Reconocimiento de voz utilizando el framework de aprendizaje profundo TensorFlow y redes neuronales sequence-to-sequence.
★ 2173+0Variación de estrellas de los últimos 7 días - #57★ 2170+3Variación de estrellas de los últimos 7 días
- #58★ 2046+1Variación de estrellas de los últimos 7 días
- #59★ 1892+2Variación de estrellas de los últimos 7 días
- #60
Inferencia de voz a texto con ggml para más de 16 familias de modelos
★ 1872+19Variación de estrellas de los últimos 7 días