speech-to-text
Repositorios de código abierto monitorizados etiquetados con speech-to-text, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a speech-to-text en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con speech-to-text.
- #1
Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.
★ 2214 - #2
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 965 - #3
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541 - #4
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 541 - #5
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501
- #1
Puerto del modelo Whisper de OpenAI en C/C++
★ 53.389+103Variación de estrellas de los últimos 7 días - #2
Una aplicación de conversión de voz a texto gratuita, de código abierto y extensible que funciona completamente sin conexión.
★ 30.916+280Variación de estrellas de los últimos 7 días - #3
Asistente de reuniones de IA con prioridad en la privacidad, transcripción en vivo con Parakeet/Whisper 4 veces más rápida, diarización de hablantes y resumen con Ollama integrado en Rust. Procesamiento 100% local, sin necesidad de nube. Meetily (Meetly Ai - https://meetily.ai) es el anotador de reuniones de IA de código abierto y autohospedado número 1 para macOS y Windows. Comprende cómo redactar actas de reuniones
★ 30.252+195Variación de estrellas de los últimos 7 días - #4★ 25.859+113Variación de estrellas de los últimos 7 días
- #5
Transcripción de Whisper más rápida con CTranslate2
★ 25.206+71Variación de estrellas de los últimos 7 días - #6
WhisperX: Reconocimiento automático de voz con marcas de tiempo a nivel de palabra (y diarización).
★ 23.864+61Variación de estrellas de los últimos 7 días - #7
YC (S26) | Open Computer History | Graba tu pantalla continuamente de forma local y proporciona contexto a tus agentes (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21.376+80Variación de estrellas de los últimos 7 días - #8
Kit de herramientas de reconocimiento de voz de código abierto para entrenamiento, inferencia, ASR en streaming, VAD, puntuación, canalizaciones de diarización de altavoces y servicio compatible con OpenAI/MCP.
★ 20.136+64Variación de estrellas de los últimos 7 días - #9
Traduce el video de un idioma a otro e incorpora doblaje y subtítulos.
★ 18.871+38Variación de estrellas de los últimos 7 días - #10★ 17.476+1Variación de estrellas de los últimos 7 días
- #11★ 15.474+3Variación de estrellas de los últimos 7 días
- #12
API de reconocimiento de voz sin conexión para Android, iOS, Raspberry Pi y servidores con Python, Java, C# y Node.
★ 15.101+17Variación de estrellas de los últimos 7 días - #13
VoiceStudio es la alternativa a ElevenLabs de código abierto y totalmente local: clonación de voz, diseño de voz, doblaje de vídeo, dictado, transcripción y creación de audiolibros en 646 idiomas.
★ 14.835+2880Variación de estrellas de los últimos 7 días - #14
Conversión de voz a texto, de texto a voz, diarización de hablantes, mejora de voz, separación de fuentes y VAD utilizando la nueva generación de Kaldi con onnxruntime sin conexión a Internet. Soporta sistemas embebidos, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket y 12 lenguajes de programación.
★ 14.575+95Variación de estrellas de los últimos 7 días - #15
Crea agentes de voz con modelos de código abierto
★ 13.015+82Variación de estrellas de los últimos 7 días - #16
Gradio WebUI para creadores y desarrolladores, con TTS clave (Edge-TTS, kokoro) y clonación de voz zero-shot (E2 & F5-TTS, CosyVoice), procesamiento de audio con Whisper, descarga de YouTube, aislamiento vocal con Demucs y traducción multilingüe.
★ 12.730+54Variación de estrellas de los últimos 7 días - #17
Un kit de herramientas de voz basado en PyTorch
★ 11.802+10Variación de estrellas de los últimos 7 días - #18
Voz a texto local en tiempo real con ASR en streaming, diarización de hablantes, traducción y API compatibles con OpenAI/Deepgram.
★ 10.990+16Variación de estrellas de los últimos 7 días - #19
Una biblioteca de conversión de voz a texto robusta, eficiente y de baja latencia, con detección avanzada de actividad de voz, activación por palabra clave y transcripción instantánea.
★ 10.108+18Variación de estrellas de los últimos 7 días - #20
Modelo de código abierto SenseVoiceSmall para ASR en mandarín, cantonés, inglés, japonés y coreano, identificación de idiomas, reconocimiento de emociones y detección de eventos de audio.
★ 9209+37Variación de estrellas de los últimos 7 días - #21
Módulo de reconocimiento de voz para Python, compatible con varios motores y APIs, en línea y fuera de línea.
★ 8987+0Variación de estrellas de los últimos 7 días - #22
Un sistema de reconocimiento de voz en chino basado en aprendizaje profundo
★ 8386+0Variación de estrellas de los últimos 7 días - #23
Una biblioteca de texto a voz (TTS), voz a texto (STT) y voz a voz (STS) construida sobre el framework MLX de Apple, que proporciona un análisis de voz eficiente en Apple Silicon.
★ 7826+23Variación de estrellas de los últimos 7 días - #24★ 6815-1Variación de estrellas de los últimos 7 días
- #25
IA de voz en el dispositivo para Apple Silicon.
★ 6353+8Variación de estrellas de los últimos 7 días - #26
Herramienta de transcripción de video, generación de subtítulos y recorte asistido por LLM basada en FunASR, con una interfaz de usuario local de Gradio
★ 6210+13Variación de estrellas de los últimos 7 días - #27
Aplicación de dictado de voz a texto con modelos locales (Nvidia Parakeet/Whisper) y en la nube (BYOK). Privacidad primero y multiplataforma.
★ 6133+305Variación de estrellas de los últimos 7 días - #28
Silero Models: modelos de texto a voz preentrenados hechos extremadamente sencillos
★ 6084-1Variación de estrellas de los últimos 7 días - #29
Convierte tu PC, Mac o equipo Linux en un servidor de IA. Inferencia de LLM, interfaz de chat, voz, agentes, flujos de trabajo, RAG y generación de imágenes.
★ 5931+1108Variación de estrellas de los últimos 7 días - #30
Reconocimiento automático de voz con diarización de hablantes basado en OpenAI Whisper
★ 5634+1Variación de estrellas de los últimos 7 días