speech-to-text
Repositorios de código abierto monitorizados etiquetados con speech-to-text, ordenados por estrellas.
- #61
Conversión de voz a texto local para macOS mediante IA en el dispositivo, totalmente privada, con nube opcional
★ 1759+0Variación de estrellas de los últimos 7 días - #62
Forma declarativa de ejecutar modelos de IA en React Native en el dispositivo, impulsada por ExecuTorch.
★ 1707+0Variación de estrellas de los últimos 7 días - #63
Recopilación de todo el contenido de Hu Chenfeng
★ 1650+0Variación de estrellas de los últimos 7 días - #64
Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.
★ 1622+0Variación de estrellas de los últimos 7 días - #65
Plugin de OBS para reconocimiento de voz y subtitulado local mediante IA.
★ 1597+0Variación de estrellas de los últimos 7 días - #66
Servidor de inferencia LLM de alto rendimiento compatible con OpenAI y Anthropic para Apple Silicon. Incluye MLX nativo, procesamiento por lotes continuo, modelos multimodales, llamadas a herramientas MCP y soporte para Claude Code.
★ 1557+0Variación de estrellas de los últimos 7 días - #67
API de TikTok LIVE para Python: la biblioteca definitiva de terceros para recibir eventos de transmisión en vivo (comentarios, regalos, etc.) en tiempo real de TikTok LIVE.
★ 1544+0Variación de estrellas de los últimos 7 días - #68
Habla con tu Mac, consulta tus documentos, sin necesidad de la nube. IA de voz en el dispositivo + RAG.
★ 1542+0Variación de estrellas de los últimos 7 días - #69
Nodos personalizados que amplían las capacidades de Comfyui
★ 1525+0Variación de estrellas de los últimos 7 días - #70
🎙️ Aplicación de dictado por IA - Código abierto y local-first ⚡ Escribe 3 veces más rápido, sin necesidad de teclado. 🆓 Impulsada por modelos de código abierto, funciona sin conexión, rápida y precisa.
★ 1520+0Variación de estrellas de los últimos 7 días - #71
Familia de modelos ASR de código abierto basados en LLM para chino, dialectos, acentos y voz multilingüe, con motores de ejecución como FunASR, vLLM, streaming y llama.cpp.
★ 1512+0Variación de estrellas de los últimos 7 días - #72
Cada reunión, cada idea, cada nota de voz, buscable por tu IA. Capa de memoria de conversación de código abierto y centrada en la privacidad.
★ 1462+0Variación de estrellas de los últimos 7 días - #73
Traducción sincronizada para videos. Doblaje de video
★ 1413+0Variación de estrellas de los últimos 7 días - #74
Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.
★ 1399+0Variación de estrellas de los últimos 7 días - #75
Ajuste fino de LLM en tu Mac con Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding y ajuste fino de OCR, de forma nativa en MLX. API compatible con Unsloth.
★ 1398+0Variación de estrellas de los últimos 7 días - #76
Aplicación Whisper con múltiples backends. Extremadamente rápida, optimizada para Mac-arm, fácil de instalar. Transcribe archivos locales o URLs usando Whisper AI de forma privada y gratuita.
★ 1394+0Variación de estrellas de los últimos 7 días - #77
Cliente de línea de comandos para Whisper, compatible con el cliente original de OpenAI y basado en CTranslate2.
★ 1346+0Variación de estrellas de los últimos 7 días - #78
Conversión de voz a texto con función push-to-talk para compositores de Wayland.
★ 1338+0Variación de estrellas de los últimos 7 días - #79
Gp.nvim: plugin de IA para Neovim que ofrece sesiones de ChatGPT, operaciones de texto/código y conversión de voz a texto [OpenAI, Ollama, Anthropic, etc.]
★ 1320+0Variación de estrellas de los últimos 7 días - #80
Motor de inferencia offline para arte, conversaciones de voz en tiempo real, chatbots impulsados por LLM y flujos de trabajo automatizados
★ 1314+0Variación de estrellas de los últimos 7 días - #81
StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.
★ 1288+0Variación de estrellas de los últimos 7 días - #82★ 1212+0Variación de estrellas de los últimos 7 días
- #83
Conversión de voz a texto nativa para Linux: sistema de dictado global rápido, preciso, privado y hackeable
★ 1189+0Variación de estrellas de los últimos 7 días - #84
Estudio de IA local sin censura para Windows, Linux y macOS. Interfaz gráfica sin configuración para generación de imágenes, LLMs GGUF, conversión de texto a voz y de voz a texto.
★ 1118+13Variación de estrellas de los últimos 7 días - #85
VTuber con IA para streaming en YouTube/Twitch.
★ 1116+3Variación de estrellas de los últimos 7 días - #86
Muesli: transcripción y dictado de reuniones locales para macOS (alternativa a Granola y WisprFlow).
★ 1105+35Variación de estrellas de los últimos 7 días - #87
La aplicación de iOS de código abierto que hace que la transcripción de voz de calidad sea más accesible en dispositivos móviles.
★ 1102+6Variación de estrellas de los últimos 7 días - #88
💬📝 Una pequeña aplicación de dictado que utiliza el modelo de reconocimiento de voz Whisper de OpenAI.
★ 1100+0Variación de estrellas de los últimos 7 días - #89
Conversión de voz a texto totalmente local, privada y multiplataforma con posprocesamiento mediante LLM
★ 1056+9Variación de estrellas de los últimos 7 días - #90
SDK de voz con IA de código abierto. La alternativa a Vapi/Retell para desarrolladores que desean ser dueños de su stack. Asigna un número de teléfono a tu agente de IA en 4 líneas: Python y TypeScript, bajo licencia MIT, compatible con Twilio, Telnyx y Plivo.
★ 1051+7Variación de estrellas de los últimos 7 días