stt
Repositorios de código abierto monitorizados etiquetados con stt, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a stt en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con stt.
- #1
Medidor de gastos y control de presupuesto para agentes de voz con IA. Mide STT, TTS, LLM y telefonía por llamada (Pipecat, LiveKit — Python y TypeScript). Detiene la ejecución antes de exceder el límite establecido. Local, sin cuentas ni telemetría. Creado por Floe para el control de costes en Voice AI.
★ 434
- #1
Tu segundo cerebro con IA. Autohospedable. Obtén respuestas de la web o de tus documentos. Construye agentes personalizados, programa automatizaciones, realiza investigaciones profundas. Convierte cualquier LLM en línea o local en tu IA personal y autónoma (gpt, claude, gemini, llama, qwen, mistral). Comienza gratis.
★ 36.787+149Variación de estrellas de los últimos 7 días - #2
API de reconocimiento de voz sin conexión para Android, iOS, Raspberry Pi y servidores con Python, Java, C# y Node.
★ 15.084+17Variación de estrellas de los últimos 7 días - #3
Voz a texto, reconocimiento de intenciones y texto a voz de muy baja latencia para construir agentes e interfaces de voz.
★ 10.964+52Variación de estrellas de los últimos 7 días - #4
Open Vision Agents de Stream. Crea agentes de voz y visión rápidamente con cualquier modelo o proveedor de video. Utiliza la red perimetral de Stream para una latencia ultrabaja.
★ 8104+9Variación de estrellas de los últimos 7 días - #5
Herramienta de reconocimiento de voz a texto / Una herramienta local fuera de línea para la conversión de audio y video a subtítulos, que genera formatos JSON, subtítulos SRT y texto plano
★ 4771+7Variación de estrellas de los últimos 7 días - #6
Transcribe cualquier audio a texto, traduce y edita subtítulos 100% localmente con una interfaz de usuario web. ¡Impulsado por modelos whisper!
★ 3067+5Variación de estrellas de los últimos 7 días - #7
🐸STT - El kit de herramientas de aprendizaje profundo para conversión de voz a texto (Speech-to-Text). Entrenar y desplegar modelos STT nunca ha sido tan fácil.
★ 2605+1Variación de estrellas de los últimos 7 días - #8
🎙 Reconocimiento de voz utilizando el framework de aprendizaje profundo TensorFlow y redes neuronales sequence-to-sequence.
★ 2173+1Variación de estrellas de los últimos 7 días - #9
Juguetes de IA de voz en tiempo real con más de 100 modelos en Arduino ESP32 con WebSockets seguros y Edge Functions para compañeros y dispositivos de IA
★ 1937+4Variación de estrellas de los últimos 7 días - #10
Conoce a Ava, el agente de WhatsApp
★ 1673+1Variación de estrellas de los últimos 7 días - #11
Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.
★ 1620+7Variación de estrellas de los últimos 7 días - #12
Aplicación de asistente Dicio para Android
★ 1462+17Variación de estrellas de los últimos 7 días - #13
Speech-AI-Forge es un proyecto desarrollado en torno a un modelo de generación TTS, que implementa un servidor API y una interfaz web basada en Gradio.
★ 1418+4Variación de estrellas de los últimos 7 días - #14
Traducción sincronizada para videos. Doblaje de video
★ 1413+5Variación de estrellas de los últimos 7 días - #15
Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.
★ 1399+0Variación de estrellas de los últimos 7 días - #16
Plataforma de gestión empresarial Java para XiaoZhi ESP32, que ofrece una solución integral de backend y frontend para monitoreo de dispositivos, personalización de voz, cambio de roles y gestión de registros de diálogo.
★ 1337+0Variación de estrellas de los últimos 7 días - #17
Gp.nvim: plugin de IA para Neovim que ofrece sesiones de ChatGPT, operaciones de texto/código y conversión de voz a texto [OpenAI, Ollama, Anthropic, etc.]
★ 1320+0Variación de estrellas de los últimos 7 días - #18
Traducción de voz en tiempo real para macOS y Windows, TTS gratuito, sin servidor, solo usa tus propias claves API
★ 1277+3Variación de estrellas de los últimos 7 días - #19
Traducción de voz bidireccional en tiempo real para reuniones bilingües: detecta automáticamente el idioma hablado y traduce en ambas direcciones, ya sea en la nube o completamente offline en el dispositivo. Disponible para escritorio (Windows, macOS, Linux) y extensiones de navegador (Chrome, Edge) para Zoom, Meet, Teams y cualquier aplicación.
★ 1164+37Variación de estrellas de los últimos 7 días - #20
NobodyWho es un motor de inferencia que permite ejecutar LLMs local y eficientemente en cualquier dispositivo.
★ 1081+11Variación de estrellas de los últimos 7 días - #21
🎤 Lobe TTS - Una biblioteca de TTS/STT confiable y de alta calidad para servidor y navegador
★ 805+2Variación de estrellas de los últimos 7 días - #22
Asistente de voz inteligente que convierte el habla en texto limpio, acciones útiles y conocimiento estructurado. Ayuda a los usuarios a capturar ideas, comunicarse de forma natural, automatizar tareas repetitivas y mantener la productividad en diferentes aplicaciones y flujos de trabajo.
★ 801+6Variación de estrellas de los últimos 7 días - #23
Conversión de voz a texto y de texto a voz. Envía texto como mensajes OSC a VRChat para mostrarlo en el avatar.
★ 799+1Variación de estrellas de los últimos 7 días - #24
Un SDK modular de Swift para procesamiento de audio con MLX en Apple Silicon.
★ 768+5Variación de estrellas de los últimos 7 días - #25
Ejecución de un modelo de voz a texto (whisper.cpp) en Unity3d en su máquina local.
★ 750-2Variación de estrellas de los últimos 7 días - #26
MLX Omni Server es un servidor de inferencia local basado en el framework MLX de Apple, diseñado específicamente para chips Apple Silicon (serie M). Implementa endpoints de API compatibles con OpenAI, lo que permite una integración fluida con clientes del SDK de OpenAI mientras aprovecha la potencia de la inferencia de ML local.
★ 741+5Variación de estrellas de los últimos 7 días - #27
Motor de conversión de voz a texto en tiempo real ejecutado en el dispositivo mediante aprendizaje profundo.
★ 671+0Variación de estrellas de los últimos 7 días - #28★ 638+0Variación de estrellas de los últimos 7 días
- #29
Un componente de React para facilitar y acelerar la corrección de transcripciones automatizadas de audio y video. Por BBC News Labs. - En desarrollo
★ 621+0Variación de estrellas de los últimos 7 días - #30
Runtime hub en C++ ggml para modelos ASR y TTS multilingües: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., además de alineación forzada universal y más
★ 599+26Variación de estrellas de los últimos 7 días