Saltar al contenido principal
buildradar
Sign in
Tema · speech-to-text

speech-to-text

Repositorios de código abierto monitorizados etiquetados con speech-to-text, ordenados por estrellas.

152 repositorios
  • dograh@dograh-hq

    Plataforma de voz de IA de código abierto. Alternativa autohospedada a Vapi y Retell. En local (On Prem), BYOK para conversión de voz a voz o LLM/STT/TTS, con un creador visual de flujos de trabajo, compatibilidad nativa con MCP y telefonía

    5568+45Variación de estrellas de los últimos 7 días
  • YouDub-webui@liuzhao1225

    Herramienta de localización de video con IA de código abierto: automatiza la descarga de videos de YouTube/Bilibili, reconocimiento y traducción de subtítulos, clonación de voz y doblaje, mezcla de pistas de audio y subtitulado integrado.

    5404+25Variación de estrellas de los últimos 7 días
  • stt@jianchang512

    Herramienta de reconocimiento de voz a texto / Una herramienta local fuera de línea para la conversión de audio y video a subtítulos, que genera formatos JSON, subtítulos SRT y texto plano

    4780+9Variación de estrellas de los últimos 7 días
  • whisper-jax@sanchit-gandhi

    Implementación en JAX del modelo Whisper de OpenAI para una aceleración de hasta 70x en TPU.

    4679-1Variación de estrellas de los últimos 7 días
  • fastrtc@gradio-app

    La biblioteca de Python para comunicación en tiempo real

    4624+0Variación de estrellas de los últimos 7 días
  • auto-subs@tmoroney

    Generación de subtítulos en el dispositivo que se conecta directamente con DaVinci Resolve, Premiere y After Effects.

    4122+20Variación de estrellas de los últimos 7 días
  • Herramienta de traducción de audio/voz en tiempo real ligera y potente basada en Windows LiveCaptions.

    3637+33Variación de estrellas de los últimos 7 días
  • openless@Open-Less

    Mantén presionada una tecla, habla, suelta: el texto optimizado por IA aparece en el cursor en cualquier aplicación. Entrada de voz de código abierto para macOS y Windows.

    3403+44Variación de estrellas de los últimos 7 días
  • API de servicio web para OpenAI Whisper ASR

    3328+2Variación de estrellas de los últimos 7 días
  • Ejecutables independientes de Whisper y Faster-Whisper para quienes no quieren lidiar con Python.

    3171+2Variación de estrellas de los últimos 7 días
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni es un modelo de interacción de voz de extremo a extremo de baja latencia y alta calidad construido sobre Llama-3.1-8B-Instruct, con el objetivo de lograr capacidades de voz al nivel de GPT-4o.

    3147+1Variación de estrellas de los últimos 7 días
  • willow@HeyWillow

    Alternativa de asistente de voz de código abierto, local y autohospedada que compite con Amazon Echo y Google Home

    3101+1Variación de estrellas de los últimos 7 días
  • whishper@pluja

    Transcribe cualquier audio a texto, traduce y edita subtítulos 100% localmente con una interfaz de usuario web. ¡Impulsado por modelos whisper!

    3068+2Variación de estrellas de los últimos 7 días
  • lingvo@tensorflow

    Lingvo.

    2864+0Variación de estrellas de los últimos 7 días
  • whisper-timestamped@linto-ai

    Reconocimiento automático del habla multilingüe con marcas de tiempo a nivel de palabra y puntuación de confianza

    2842+1Variación de estrellas de los últimos 7 días
  • vexa@Vexa-ai

    API de transcripción de reuniones de código abierto para Google Meet, Microsoft Teams y Zoom. Bots de unión automática, transcripciones en tiempo real por WebSocket, servidor MCP para agentes de IA. Autohospedado o mediante SaaS.

    2741+15Variación de estrellas de los últimos 7 días
  • FluidAudio@FluidInference

    Modelos de audio CoreML de vanguardia en tus aplicaciones: texto a voz, voz a texto, detección de actividad de voz y diarización de hablantes. En Swift, impulsado por código abierto SOTA.

    2723+13Variación de estrellas de los últimos 7 días
  • pluely@iamsrikanthnani

    La alternativa de código abierto a Cluely: un asistente de IA ultrarrápido y centrado en la privacidad que funciona sin problemas durante reuniones, entrevistas y conversaciones sin que nadie lo note. Construido con Tauri para un rendimiento nativo, de solo 10 MB. Completamente sigiloso en videollamadas, pantallas compartidas y grabaciones.

    2619+12Variación de estrellas de los últimos 7 días
  • STT@coqui-ai

    🐸STT - El kit de herramientas de aprendizaje profundo para conversión de voz a texto (Speech-to-Text). Entrenar y desplegar modelos STT nunca ha sido tan fácil.

    2606+1Variación de estrellas de los últimos 7 días
  • foundry-local@microsoft
    2537+6Variación de estrellas de los últimos 7 días
  • awesome-whisper@sindresorhus

    🔊 Lista impresionante para Whisper, un sistema de reconocimiento de voz impulsado por IA de código abierto desarrollado por OpenAI

    2375+1Variación de estrellas de los últimos 7 días
  • openscreen@getopenscreen

    Graba tu pantalla, publica una demo. Gratis y de código abierto, acelerado por GPU, sin marcas de agua, sin suscripciones. Windows, macOS, Linux. Mantenimiento activo.

    2287+122Variación de estrellas de los últimos 7 días
  • ququ@yan5xu

    Alternativa abierta y gratuita a Wispr Flow | Flujo de trabajo de voz de escritorio en chino de próxima generación con integración del modelo local FunASR y modelos de lenguaje grande configurables

    2278+5Variación de estrellas de los últimos 7 días
  • audio.cpp@0xShug0

    Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.

    2214+115Variación de estrellas de los últimos 7 días
  • WhisperJAV@meizhong986

    Generador de subtítulos ASR/STT. Utiliza Qwen3-ASR, LLM local, Whisper, TEN-VAD. Robusto frente al ruido para JAV

    2196+17Variación de estrellas de los últimos 7 días
  • 🎙 Reconocimiento de voz utilizando el framework de aprendizaje profundo TensorFlow y redes neuronales sequence-to-sequence.

    2173+0Variación de estrellas de los últimos 7 días
  • soloud@jarikomppa

    Motor de audio gratuito, fácil y portátil para juegos

    2170+3Variación de estrellas de los últimos 7 días
  • vad@ricky0123

    Detector de actividad de voz (VAD) para el navegador con una API sencilla

    2046+1Variación de estrellas de los últimos 7 días
  • audapolis@bugbakery

    un editor para audio hablado con transcripción automática

    1892+2Variación de estrellas de los últimos 7 días
  • transcribe.cpp@handy-computer

    Inferencia de voz a texto con ggml para más de 16 familias de modelos

    1872+19Variación de estrellas de los últimos 7 días
← Volver a temas