Saltar al contenido principal
buildradar
Iniciar sesión
Tema · speech-to-text

speech-to-text

Repositorios de código abierto monitorizados etiquetados con speech-to-text, ordenados por estrellas.

152 repositorios
  • Colección de recursos sobre las aplicaciones de modelos de lenguaje (LLM) en IA de audio.

    738+0Variación de estrellas de los últimos 7 días
  • MASR@yeyupiaoling

    Marco de trabajo de reconocimiento automático de voz (ASR) en PyTorch para modelos de transmisión y no transmisión, compatible con reconocimiento en línea y fuera de línea. Soporta modelos Conformer, Squeezeformer y DeepSpeech2, además de diversos métodos de aumento de datos.

    727+0Variación de estrellas de los últimos 7 días
  • voice-ai@rapidaai

    Rapida es una plataforma de orquestación de voz con IA de código abierto para crear agentes de voz conversacionales en tiempo real, con streaming de audio, STT, TTS, VAD, integración multicanal, gestión de estado del agente y observabilidad.

    723+4Variación de estrellas de los últimos 7 días
  • adapt@MycroftAI

    Analizador de intenciones Adapt

    720+1Variación de estrellas de los últimos 7 días
  • curses@mmpneo

    Conversión de voz a texto y subtítulos mediante entrada de teclado para OBS, VRChat, chat de Twitch y Discord

    718-1Variación de estrellas de los últimos 7 días
  • speech-demo@Baidu-AIP

    Ejemplos de API de voz.

    707-1Variación de estrellas de los últimos 7 días
  • Framework de evaluación comparativa de voz a texto.

    698+1Variación de estrellas de los últimos 7 días
  • WhisperSubTranslate@Blue-B

    Una aplicación de escritorio local y gratuita para extraer subtítulos (SRT) de videos y traducirlos a cualquier idioma; uso ilimitado, sin registro, sin nube.

    688+19Variación de estrellas de los últimos 7 días
  • Reconocimiento de voz para proyectos de React Native Expo.

    678+4Variación de estrellas de los últimos 7 días
  • openlrc@zh-plus

    Transcribe y traduce voz a archivos LRC usando Whisper y LLMs (GPT, Claude, etc.).

    678+3Variación de estrellas de los últimos 7 días
  • cheetah@Picovoice

    Motor de conversión de voz a texto en tiempo real ejecutado en el dispositivo mediante aprendizaje profundo.

    671+0Variación de estrellas de los últimos 7 días
  • sonus@evancohen

    STT (speech to text) para Node con detección de palabras clave sin conexión

    638+0Variación de estrellas de los últimos 7 días
  • Proctoring-AI@vardanagarwal

    Creación de software para la supervisión automática en exámenes en línea.

    634-1Variación de estrellas de los últimos 7 días
  • macparakeet@moona3k

    Aplicación de voz rápida, privada y local para Macs con Apple Silicon: dictado, transcripción de archivos/medios, grabación de reuniones, transformaciones y una CLI de automatización pública. Gratuita y de código abierto.

    633+14Variación de estrellas de los últimos 7 días
  • pindrop@watzon

    Una aplicación nativa de dictado para la barra de menús de macOS que utiliza conversión de voz a texto local con WhisperKit.

    621+1Variación de estrellas de los últimos 7 días
  • CrispASR@CrispStrobe

    Runtime hub en C++ ggml para modelos ASR y TTS multilingües: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., además de alineación forzada universal y más

    619+13Variación de estrellas de los últimos 7 días
  • speech-to-text@reriiasu

    Transcripción en tiempo real utilizando faster-whisper

    614+0Variación de estrellas de los últimos 7 días
  • Sayboard@ElishaAz

    Un IME (teclado) de voz de código abierto que funciona en el dispositivo para Android, utilizando la biblioteca Vosk.

    582+4Variación de estrellas de los últimos 7 días
  • Una biblioteca de Python para resolver reCAPTCHA v2 y v3 con Playwright.

    579+3Variación de estrellas de los últimos 7 días
  • WhisperS2T@shashikg

    Una canalización optimizada de voz a texto para el modelo Whisper que admite múltiples motores de inferencia

    578+0Variación de estrellas de los últimos 7 días
  • VRCOSC@VolcanicArts

    Un lenguaje de programación modular basado en nodos, creador de programas, sistema de animación, kit de herramientas, enrutador y depurador diseñado para VRChat.

    564+0Variación de estrellas de los últimos 7 días
  • 🗣 Una superposición que obtiene el permiso de voz del usuario y la entrada como texto en una interfaz de usuario personalizable

    557+1Variación de estrellas de los últimos 7 días
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    549+25Variación de estrellas de los últimos 7 días
  • Talkify@tornikegomareli

    Lightning-fast, free, local first voice dictation for macOS with on-device transcription

    547+13Variación de estrellas de los últimos 7 días
  • Lista de APIs de reconocimiento de voz (STT) en coreano con sus respectivos benchmarks de rendimiento.

    547+0Variación de estrellas de los últimos 7 días
  • vosk-browser@ccoreilly

    Una biblioteca de reconocimiento de voz que se ejecuta en el navegador gracias a una compilación en WebAssembly de Vosk

    529+1Variación de estrellas de los últimos 7 días
  • Phonetisaurus@AdolfVonKleist

    Phonetisaurus G2P

    521-1Variación de estrellas de los últimos 7 días
  • Esta herramienta utiliza IA para evaluar tu pronunciación.

    518+2Variación de estrellas de los últimos 7 días
  • opentypeless@tover0314-w

    Open-source AI voice typing for macOS, Windows, and Linux. Press a hotkey, speak naturally, get polished text in any app.

    516Variación de estrellas de los últimos 7 días
  • transcribee@bugbakery

    Software de transcripción de audio y video de código abierto

    515+0Variación de estrellas de los últimos 7 días
← Volver a temas