Saltar al contenido principal
buildradar
Sign in
Tema · speech-recognition

speech-recognition

Repositorios de código abierto monitorizados etiquetados con speech-recognition, ordenados por estrellas.

156 repositorios
  • whisper-jax@sanchit-gandhi

    Implementación en JAX del modelo Whisper de OpenAI para una aceleración de hasta 70x en TPU.

    4679-1Variación de estrellas de los últimos 7 días
  • pocketsphinx@cmusphinx

    Un pequeño reconocedor de voz

    4337+2Variación de estrellas de los últimos 7 días
  • distil-whisper@huggingface

    Variante destilada de Whisper para reconocimiento de voz. 6 veces más rápido, 50% más pequeño y con una tasa de error de palabras inferior al 1%.

    4114+2Variación de estrellas de los últimos 7 días
  • API de servicio web para OpenAI Whisper ASR

    3328+2Variación de estrellas de los últimos 7 días
  • Ejecutables independientes de Whisper y Faster-Whisper para quienes no quieren lidiar con Python.

    3171+2Variación de estrellas de los últimos 7 días
  • willow@HeyWillow

    Alternativa de asistente de voz de código abierto, local y autohospedada que compite con Amazon Echo y Google Home

    3101+1Variación de estrellas de los últimos 7 días
  • whishper@pluja

    Transcribe cualquier audio a texto, traduce y edita subtítulos 100% localmente con una interfaz de usuario web. ¡Impulsado por modelos whisper!

    3068+2Variación de estrellas de los últimos 7 días
  • lingvo@tensorflow

    Lingvo.

    2864+0Variación de estrellas de los últimos 7 días
  • whisper-timestamped@linto-ai

    Reconocimiento automático del habla multilingüe con marcas de tiempo a nivel de palabra y puntuación de confianza

    2842+1Variación de estrellas de los últimos 7 días
  • STT@coqui-ai

    🐸STT - El kit de herramientas de aprendizaje profundo para conversión de voz a texto (Speech-to-Text). Entrenar y desplegar modelos STT nunca ha sido tan fácil.

    2606+1Variación de estrellas de los últimos 7 días
  • qwen-audio-agent@QwenAudio

    Un tiempo de ejecución de voz en tiempo real que mantiene a los agentes hablando, trabajando y presentes. Tiempo de ejecución de voz en tiempo real para agentes de IA

    2362+72Variación de estrellas de los últimos 7 días
  • 🎙 Reconocimiento de voz utilizando el framework de aprendizaje profundo TensorFlow y redes neuronales sequence-to-sequence.

    2173+0Variación de estrellas de los últimos 7 días
  • parlor@fikrikarim

    IA multimodal en tiempo real y en el dispositivo con funciones similares a GPT-Live

    2048+7Variación de estrellas de los últimos 7 días
  • FireRedASR@FireRedTeam

    Modelos ASR de grado industrial de código abierto que admiten mandarín, dialectos chinos e inglés, logrando un nuevo SOTA en benchmarks públicos de ASR en mandarín, y ofreciendo además una capacidad excepcional de reconocimiento de letras de canciones.

    1975+2Variación de estrellas de los últimos 7 días
  • masr@nobody132

    Reconocimiento de voz en chino mandarín; Mandarin Automatic Speech Recognition;

    1968+0Variación de estrellas de los últimos 7 días
  • julius@julius-speech

    Motor de reconocimiento de voz continuo de vocabulario amplio de código abierto

    1935+1Variación de estrellas de los últimos 7 días
  • Una lista curada de excelentes artículos, librerías, conjuntos de datos y otros recursos sobre Speaker Diarization.

    1894+1Variación de estrellas de los últimos 7 días
  • alan-sdk-ios@alan-ai

    El sistema de autocodificación para tu app — Alan AI SDK para iOS

    1878-3Variación de estrellas de los últimos 7 días
  • El sistema de autoprogramación para tu aplicación — Alan AI SDK para Android

    1807-1Variación de estrellas de los últimos 7 días
  • whisper-turbo@FL33TW00D

    Whisper multiplataforma acelerado por GPU 🏎️

    1794+0Variación de estrellas de los últimos 7 días
  • sherpa-ncnn@k2-fsa

    Reconocimiento de voz en tiempo real y detección de actividad de voz (VAD) utilizando la nueva generación de Kaldi con ncnn sin conexión a Internet. Compatible con iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre otros.

    1777-1Variación de estrellas de los últimos 7 días
  • El sistema de autocodificación para tu aplicación: Alan AI SDK para Flutter.

    1756-1Variación de estrellas de los últimos 7 días
  • alan-sdk-ionic@alan-ai

    El sistema de autocodificación para su aplicación: SDK de Alan AI para Ionic.

    1649-1Variación de estrellas de los últimos 7 días
  • dsnote@mkiol

    Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.

    1622+8Variación de estrellas de los últimos 7 días
  • Plugin de OBS para reconocimiento de voz y subtitulado local mediante IA.

    1597+8Variación de estrellas de los últimos 7 días
  • amica@semperai

    Amica es una interfaz de código abierto para la comunicación interactiva con personajes 3D mediante síntesis de voz y reconocimiento de voz.

    1591-2Variación de estrellas de los últimos 7 días
  • Nodos personalizados que amplían las capacidades de Comfyui

    1525+1Variación de estrellas de los últimos 7 días
  • SALMONN@bytedance

    Familia SALMONN: un conjunto de LLMs multimodales avanzados.

    1521+3Variación de estrellas de los últimos 7 días
  • Fun-ASR@QwenAudio

    Familia de modelos ASR de código abierto basados en LLM para chino, dialectos, acentos y voz multilingüe, con motores de ejecución como FunASR, vLLM, streaming y llama.cpp.

    1512+10Variación de estrellas de los últimos 7 días
  • SpeechT5@microsoft

    Preentrenamiento de voz-texto modal unificado para procesamiento de lenguaje hablado

    1449+0Variación de estrellas de los últimos 7 días
← Volver a temas