Saltar al contenido principal
buildradar
Sign in
Tema · speech-recognition

speech-recognition

Repositorios de código abierto monitorizados etiquetados con speech-recognition, ordenados por estrellas.

156 repositorios
  • Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.

    1399+0Variación de estrellas de los últimos 7 días
  • mlx-tune@ARahim3

    Ajuste fino de LLM en tu Mac con Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding y ajuste fino de OCR, de forma nativa en MLX. API compatible con Unsloth.

    1398+8Variación de estrellas de los últimos 7 días
  • CrisperWhisper@nyrahealth

    Transcripción controlable. Literal (incluyendo muletillas, pausas, tartamudeos, sonidos vocales) o intencionada (lo que el hablante quiso decir, optimizado para legibilidad) con marcas de tiempo a nivel de palabra.

    1371+13Variación de estrellas de los últimos 7 días
  • whisper-ctranslate2@Softcatala

    Cliente de línea de comandos para Whisper, compatible con el cliente original de OpenAI y basado en CTranslate2.

    1346+2Variación de estrellas de los últimos 7 días
  • J.A.R.V.I.S@GauravSingh9356

    Asistente personal construido con librerías de Python. Realiza diversas tareas como enviar correos, reconocimiento óptico de texto, reportes de noticias dinámicos mediante API, gestión de listas de tareas, apertura de sitios web por comando de voz, reproducción de música, búsquedas en Wikipedia, diccionario con corrección ortográfica inteligente y reportes meteorológicos.

    1341+5Variación de estrellas de los últimos 7 días
  • voxtype@peteonrails

    Conversión de voz a texto con función push-to-talk para compositores de Wayland.

    1338+42Variación de estrellas de los últimos 7 días
  • StreamSpeech@ictnlp

    StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.

    1288+0Variación de estrellas de los últimos 7 días
  • pruna@PrunaAI

    Pruna es un framework de optimización de modelos diseñado para desarrolladores, que permite entregar modelos más rápidos y eficientes con una sobrecarga mínima.

    1274+1Variación de estrellas de los últimos 7 días
  • vosk-server@alphacep

    Servidor de reconocimiento de voz WebSocket, gRPC y WebRTC basado en las bibliotecas Vosk y Kaldi

    1262+1Variación de estrellas de los últimos 7 días
  • Whisper-Finetune@yeyupiaoling

    Ajuste fino del modelo de reconocimiento de voz Whisper para admitir entrenamiento sin datos de marcas de tiempo, con datos de marcas de tiempo y sin datos de voz. Acelera la inferencia y admite despliegue en la web, en escritorio con Windows y en Android

    1222-1Variación de estrellas de los últimos 7 días
  • quillman@modal-labs

    Una aplicación de chat de voz.

    1212-1Variación de estrellas de los últimos 7 días
  • Treasure-of-Transformers@ashishpatel26

    💁 Impresionante colección de modelos Transformers para procesamiento de lenguaje natural que contiene artículos, videos, blogs, repositorio oficial junto con cuadernos de Colab. 🛫☑️

    1179+0Variación de estrellas de los últimos 7 días
  • Laboratorio práctico para construir, probar y evaluar aplicaciones con el framework de modelos fundacionales de Apple.

    1178+1Variación de estrellas de los últimos 7 días
  • lotti@matthiasn

    Un diario privado con un equipo de asistentes personales de IA. Los agentes leen lo que registras y proponen qué hacer a continuación; tú apruebas los cambios. Sincronización cifrada de extremo a extremo entre tus dispositivos; los servidores solo ven texto cifrado. IA local opcional.

    1168+3Variación de estrellas de los últimos 7 días
  • speech-swift@soniqo

    Kit de herramientas de voz con IA para Apple Silicon: ASR, TTS, voz a voz, VAD y diarización impulsados por MLX y CoreML

    1161+4Variación de estrellas de los últimos 7 días
  • Irina: un asistente de voz en ruso para trabajar sin conexión. Admite habilidades mediante complementos.

    1153+0Variación de estrellas de los últimos 7 días
  • lhotse@lhotse-speech

    Herramientas para gestionar datos multimodales en proyectos de machine learning.

    1149-1Variación de estrellas de los últimos 7 días
  • El sistema de autocodificación para su aplicación: Alan AI SDK para Cordova.

    1132+0Variación de estrellas de los últimos 7 días
  • conformer@sooftware

    Implementación no oficial en PyTorch de Conformer: Convolution-augmented Transformer for Speech Recognition (INTERSPEECH 2020).

    1132+1Variación de estrellas de los últimos 7 días
  • sglang-omni@sgl-project

    SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.

    1118+143Variación de estrellas de los últimos 7 días
  • AI-Waifu-Vtuber@ardha27

    VTuber con IA para streaming en YouTube/Twitch.

    1115+1Variación de estrellas de los últimos 7 días
  • Whisperboard@Saik0s

    La aplicación de iOS de código abierto que hace que la transcripción de voz de calidad sea más accesible en dispositivos móviles.

    1102+8Variación de estrellas de los últimos 7 días
  • whisper-writer@savbell

    💬📝 Una pequeña aplicación de dictado que utiliza el modelo de reconocimiento de voz Whisper de OpenAI.

    1100+2Variación de estrellas de los últimos 7 días
  • Servidor de reconocimiento de voz dúplex completo en tiempo real, basado en el kit de herramientas Kaldi y el framework GStreamer.

    1094+1Variación de estrellas de los últimos 7 días
  • Reconocimiento de voz sin conexión para Android con la biblioteca Vosk.

    1056+0Variación de estrellas de los últimos 7 días
  • pykaldi@pykaldi

    Un wrapper de Python para Kaldi

    1040+1Variación de estrellas de los últimos 7 días
  • TensorFlowASR@TensorSpeech

    :zap: TensorFlowASR: Reconocimiento automático de voz casi de última generación en TensorFlow 2. Idiomas compatibles que pueden usar caracteres o subpalabras

    1010+0Variación de estrellas de los últimos 7 días
  • StoryToolkitAI@octimot

    Herramienta de edición que utiliza IA para transcribir, comprender contenido y buscar cualquier elemento en el metraje, integrada con ChatGPT y otros modelos de IA.

    1009+2Variación de estrellas de los últimos 7 días
  • sherpa@k2-fsa

    Framework de servidor de voz a texto con Kaldi de próxima generación.

    984+4Variación de estrellas de los últimos 7 días
  • VoiceStreamAI@alesaccoia

    Transcripción de audio en tiempo casi real usando Whisper autohospedado y WebSocket en Python/JS.

    960+1Variación de estrellas de los últimos 7 días
← Volver a temas