speech-recognition
Repositorios de código abierto monitorizados etiquetados con speech-recognition, ordenados por estrellas.
- #61
Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.
★ 1399+0Variación de estrellas de los últimos 7 días - #62
Ajuste fino de LLM en tu Mac con Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding y ajuste fino de OCR, de forma nativa en MLX. API compatible con Unsloth.
★ 1398+8Variación de estrellas de los últimos 7 días - #63
Transcripción controlable. Literal (incluyendo muletillas, pausas, tartamudeos, sonidos vocales) o intencionada (lo que el hablante quiso decir, optimizado para legibilidad) con marcas de tiempo a nivel de palabra.
★ 1371+13Variación de estrellas de los últimos 7 días - #64
Cliente de línea de comandos para Whisper, compatible con el cliente original de OpenAI y basado en CTranslate2.
★ 1346+2Variación de estrellas de los últimos 7 días - #65
Asistente personal construido con librerías de Python. Realiza diversas tareas como enviar correos, reconocimiento óptico de texto, reportes de noticias dinámicos mediante API, gestión de listas de tareas, apertura de sitios web por comando de voz, reproducción de música, búsquedas en Wikipedia, diccionario con corrección ortográfica inteligente y reportes meteorológicos.
★ 1341+5Variación de estrellas de los últimos 7 días - #66
Conversión de voz a texto con función push-to-talk para compositores de Wayland.
★ 1338+42Variación de estrellas de los últimos 7 días - #67
StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.
★ 1288+0Variación de estrellas de los últimos 7 días - #68
Pruna es un framework de optimización de modelos diseñado para desarrolladores, que permite entregar modelos más rápidos y eficientes con una sobrecarga mínima.
★ 1274+1Variación de estrellas de los últimos 7 días - #69
Servidor de reconocimiento de voz WebSocket, gRPC y WebRTC basado en las bibliotecas Vosk y Kaldi
★ 1262+1Variación de estrellas de los últimos 7 días - #70
Ajuste fino del modelo de reconocimiento de voz Whisper para admitir entrenamiento sin datos de marcas de tiempo, con datos de marcas de tiempo y sin datos de voz. Acelera la inferencia y admite despliegue en la web, en escritorio con Windows y en Android
★ 1222-1Variación de estrellas de los últimos 7 días - #71★ 1212-1Variación de estrellas de los últimos 7 días
- #72
💁 Impresionante colección de modelos Transformers para procesamiento de lenguaje natural que contiene artículos, videos, blogs, repositorio oficial junto con cuadernos de Colab. 🛫☑️
★ 1179+0Variación de estrellas de los últimos 7 días - #73
Laboratorio práctico para construir, probar y evaluar aplicaciones con el framework de modelos fundacionales de Apple.
★ 1178+1Variación de estrellas de los últimos 7 días - #74
Un diario privado con un equipo de asistentes personales de IA. Los agentes leen lo que registras y proponen qué hacer a continuación; tú apruebas los cambios. Sincronización cifrada de extremo a extremo entre tus dispositivos; los servidores solo ven texto cifrado. IA local opcional.
★ 1168+3Variación de estrellas de los últimos 7 días - #75
Kit de herramientas de voz con IA para Apple Silicon: ASR, TTS, voz a voz, VAD y diarización impulsados por MLX y CoreML
★ 1161+4Variación de estrellas de los últimos 7 días - #76
Irina: un asistente de voz en ruso para trabajar sin conexión. Admite habilidades mediante complementos.
★ 1153+0Variación de estrellas de los últimos 7 días - #77
Herramientas para gestionar datos multimodales en proyectos de machine learning.
★ 1149-1Variación de estrellas de los últimos 7 días - #78
El sistema de autocodificación para su aplicación: Alan AI SDK para Cordova.
★ 1132+0Variación de estrellas de los últimos 7 días - #79
Implementación no oficial en PyTorch de Conformer: Convolution-augmented Transformer for Speech Recognition (INTERSPEECH 2020).
★ 1132+1Variación de estrellas de los últimos 7 días - #80
SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.
★ 1118+143Variación de estrellas de los últimos 7 días - #81
VTuber con IA para streaming en YouTube/Twitch.
★ 1115+1Variación de estrellas de los últimos 7 días - #82
La aplicación de iOS de código abierto que hace que la transcripción de voz de calidad sea más accesible en dispositivos móviles.
★ 1102+8Variación de estrellas de los últimos 7 días - #83
💬📝 Una pequeña aplicación de dictado que utiliza el modelo de reconocimiento de voz Whisper de OpenAI.
★ 1100+2Variación de estrellas de los últimos 7 días - #84
Servidor de reconocimiento de voz dúplex completo en tiempo real, basado en el kit de herramientas Kaldi y el framework GStreamer.
★ 1094+1Variación de estrellas de los últimos 7 días - #85
Reconocimiento de voz sin conexión para Android con la biblioteca Vosk.
★ 1056+0Variación de estrellas de los últimos 7 días - #86★ 1040+1Variación de estrellas de los últimos 7 días
- #87
:zap: TensorFlowASR: Reconocimiento automático de voz casi de última generación en TensorFlow 2. Idiomas compatibles que pueden usar caracteres o subpalabras
★ 1010+0Variación de estrellas de los últimos 7 días - #88
Herramienta de edición que utiliza IA para transcribir, comprender contenido y buscar cualquier elemento en el metraje, integrada con ChatGPT y otros modelos de IA.
★ 1009+2Variación de estrellas de los últimos 7 días - #89★ 984+4Variación de estrellas de los últimos 7 días
- #90
Transcripción de audio en tiempo casi real usando Whisper autohospedado y WebSocket en Python/JS.
★ 960+1Variación de estrellas de los últimos 7 días