speech-recognition
Repositorios de código abierto monitorizados etiquetados con speech-recognition, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a speech-recognition en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con speech-recognition.
- #1
Un tiempo de ejecución de voz en tiempo real que mantiene a los agentes hablando, trabajando y presentes. Tiempo de ejecución de voz en tiempo real para agentes de IA
★ 2362 - #2
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541 - #3
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501 - #4
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 327
- #1
🤗 Transformers: el marco de definición de modelos para aprendizaje automático de última generación en texto, visión, audio y modelos multimodales, tanto para inferencia como para entrenamiento.
★ 164.731+119Variación de estrellas de los últimos 7 días - #2
Puerto del modelo Whisper de OpenAI en C/C++
★ 53.389+103Variación de estrellas de los últimos 7 días - #3
Transcripción de Whisper más rápida con CTranslate2
★ 25.206+71Variación de estrellas de los últimos 7 días - #4
WhisperX: Reconocimiento automático de voz con marcas de tiempo a nivel de palabra (y diarización).
★ 23.864+61Variación de estrellas de los últimos 7 días - #5
Kit de herramientas de reconocimiento de voz de código abierto para entrenamiento, inferencia, ASR en streaming, VAD, puntuación, canalizaciones de diarización de altavoces y servicio compatible con OpenAI/MCP.
★ 20.136+64Variación de estrellas de los últimos 7 días - #6★ 17.476+1Variación de estrellas de los últimos 7 días
- #7★ 15.474+3Variación de estrellas de los últimos 7 días
- #8
API de reconocimiento de voz sin conexión para Android, iOS, Raspberry Pi y servidores con Python, Java, C# y Node.
★ 15.101+17Variación de estrellas de los últimos 7 días - #9
Scripts de Deep Learning de última generación organizados por modelos: fáciles de entrenar y desplegar con precisión y rendimiento reproducibles en infraestructura de nivel empresarial.
★ 14.846+4Variación de estrellas de los últimos 7 días - #10
¡Sumérgete en Deep Learning, Reinforcement Learning, Machine Learning, Computer Vision y NLP aprendiendo de estas emocionantes conferencias!
★ 12.939+3Variación de estrellas de los últimos 7 días - #11
Gradio WebUI para creadores y desarrolladores, con TTS clave (Edge-TTS, kokoro) y clonación de voz zero-shot (E2 & F5-TTS, CosyVoice), procesamiento de audio con Whisper, descarga de YouTube, aislamiento vocal con Demucs y traducción multilingüe.
★ 12.730+54Variación de estrellas de los últimos 7 días - #12
Kit de herramientas de voz fácil de usar que incluye modelo de aprendizaje autosupervisado, ASR de transmisión/SOTA con puntuación, TTS de transmisión con interfaz de texto, sistema de verificación de hablantes, traducción de voz de extremo a extremo y detección de palabras clave. Ganador del premio al mejor demo en NAACL2022.
★ 12.676+5Variación de estrellas de los últimos 7 días - #13
Un kit de herramientas de voz basado en PyTorch
★ 11.802+10Variación de estrellas de los últimos 7 días - #14
Voz a texto local en tiempo real con ASR en streaming, diarización de hablantes, traducción y API compatibles con OpenAI/Deepgram.
★ 10.990+16Variación de estrellas de los últimos 7 días - #15
OpenVINO™ es un kit de herramientas de código abierto para optimizar y desplegar inferencia de IA
★ 10.793+30Variación de estrellas de los últimos 7 días - #16★ 9949+3Variación de estrellas de los últimos 7 días
- #17
Modelo de código abierto SenseVoiceSmall para ASR en mandarín, cantonés, inglés, japonés y coreano, identificación de idiomas, reconocimiento de emociones y detección de eventos de audio.
★ 9209+37Variación de estrellas de los últimos 7 días - #18
Módulo de reconocimiento de voz para Python, compatible con varios motores y APIs, en línea y fuera de línea.
★ 8987+0Variación de estrellas de los últimos 7 días - #19
Un sistema de reconocimiento de voz en chino basado en aprendizaje profundo
★ 8386+0Variación de estrellas de los últimos 7 días - #20
Una biblioteca de texto a voz (TTS), voz a texto (STT) y voz a voz (STS) construida sobre el framework MLX de Apple, que proporciona un análisis de voz eficiente en Apple Silicon.
★ 7826+23Variación de estrellas de los últimos 7 días - #21★ 6815-1Variación de estrellas de los últimos 7 días
- #22
Kit de herramientas de reconocimiento automático de voz de Facebook AI Research
★ 6437+1Variación de estrellas de los últimos 7 días - #23
IA de voz en el dispositivo para Apple Silicon.
★ 6353+8Variación de estrellas de los últimos 7 días - #24★ 6254+3Variación de estrellas de los últimos 7 días
- #25
Herramienta de transcripción de video, generación de subtítulos y recorte asistido por LLM basada en FunASR, con una interfaz de usuario local de Gradio
★ 6210+13Variación de estrellas de los últimos 7 días - #26
Reconocimiento automático de voz con diarización de hablantes basado en OpenAI Whisper
★ 5634+1Variación de estrellas de los últimos 7 días - #27
Kit de herramientas de reconocimiento de voz de extremo a extremo listo para producción y centrado en la producción
★ 5229+1Variación de estrellas de los últimos 7 días - #28
Detección de palabra de activación en el dispositivo impulsada por aprendizaje profundo
★ 4928+3Variación de estrellas de los últimos 7 días - #29★ 4927+5Variación de estrellas de los últimos 7 días
- #30
Herramienta de reconocimiento de voz a texto / Una herramienta local fuera de línea para la conversión de audio y video a subtítulos, que genera formatos JSON, subtítulos SRT y texto plano
★ 4780+9Variación de estrellas de los últimos 7 días