asr
Repositorios de código abierto monitorizados etiquetados con asr, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a asr en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con asr.
- #1
Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.
★ 2214 - #2
Motor de análisis multimodal todo en uno + motor de conocimiento listo para IA, basado en ontologías y wiki de LLM
★ 1014 - #3
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501 - #4
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 327
- #1
WhisperX: Reconocimiento automático de voz con marcas de tiempo a nivel de palabra (y diarización).
★ 23.864+61Variación de estrellas de los últimos 7 días - #2
Kit de herramientas de reconocimiento de voz de código abierto para entrenamiento, inferencia, ASR en streaming, VAD, puntuación, canalizaciones de diarización de altavoces y servicio compatible con OpenAI/MCP.
★ 20.136+64Variación de estrellas de los últimos 7 días - #3
Un framework de IA generativa escalable creado para investigadores y desarrolladores que trabajan en Modelos de Lenguaje Grande, Multimodal y IA de Voz (Reconocimiento Automático de Voz y Text-to-Speech)
★ 18.379+21Variación de estrellas de los últimos 7 días - #4
API de reconocimiento de voz sin conexión para Android, iOS, Raspberry Pi y servidores con Python, Java, C# y Node.
★ 15.101+17Variación de estrellas de los últimos 7 días - #5
Conversión de voz a texto, de texto a voz, diarización de hablantes, mejora de voz, separación de fuentes y VAD utilizando la nueva generación de Kaldi con onnxruntime sin conexión a Internet. Soporta sistemas embebidos, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket y 12 lenguajes de programación.
★ 14.575+95Variación de estrellas de los últimos 7 días - #6
Kit de herramientas de voz fácil de usar que incluye modelo de aprendizaje autosupervisado, ASR de transmisión/SOTA con puntuación, TTS de transmisión con interfaz de texto, sistema de verificación de hablantes, traducción de voz de extremo a extremo y detección de palabras clave. Ganador del premio al mejor demo en NAACL2022.
★ 12.676+5Variación de estrellas de los últimos 7 días - #7
Un kit de herramientas de voz basado en PyTorch
★ 11.802+10Variación de estrellas de los últimos 7 días - #8
Modelo de código abierto SenseVoiceSmall para ASR en mandarín, cantonés, inglés, japonés y coreano, identificación de idiomas, reconocimiento de emociones y detección de eventos de audio.
★ 9209+37Variación de estrellas de los últimos 7 días - #9
Esta es una API de Python que te permite obtener la transcripción o subtítulos de un video de YouTube dado. ¡También funciona para subtítulos generados automáticamente y no requiere una clave de API ni un navegador headless, como lo hacen otras soluciones basadas en selenium!
★ 8143+14Variación de estrellas de los últimos 7 días - #10
🤖 wukong-robot es un proyecto de robot de diálogo de voz en chino / altavoz inteligente simple, flexible y elegante. Admite la capacidad de conversación de múltiples turnos de ChatGPT y puede ser el primer proyecto de altavoz inteligente de código abierto que admite la interacción cerebro-computadora.
★ 7126+2Variación de estrellas de los últimos 7 días - #11
Herramienta de transcripción de video, generación de subtítulos y recorte asistido por LLM basada en FunASR, con una interfaz de usuario local de Gradio
★ 6210+13Variación de estrellas de los últimos 7 días - #12
Reconocimiento automático de voz con diarización de hablantes basado en OpenAI Whisper
★ 5634+1Variación de estrellas de los últimos 7 días - #13
Formatos html5 js grabación mp3 wav ogg webm amr g711a g711u, compatible con PC y algunos navegadores web de Android e iOS, Hybrid App (código fuente de Android e iOS incluido), WeChat, ofrece ejemplo de chat de voz H5 con conversión de voz a texto ASR y codificación/decodificación DTMF
★ 5631+3Variación de estrellas de los últimos 7 días - #14
Kit de herramientas de reconocimiento de voz de extremo a extremo listo para producción y centrado en la producción
★ 5229+1Variación de estrellas de los últimos 7 días - #15
El reproductor de medios para el aprendizaje de idiomas, con subtítulos duales, subtítulos generados por IA, traducción en tiempo real ¡y más!
★ 4070+12Variación de estrellas de los últimos 7 días - #16
Streamer-Sales: Un LLM para streamers de ventas que genera explicaciones de productos para incentivar la compra. Incluye flujo de datos, aceleración de inferencia con LMDeploy, RAG, TTS, generación de avatares digitales, agentes con búsqueda web, ASR, frontend en Vue, backend en FastAPI y despliegue con Docker-compose.
★ 3764+1Variación de estrellas de los últimos 7 días - #17
Mantén presionada una tecla, habla, suelta: el texto optimizado por IA aparece en el cursor en cualquier aplicación. Entrada de voz de código abierto para macOS y Windows.
★ 3403+44Variación de estrellas de los últimos 7 días - #18
API de servicio web para OpenAI Whisper ASR
★ 3328+2Variación de estrellas de los últimos 7 días - #19
Ejecutables independientes de Whisper y Faster-Whisper para quienes no quieren lidiar con Python.
★ 3171+2Variación de estrellas de los últimos 7 días - #20
[AutoArk] ¡GPA (Audio de Propósito General) puede hacer reconocimiento de voz (ASR), síntesis de voz (TTS) y conversión de voz con un modelo diminuto!
★ 3061+164Variación de estrellas de los últimos 7 días - #21
Interfaz gráfica para faster_whisper con PySide6
★ 2995+4Variación de estrellas de los últimos 7 días - #22★ 2864+0Variación de estrellas de los últimos 7 días
- #23
Reconocimiento automático del habla multilingüe con marcas de tiempo a nivel de palabra y puntuación de confianza
★ 2842+1Variación de estrellas de los últimos 7 días - #24
Modelos de audio CoreML de vanguardia en tus aplicaciones: texto a voz, voz a texto, detección de actividad de voz y diarización de hablantes. En Swift, impulsado por código abierto SOTA.
★ 2723+13Variación de estrellas de los últimos 7 días - #25
🐸STT - El kit de herramientas de aprendizaje profundo para conversión de voz a texto (Speech-to-Text). Entrenar y desplegar modelos STT nunca ha sido tan fácil.
★ 2606+1Variación de estrellas de los últimos 7 días - #26
Extracción rápida de contenido de audio y video, organizado en notas de markdown estructuradas.
★ 2483+7Variación de estrellas de los últimos 7 días - #27
Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.
★ 2214+115Variación de estrellas de los últimos 7 días - #28
Modelos ASR de grado industrial de código abierto que admiten mandarín, dialectos chinos e inglés, logrando un nuevo SOTA en benchmarks públicos de ASR en mandarín, y ofreciendo además una capacidad excepcional de reconocimiento de letras de canciones.
★ 1975+2Variación de estrellas de los últimos 7 días - #29
Inferencia de voz a texto con ggml para más de 16 familias de modelos
★ 1872+19Variación de estrellas de los últimos 7 días - #30
Framework de IA+IoT de próxima generación para T2/T3/T5AI/ESP32 y más: integración rápida de hardware IoT y agentes de IA
★ 1816+5Variación de estrellas de los últimos 7 días