voice-activity-detection
Repositorios de código abierto monitorizados etiquetados con voice-activity-detection, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a voice-activity-detection en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con voice-activity-detection.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Kit de herramientas de reconocimiento de voz de código abierto para entrenamiento, inferencia, ASR en streaming, VAD, puntuación, canalizaciones de diarización de altavoces y servicio compatible con OpenAI/MCP.
★ 20.136+64Variación de estrellas de los últimos 7 días - #2
Bloques de construcción neuronales para la diarización de hablantes: detección de actividad de voz, detección de cambio de hablante, detección de voz superpuesta y embeddings de hablantes
★ 10.500+16Variación de estrellas de los últimos 7 días - #3
Supresión de ruido de micrófono en tiempo real en Linux.
★ 10.315+2Variación de estrellas de los últimos 7 días - #4
Silero VAD: Detector de actividad de voz de nivel empresarial preentrenado
★ 10.112+29Variación de estrellas de los últimos 7 días - #5★ 7864+7Variación de estrellas de los últimos 7 días
- #6
Modelos de audio CoreML de vanguardia en tus aplicaciones: texto a voz, voz a texto, detección de actividad de voz y diarización de hablantes. En Swift, impulsado por código abierto SOTA.
★ 2723+13Variación de estrellas de los últimos 7 días - #7
La alternativa de código abierto a Cluely: un asistente de IA ultrarrápido y centrado en la privacidad que funciona sin problemas durante reuniones, entrevistas y conversaciones sin que nadie lo note. Construido con Tauri para un rendimiento nativo, de solo 10 MB. Completamente sigiloso en videollamadas, pantallas compartidas y grabaciones.
★ 2619+12Variación de estrellas de los últimos 7 días - #8★ 2256+7Variación de estrellas de los últimos 7 días
- #9
🔊 Una lista completa de conjuntos de datos de código abierto para voz y computación de sonido (más de 95 conjuntos de datos).
★ 2223+1Variación de estrellas de los últimos 7 días - #10★ 2046+1Variación de estrellas de los últimos 7 días
- #11
Un paquete de Python para crear aplicaciones de audio en tiempo real impulsadas por IA
★ 2024+1Variación de estrellas de los últimos 7 días - #12
Reconocimiento de voz en tiempo real y detección de actividad de voz (VAD) utilizando la nueva generación de Kaldi con ncnn sin conexión a Internet. Compatible con iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre otros.
★ 1777-1Variación de estrellas de los últimos 7 días - #13
Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.
★ 1399+0Variación de estrellas de los últimos 7 días - #14
Kit de herramientas de voz con IA para Apple Silicon: ASR, TTS, voz a voz, VAD y diarización impulsados por MLX y CoreML
★ 1161+4Variación de estrellas de los últimos 7 días - #15
Asistente de IA en Python 🧠
★ 1014+0Variación de estrellas de los últimos 7 días - #16
Whisper.net. Conversión de voz a texto simplificada mediante modelos Whisper.
★ 941+1Variación de estrellas de los últimos 7 días - #17
Kit de herramientas de segmentación de audio basado en CNN. Permite detectar voz, música, ruido y el género del hablante. Diseñado para estudios de igualdad de género a gran escala basados en el tiempo de habla por género.
★ 910+1Variación de estrellas de los últimos 7 días - #18★ 860+1Variación de estrellas de los últimos 7 días
- #19
Un sistema ASR integral de grado industrial con módulos ASR, VAD, LID y Punc. FireRedASR2 admite chino (mandarín, más de 20 dialectos/acentos), inglés, cambio de código, y reconocimiento de voz y canto. FireRedVAD admite voz/canto/música en más de 100 idiomas. FireRedLID admite más de 100 idiomas y más de 20 dialectos chinos. FireRedPunc admite chino e inglés.
★ 670+12Variación de estrellas de los últimos 7 días - #20
Una canalización optimizada de voz a texto para el modelo Whisper que admite múltiples motores de inferencia
★ 578+1Variación de estrellas de los últimos 7 días - #21
Detección de actividad de voz y eventos de audio de grado industrial de última generación, compatible con más de 100 idiomas, superando a Silero-VAD, TEN-VAD, FunASR-VAD y WebRTC-VAD.
★ 520+5Variación de estrellas de los últimos 7 días - #22
Sincroniza y traduce subtítulos automáticamente, o crea nuevos mediante transcripción, utilizando DNN preentrenadas, alineaciones forzadas y Transformers. https://subaligner.readthedocs.io/
★ 509+0Variación de estrellas de los últimos 7 días - #23
Biblioteca de detección de actividad de voz (VAD) para Android. Soporta modelos WebRTC VAD GMM, Silero VAD DNN y Yamnet VAD DNN.
★ 506+1Variación de estrellas de los últimos 7 días