speech
Repositorios de código abierto monitorizados etiquetados con speech, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a speech en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con speech.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
🐸💬 - Un conjunto de herramientas de aprendizaje profundo para texto a voz (TTS), probado en combate en investigación y producción
★ 45.967+36Variación de estrellas de los últimos 7 días - #2
🚀 Clona una voz en 5 segundos para generar voz arbitraria en tiempo real
★ 36.912-1Variación de estrellas de los últimos 7 días - #3
VoxCPM2: TTS sin tokenizador para generación de voz multilingüe, diseño de voz creativo y clonación realista
★ 36.250+293Variación de estrellas de los últimos 7 días - #4
WhisperX: Reconocimiento automático de voz con marcas de tiempo a nivel de palabra (y diarización).
★ 23.803+117Variación de estrellas de los últimos 7 días - #5
🤗 El mayor centro de conjuntos de datos listos para usar para modelos de IA con herramientas de manipulación de datos rápidas, fáciles de usar y eficientes
★ 21.878+34Variación de estrellas de los últimos 7 días - #6
Grounded SAM: Combinando Grounding DINO con Segment Anything, Stable Diffusion y Recognize Anything: detecta, segmenta y genera cualquier cosa automáticamente
★ 17.713+3Variación de estrellas de los últimos 7 días - #7★ 15.471+7Variación de estrellas de los últimos 7 días
- #8
Crea agentes de voz con modelos de código abierto
★ 12.933+180Variación de estrellas de los últimos 7 días - #9★ 10.166-2Variación de estrellas de los últimos 7 días
- #10
Silero VAD: Detector de actividad de voz de nivel empresarial preentrenado
★ 10.083+52Variación de estrellas de los últimos 7 días - #11
ModelScope: da vida al concepto de Model-as-a-Service.
★ 9117+19Variación de estrellas de los últimos 7 días - #12
EmotiVoice 😊: Un motor TTS multi-voz y controlado por avisos
★ 8523+2Variación de estrellas de los últimos 7 días - #13
Mantenido oficialmente y con soporte de PaddlePaddle, incluye CV, NLP, Speech, Rec, TS, modelos grandes y más.
★ 6932+0Variación de estrellas de los últimos 7 días - #14★ 6816+1Variación de estrellas de los últimos 7 días
- #15
Silero Models: modelos de texto a voz preentrenados hechos extremadamente sencillos
★ 6085+11Variación de estrellas de los últimos 7 días - #16
Cuantización, núcleos, entorno de ejecución y motor de inferencia para dispositivos móviles, wearables, hogares inteligentes y robots.
★ 5955+71Variación de estrellas de los últimos 7 días - #17
Reconocimiento automático de voz con diarización de hablantes basado en OpenAI Whisper
★ 5633+7Variación de estrellas de los últimos 7 días - #18
Herramienta de reconocimiento de voz a texto / Una herramienta local fuera de línea para la conversión de audio y video a subtítulos, que genera formatos JSON, subtítulos SRT y texto plano
★ 4771+7Variación de estrellas de los últimos 7 días - #19
Supresión de ruido mediante filtrado profundo
★ 4636+14Variación de estrellas de los últimos 7 días - #20★ 4556+7Variación de estrellas de los últimos 7 días
- #21
Un kit de herramientas de procesamiento de voz impulsado por IA y modelos preentrenados SOTA de código abierto, compatible con mejora de voz, separación y extracción del hablante objetivo, etc.
★ 4449+19Variación de estrellas de los últimos 7 días - #22
Modelo fundacional para TTS expresivo y de aspecto humano
★ 4204-1Variación de estrellas de los últimos 7 días - #23
🚀 Colección seleccionada de increíbles scripts de Python desde básicos hasta avanzados con scripts de tareas de automatización.
★ 3663+5Variación de estrellas de los últimos 7 días - #24
Una herramienta de conversión de voz simple y de alta calidad, enfocada en la facilidad de uso y el rendimiento.
★ 3660+39Variación de estrellas de los últimos 7 días - #25
API de servicio web para OpenAI Whisper ASR
★ 3326+2Variación de estrellas de los últimos 7 días - #26
Ejemplos de código para las nuevas APIs de iOS 10.
★ 3273-2Variación de estrellas de los últimos 7 días - #27
Manipulación y transformación de datos para el procesamiento de señales de audio, impulsado por PyTorch
★ 2931+6Variación de estrellas de los últimos 7 días - #28★ 2864+0Variación de estrellas de los últimos 7 días
- #29
aeneas es una biblioteca de Python/C y un conjunto de herramientas para sincronizar automáticamente audio y texto (también conocido como alineación forzada)
★ 2862-1Variación de estrellas de los últimos 7 días - #30
Reconocimiento automático del habla multilingüe con marcas de tiempo a nivel de palabra y puntuación de confianza
★ 2841+2Variación de estrellas de los últimos 7 días