Saltar al contenido principal
buildradar
Sign in
Tema · speech

speech

Repositorios de código abierto monitorizados etiquetados con speech, ordenados por estrellas.

74 repositorios
  • MARS5-TTS@Camb-ai

    Modelo de voz (TTS) MARS5 de CAMB.AI

    2818+1Variación de estrellas de los últimos 7 días
  • speechgpt@hahahumble

    💬 SpeechGPT es una aplicación web que te permite conversar con ChatGPT.

    2750-1Variación de estrellas de los últimos 7 días
  • gTTS@pndurette

    Biblioteca de Python y herramienta de línea de comandos para interactuar con la API de conversión de texto a voz de Google Translate

    2628+0Variación de estrellas de los últimos 7 días
  • ten-vad@TEN-framework

    Detector de actividad de voz (VAD): baja latencia, alto rendimiento y ligero

    2256+7Variación de estrellas de los últimos 7 días
  • IMS-Toucan@DigitalPhonetics

    ¡Texto a voz controlable y rápido para más de 7000 idiomas!

    2207-1Variación de estrellas de los últimos 7 días
  • soloud@jarikomppa

    Motor de audio gratuito, fácil y portátil para juegos

    2170+3Variación de estrellas de los últimos 7 días
  • openai-edge-tts@travisvn

    Endpoint de API de texto a voz gratuito y de alta calidad para reemplazar OpenAI, Azure o ElevenLabs

    2075+5Variación de estrellas de los últimos 7 días
  • Praat: Fonética por computadora

    1970+1Variación de estrellas de los últimos 7 días
  • julius@julius-speech

    Motor de reconocimiento de voz continuo de vocabulario amplio de código abierto

    1935+1Variación de estrellas de los últimos 7 días
  • Lista comunitaria de startups que trabajan con IA en tecnología de audio y música.

    1769+1Variación de estrellas de los últimos 7 días
  • SALMONN@bytedance

    Familia SALMONN: un conjunto de LLMs multimodales avanzados.

    1521+3Variación de estrellas de los últimos 7 días
  • voicefixer@haoheliu

    Restauración general de voz.

    1375+0Variación de estrellas de los últimos 7 días
  • CrisperWhisper@nyrahealth

    Transcripción controlable. Literal (incluyendo muletillas, pausas, tartamudeos, sonidos vocales) o intencionada (lo que el hablante quiso decir, optimizado para legibilidad) con marcas de tiempo a nivel de palabra.

    1371+13Variación de estrellas de los últimos 7 días
  • nlp-paper@DengBoCong

    Artículos relevantes en el campo del procesamiento de lenguaje natural (con notas de lectura), modelos de reproducción y procesamiento de datos (código disponible en versiones TensorFlow y PyTorch)

    1333+1Variación de estrellas de los últimos 7 días
  • MTools@HG-ha

    MTools es una potente aplicación de escritorio multifuncional que integra procesamiento de audio y vídeo, edición de imágenes, operaciones de texto y herramientas de codificación, con funciones de IA integradas. Diseñado para simplificar tu flujo de trabajo y mejorar la productividad.

    1305+5Variación de estrellas de los últimos 7 días
  • StreamSpeech@ictnlp

    StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.

    1288+0Variación de estrellas de los últimos 7 días
  • Deep-Learning-Experiments@roatienza

    Videos, notas y experimentos para comprender el aprendizaje profundo

    1198+0Variación de estrellas de los últimos 7 días
  • lhotse@lhotse-speech

    Herramientas para gestionar datos multimodales en proyectos de machine learning.

    1149-1Variación de estrellas de los últimos 7 días
  • conformer@sooftware

    Implementación no oficial en PyTorch de Conformer: Convolution-augmented Transformer for Speech Recognition (INTERSPEECH 2020).

    1132+1Variación de estrellas de los últimos 7 días
  • pykaldi@pykaldi

    Un wrapper de Python para Kaldi

    1040+1Variación de estrellas de los últimos 7 días
  • FireRedTTS@FireRedTeam

    Un sistema TTS fundamental potenciado por LLM de código abierto

    920+1Variación de estrellas de los últimos 7 días
  • inaSpeechSegmenter@ina-foss

    Kit de herramientas de segmentación de audio basado en CNN. Permite detectar voz, música, ruido y el género del hablante. Diseñado para estudios de igualdad de género a gran escala basados en el tiempo de habla por género.

    910+1Variación de estrellas de los últimos 7 días
  • diffwave@lmnt-com

    DiffWave es un vocoder neuronal y sintetizador de formas de onda rápido y de alta calidad.

    885+0Variación de estrellas de los últimos 7 días
  • AnyGPT@OpenMOSS

    Código para "AnyGPT: LLM multimodal unificado con modelado de secuencia discreta"

    881-1Variación de estrellas de los últimos 7 días
  • PPASR@yeyupiaoling

    Reconocimiento de voz en chino de extremo a extremo basado en PaddlePaddle, desde conceptos básicos hasta proyectos empresariales prácticos. Soporta modelos populares como DeepSpeech2, Conformer y Squeezeformer

    870-1Variación de estrellas de los últimos 7 días
  • Voxtral ASR & TTS ejecutándose de forma nativa y en el navegador. Una implementación en Rust del ASR/TTS en tiempo real de Mistral Voxtral mini utilizando el framework Burn ML.

    819+2Variación de estrellas de los últimos 7 días
  • AlphaAvatar@AlphaAvatar

    Un Omni Avatar interactivo en tiempo real construido sobre LiveKit, que permite una integración fluida con cualquier componente de avatar de código abierto (modelo en tiempo real, visual, voz, memoria, búsqueda, etc.).

    813+4Variación de estrellas de los últimos 7 días
  • XR3Player@goxr3plus

    El reproductor multimedia JavaFX más avanzado

    771+0Variación de estrellas de los últimos 7 días
  • cboard@cboard-org

    Sistema de comunicación aumentativa y alternativa (AAC) con conversión de texto a voz para el navegador.

    755+9Variación de estrellas de los últimos 7 días
  • allosaurus@xinjli

    Allosaurus es un reconocedor fonético universal preentrenado para más de 2000 idiomas

    746+4Variación de estrellas de los últimos 7 días
← Volver a temas