Saltar al contenido principal
buildradar
Sign in
Tema · asr

asr

Repositorios de código abierto monitorizados etiquetados con asr, ordenados por estrellas.

87 repositorios
  • GLM-ASR@zai-org

    GLM-ASR-Nano: un modelo de reconocimiento de voz robusto y de código abierto con 1.5B de parámetros

    854+3Variación de estrellas de los últimos 7 días
  • Voxtral ASR & TTS ejecutándose de forma nativa y en el navegador. Una implementación en Rust del ASR/TTS en tiempo real de Mistral Voxtral mini utilizando el framework Burn ML.

    819+2Variación de estrellas de los últimos 7 días
  • voxt@hehehai

    Asistente de voz inteligente que convierte el habla en texto limpio, acciones útiles y conocimiento estructurado. Ayuda a los usuarios a capturar ideas, comunicarse de forma natural, automatizar tareas repetitivas y mantener la productividad en diferentes aplicaciones y flujos de trabajo.

    807+5Variación de estrellas de los últimos 7 días
  • ZerolanLiveRobot@AkagawaTsurunaki

    VTuber con IA que utiliza LLM, ASR, TTS, OCR, CV y otras tecnologías para realizar transmisiones en vivo o jugar Minecraft contigo.

    803+5Variación de estrellas de los últimos 7 días
  • BiBi-Keyboard@BryceWG

    BiBi Keyboard: Una aplicación de teclado para Android basada en Kotlin con LLM y entrada de voz ASR

    772+17Variación de estrellas de los últimos 7 días
  • cn2an@Ailln

    Conversión rápida entre números chinos y números arábigos (características recientes: fracciones, fechas, temperaturas, etc.).

    766+0Variación de estrellas de los últimos 7 días
  • PaddlePaddle-DeepSpeech@yeyupiaoling

    Reconocimiento de voz en chino implementado con PaddlePaddle. Proyecto completo con buenos resultados de reconocimiento. Soporta entrenamiento y predicción en Windows y Linux, además de predicción en placas Nvidia Jetson.

    763+0Variación de estrellas de los últimos 7 días
  • Ejecución de un modelo de voz a texto (whisper.cpp) en Unity3d en su máquina local.

    751+1Variación de estrellas de los últimos 7 días
  • MASR@yeyupiaoling

    Marco de trabajo de reconocimiento automático de voz (ASR) en PyTorch para modelos de transmisión y no transmisión, compatible con reconocimiento en línea y fuera de línea. Soporta modelos Conformer, Squeezeformer y DeepSpeech2, además de diversos métodos de aumento de datos.

    727+0Variación de estrellas de los últimos 7 días
  • openspeech@openspeech-team

    Kit de herramientas de código abierto para reconocimiento de voz de extremo a extremo utilizando PyTorch-Lightning y Hydra.

    714+0Variación de estrellas de los últimos 7 días
  • Reconocimiento de voz sin conexión con OpenAI Whisper y TensorFlow Lite para Android

    688+0Variación de estrellas de los últimos 7 días
  • Artículos de INTERSPEECH 2023-2024: Una colección completa de artículos de investigación influyentes y destacados de la conferencia INTERSPEECH 2023-24. Explora los últimos avances en procesamiento de voz y lenguaje. Incluye código.

    684+0Variación de estrellas de los últimos 7 días
  • pyannote-whisper@yinruiqing
    677+0Variación de estrellas de los últimos 7 días
  • FireRedASR2S@FireRedTeam

    Un sistema ASR integral de grado industrial con módulos ASR, VAD, LID y Punc. FireRedASR2 admite chino (mandarín, más de 20 dialectos/acentos), inglés, cambio de código, y reconocimiento de voz y canto. FireRedVAD admite voz/canto/música en más de 100 idiomas. FireRedLID admite más de 100 idiomas y más de 20 dialectos chinos. FireRedPunc admite chino e inglés.

    672+13Variación de estrellas de los últimos 7 días
  • cheetah@Picovoice

    Motor de conversión de voz a texto en tiempo real ejecutado en el dispositivo mediante aprendizaje profundo.

    671+0Variación de estrellas de los últimos 7 días
  • LiveTranslate@TheDeathDragon

    Traducción de audio en tiempo real, captura audio del sistema y micrófono, ejecuta ASR (Whisper/SenseVoice) y traduce mediante la API de LLM con visualización en streaming. Ideal para VTubers, streamers y consumo de contenido extranjero.

    626+38Variación de estrellas de los últimos 7 días
  • ASR_Theory@zw76859420

    Teoría, artículos y presentaciones sobre reconocimiento de voz

    618+0Variación de estrellas de los últimos 7 días
  • optimum-intel@huggingface

    🤗 Optimum Intel: Acelere la inferencia con herramientas de optimización de Intel

    617+1Variación de estrellas de los últimos 7 días
  • RapidASR@RapidAI

    Biblioteca de reconocimiento automático de voz de grado comercial, lista para usar, compatible con todas las plataformas y con reconocimiento mixto de chino e inglés. Implementación multiplataforma de inferencia ASR basada en ONNXRuntime y FunASR. Proporcionamos un conjunto de API más sencillas para invocar modelos ASR.

    611+0Variación de estrellas de los últimos 7 días
  • echokit_server@second-state

    Plataforma de agente de voz de código abierto.

    592+2Variación de estrellas de los últimos 7 días
  • WhisperS2T@shashikg

    Una canalización optimizada de voz a texto para el modelo Whisper que admite múltiples motores de inferencia

    578+1Variación de estrellas de los últimos 7 días
  • auto-caption@HiMeditator

    Un software multiplataforma de visualización de subtítulos en tiempo real.

    578+4Variación de estrellas de los últimos 7 días
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: una plataforma de evaluación comparativa amplia, robusta y completa para el reconocimiento automático de voz.

    553+3Variación de estrellas de los últimos 7 días
  • vosk-browser@ccoreilly

    Una biblioteca de reconocimiento de voz que se ejecuta en el navegador gracias a una compilación en WebAssembly de Vosk

    529+1Variación de estrellas de los últimos 7 días
  • ICASSP-2023-24-Papers@DmitryRyumin

    Artículos de ICASSP 2023-2024: Una colección completa de artículos de investigación influyentes y destacados de las conferencias ICASSP 2023-24. Explore los últimos avances en acústica, voz y procesamiento de señales. Código incluido. ¡Marque el repositorio con una estrella para apoyar el avance del procesamiento de audio y señales!

    526+1Variación de estrellas de los últimos 7 días
  • whisplay-ai-chatbot@PiSugar

    Chatbot de IA de bolsillo construido con una RPI Zero 2w / 5.

    513+10Variación de estrellas de los últimos 7 días
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501+7Variación de estrellas de los últimos 7 días
← Volver a temas