Saltar al contenido principal
buildradar
Sign in
Tema · asr

asr

Repositorios de código abierto monitorizados etiquetados con asr, ordenados por estrellas.

87 repositorios
  • sherpa-ncnn@k2-fsa

    Reconocimiento de voz en tiempo real y detección de actividad de voz (VAD) utilizando la nueva generación de Kaldi con ncnn sin conexión a Internet. Compatible con iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre otros.

    1777-1Variación de estrellas de los últimos 7 días
  • bailing@wwbin2017

    Bailing es un robot de conversación por voz similar a GPT-4o, implementado mediante ASR+LLM+TTS, que integra modelos avanzados como DeepSeek R1 y openClaw. Es un asistente de voz personal real con una latencia de hasta 800 ms, ejecutable en equipos de bajos recursos como Mac y con soporte para interrupciones.

    1759+2Variación de estrellas de los últimos 7 días
  • dsnote@mkiol

    Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.

    1622+8Variación de estrellas de los últimos 7 días
  • video-analyzer@byjlw

    Analiza videos utilizando LLMs, visión artificial y reconocimiento automático de voz

    1570+8Variación de estrellas de los últimos 7 días
  • amical@amicalhq

    🎙️ Aplicación de dictado por IA - Código abierto y local-first ⚡ Escribe 3 veces más rápido, sin necesidad de teclado. 🆓 Impulsada por modelos de código abierto, funciona sin conexión, rápida y precisa.

    1520+8Variación de estrellas de los últimos 7 días
  • Fun-ASR@QwenAudio

    Familia de modelos ASR de código abierto basados en LLM para chino, dialectos, acentos y voz multilingüe, con motores de ejecución como FunASR, vLLM, streaming y llama.cpp.

    1512+10Variación de estrellas de los últimos 7 días
  • Speech-AI-Forge@lenML

    Speech-AI-Forge es un proyecto desarrollado en torno a un modelo de generación TTS, que implementa un servidor API y una interfaz web basada en Gradio.

    1418+0Variación de estrellas de los últimos 7 días
  • SoniTranslate@R3gm

    Traducción sincronizada para videos. Doblaje de video

    1413+2Variación de estrellas de los últimos 7 días
  • CrisperWhisper@nyrahealth

    Transcripción controlable. Literal (incluyendo muletillas, pausas, tartamudeos, sonidos vocales) o intencionada (lo que el hablante quiso decir, optimizado para legibilidad) con marcas de tiempo a nivel de palabra.

    1371+13Variación de estrellas de los últimos 7 días
  • voicemode@mbailey

    Conversaciones de voz naturales con Claude Code.

    1347+6Variación de estrellas de los últimos 7 días
  • VideoChat@Henry-23

    Humano digital interactivo en tiempo real, con apariencia y voz personalizables, soporte para clonación de voz y una latencia de respuesta de hasta 3 segundos.

    1303-1Variación de estrellas de los últimos 7 días
  • StreamSpeech@ictnlp

    StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.

    1288+0Variación de estrellas de los últimos 7 días
  • vosk-server@alphacep

    Servidor de reconocimiento de voz WebSocket, gRPC y WebRTC basado en las bibliotecas Vosk y Kaldi

    1262+1Variación de estrellas de los últimos 7 días
  • Whisper-Finetune@yeyupiaoling

    Ajuste fino del modelo de reconocimiento de voz Whisper para admitir entrenamiento sin datos de marcas de tiempo, con datos de marcas de tiempo y sin datos de voz. Acelera la inferencia y admite despliegue en la web, en escritorio con Windows y en Android

    1222-1Variación de estrellas de los últimos 7 días
  • speech-swift@soniqo

    Kit de herramientas de voz con IA para Apple Silicon: ASR, TTS, voz a voz, VAD y diarización impulsados por MLX y CoreML

    1161+4Variación de estrellas de los últimos 7 días
  • Mega-ASR@xzf-thu

    El primer ASR fundamental construido para el mundo real: 7 condiciones acústicas atómicas, 54 escenarios compuestos, 2.6 millones de muestras y hasta un ~30% de mejora sobre el estado del arte donde otros modelos fallan. Volverás a MEGA-ASR después de que los demás fallen en entornos reales.

    1136+3Variación de estrellas de los últimos 7 días
  • conformer@sooftware

    Implementación no oficial en PyTorch de Conformer: Convolution-augmented Transformer for Speech Recognition (INTERSPEECH 2020).

    1132+1Variación de estrellas de los últimos 7 días
  • sglang-omni@sgl-project

    SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.

    1118+143Variación de estrellas de los últimos 7 días
  • violin@shang-zhu

    Habilidad de traducción de video de código abierto

    1057+8Variación de estrellas de los últimos 7 días
  • Reconocimiento de voz sin conexión para Android con la biblioteca Vosk.

    1056+0Variación de estrellas de los últimos 7 días
  • murmure@Kieirra

    Conversión de voz a texto totalmente local, privada y multiplataforma con posprocesamiento mediante LLM

    1055+15Variación de estrellas de los últimos 7 días
  • pykaldi@pykaldi

    Un wrapper de Python para Kaldi

    1040+1Variación de estrellas de los últimos 7 días
  • jonex@yuezhiai

    Motor de análisis multimodal todo en uno + motor de conocimiento listo para IA, basado en ontologías y wiki de LLM

    1014+166Variación de estrellas de los últimos 7 días
  • sherpa@k2-fsa

    Framework de servidor de voz a texto con Kaldi de próxima generación.

    984+4Variación de estrellas de los últimos 7 días
  • espresso@freewym

    Espresso: un kit de herramientas rápido de reconocimiento de voz neuronal de extremo a extremo

    939+0Variación de estrellas de los últimos 7 días
  • vocotype-cli@233stone

    VocoType es una herramienta de entrada de voz local, privada y segura que permite convertir voz a texto en tiempo real mediante atajos de teclado e ingresarlo automáticamente en la aplicación actual. Admite MCP de voz a texto, optimización de texto por IA, diccionarios de reemplazo personalizados y transcripción de audio/video.

    929+9Variación de estrellas de los últimos 7 días
  • whisper.api@innovatorved

    Este proyecto proporciona una API con soporte de acceso a nivel de usuario para transcribir voz a texto utilizando un modelo Whisper ASR ajustado y procesado.

    914+0Variación de estrellas de los últimos 7 días
  • SmartJavaAI@geekwenjie

    Caja de herramientas de algoritmos de IA offline gratuita para Java, que admite reconocimiento facial, detección de vida, reconocimiento de expresiones, detección de objetos, segmentación de instancias, detección de peatones, OCR, reconocimiento de matrículas, reconocimiento de tablas, ASR+TTS, traducción automática y más. Se utiliza mediante Maven. Compatible con PyTorch y Tensorflow, e integra modelos como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) y Whisper.

    909+3Variación de estrellas de los últimos 7 días
  • Easy-Voice-Toolkit@Spr-Aachen

    Un kit de herramientas fácil de usar para reconocimiento, transcripción y conversión de voz, entre otros

    873+0Variación de estrellas de los últimos 7 días
  • PPASR@yeyupiaoling

    Reconocimiento de voz en chino de extremo a extremo basado en PaddlePaddle, desde conceptos básicos hasta proyectos empresariales prácticos. Soporta modelos populares como DeepSpeech2, Conformer y Squeezeformer

    870-1Variación de estrellas de los últimos 7 días
← Volver a temas