Saltar al contenido principal
buildradar
Sign in
Tema · asr

asr

Repositorios de código abierto monitorizados etiquetados con asr, ordenados por estrellas.

Repositorios
87
Estrellas totales
261.812
Estrellas de media
3009
Proporción
0,01%

Temas que aparecen con frecuencia junto a asr en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con asr.

  • audio.cpp@0xShug0

    Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.

    2214
  • jonex@yuezhiai

    Motor de análisis multimodal todo en uno + motor de conocimiento listo para IA, basado en ontologías y wiki de LLM

    1014
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • hayamimi@oboroge0

    早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.

    327
  • whisperX@m-bain

    WhisperX: Reconocimiento automático de voz con marcas de tiempo a nivel de palabra (y diarización).

    23.864+61Variación de estrellas de los últimos 7 días
  • FunASR@modelscope

    Kit de herramientas de reconocimiento de voz de código abierto para entrenamiento, inferencia, ASR en streaming, VAD, puntuación, canalizaciones de diarización de altavoces y servicio compatible con OpenAI/MCP.

    20.136+64Variación de estrellas de los últimos 7 días
  • Speech@NVIDIA-NeMo

    Un framework de IA generativa escalable creado para investigadores y desarrolladores que trabajan en Modelos de Lenguaje Grande, Multimodal y IA de Voz (Reconocimiento Automático de Voz y Text-to-Speech)

    18.379+21Variación de estrellas de los últimos 7 días
  • vosk-api@alphacep

    API de reconocimiento de voz sin conexión para Android, iOS, Raspberry Pi y servidores con Python, Java, C# y Node.

    15.101+17Variación de estrellas de los últimos 7 días
  • sherpa-onnx@k2-fsa

    Conversión de voz a texto, de texto a voz, diarización de hablantes, mejora de voz, separación de fuentes y VAD utilizando la nueva generación de Kaldi con onnxruntime sin conexión a Internet. Soporta sistemas embebidos, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket y 12 lenguajes de programación.

    14.575+95Variación de estrellas de los últimos 7 días
  • PaddleSpeech@PaddlePaddle

    Kit de herramientas de voz fácil de usar que incluye modelo de aprendizaje autosupervisado, ASR de transmisión/SOTA con puntuación, TTS de transmisión con interfaz de texto, sistema de verificación de hablantes, traducción de voz de extremo a extremo y detección de palabras clave. Ganador del premio al mejor demo en NAACL2022.

    12.676+5Variación de estrellas de los últimos 7 días
  • speechbrain@speechbrain

    Un kit de herramientas de voz basado en PyTorch

    11.802+10Variación de estrellas de los últimos 7 días
  • SenseVoice@QwenAudio

    Modelo de código abierto SenseVoiceSmall para ASR en mandarín, cantonés, inglés, japonés y coreano, identificación de idiomas, reconocimiento de emociones y detección de eventos de audio.

    9209+37Variación de estrellas de los últimos 7 días
  • Esta es una API de Python que te permite obtener la transcripción o subtítulos de un video de YouTube dado. ¡También funciona para subtítulos generados automáticamente y no requiere una clave de API ni un navegador headless, como lo hacen otras soluciones basadas en selenium!

    8143+14Variación de estrellas de los últimos 7 días
  • wukong-robot@wzpan

    🤖 wukong-robot es un proyecto de robot de diálogo de voz en chino / altavoz inteligente simple, flexible y elegante. Admite la capacidad de conversación de múltiples turnos de ChatGPT y puede ser el primer proyecto de altavoz inteligente de código abierto que admite la interacción cerebro-computadora.

    7126+2Variación de estrellas de los últimos 7 días
  • FunClip@modelscope

    Herramienta de transcripción de video, generación de subtítulos y recorte asistido por LLM basada en FunASR, con una interfaz de usuario local de Gradio

    6210+13Variación de estrellas de los últimos 7 días
  • whisper-diarization@MahmoudAshraf97

    Reconocimiento automático de voz con diarización de hablantes basado en OpenAI Whisper

    5634+1Variación de estrellas de los últimos 7 días
  • Recorder@xiangyuecn

    Formatos html5 js grabación mp3 wav ogg webm amr g711a g711u, compatible con PC y algunos navegadores web de Android e iOS, Hybrid App (código fuente de Android e iOS incluido), WeChat, ofrece ejemplo de chat de voz H5 con conversión de voz a texto ASR y codificación/decodificación DTMF

    5631+3Variación de estrellas de los últimos 7 días
  • wenet@wenet-e2e

    Kit de herramientas de reconocimiento de voz de extremo a extremo listo para producción y centrado en la producción

    5229+1Variación de estrellas de los últimos 7 días
  • LLPlayer@umlx5h

    El reproductor de medios para el aprendizaje de idiomas, con subtítulos duales, subtítulos generados por IA, traducción en tiempo real ¡y más!

    4070+12Variación de estrellas de los últimos 7 días
  • Streamer-Sales@PeterH0323

    Streamer-Sales: Un LLM para streamers de ventas que genera explicaciones de productos para incentivar la compra. Incluye flujo de datos, aceleración de inferencia con LMDeploy, RAG, TTS, generación de avatares digitales, agentes con búsqueda web, ASR, frontend en Vue, backend en FastAPI y despliegue con Docker-compose.

    3764+1Variación de estrellas de los últimos 7 días
  • openless@Open-Less

    Mantén presionada una tecla, habla, suelta: el texto optimizado por IA aparece en el cursor en cualquier aplicación. Entrada de voz de código abierto para macOS y Windows.

    3403+44Variación de estrellas de los últimos 7 días
  • API de servicio web para OpenAI Whisper ASR

    3328+2Variación de estrellas de los últimos 7 días
  • Ejecutables independientes de Whisper y Faster-Whisper para quienes no quieren lidiar con Python.

    3171+2Variación de estrellas de los últimos 7 días
  • GPA@AutoArk

    [AutoArk] ¡GPA (Audio de Propósito General) puede hacer reconocimiento de voz (ASR), síntesis de voz (TTS) y conversión de voz con un modelo diminuto!

    3061+164Variación de estrellas de los últimos 7 días
  • faster-whisper-GUI@CheshireCC

    Interfaz gráfica para faster_whisper con PySide6

    2995+4Variación de estrellas de los últimos 7 días
  • lingvo@tensorflow

    Lingvo.

    2864+0Variación de estrellas de los últimos 7 días
  • whisper-timestamped@linto-ai

    Reconocimiento automático del habla multilingüe con marcas de tiempo a nivel de palabra y puntuación de confianza

    2842+1Variación de estrellas de los últimos 7 días
  • FluidAudio@FluidInference

    Modelos de audio CoreML de vanguardia en tus aplicaciones: texto a voz, voz a texto, detección de actividad de voz y diarización de hablantes. En Swift, impulsado por código abierto SOTA.

    2723+13Variación de estrellas de los últimos 7 días
  • STT@coqui-ai

    🐸STT - El kit de herramientas de aprendizaje profundo para conversión de voz a texto (Speech-to-Text). Entrenar y desplegar modelos STT nunca ha sido tan fácil.

    2606+1Variación de estrellas de los últimos 7 días
  • AudioNotes@harry0703

    Extracción rápida de contenido de audio y video, organizado en notas de markdown estructuradas.

    2483+7Variación de estrellas de los últimos 7 días
  • audio.cpp@0xShug0

    Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.

    2214+115Variación de estrellas de los últimos 7 días
  • FireRedASR@FireRedTeam

    Modelos ASR de grado industrial de código abierto que admiten mandarín, dialectos chinos e inglés, logrando un nuevo SOTA en benchmarks públicos de ASR en mandarín, y ofreciendo además una capacidad excepcional de reconocimiento de letras de canciones.

    1975+2Variación de estrellas de los últimos 7 días
  • transcribe.cpp@handy-computer

    Inferencia de voz a texto con ggml para más de 16 familias de modelos

    1872+19Variación de estrellas de los últimos 7 días
  • Framework de IA+IoT de próxima generación para T2/T3/T5AI/ESP32 y más: integración rápida de hardware IoT y agentes de IA

    1816+5Variación de estrellas de los últimos 7 días
← Volver a temas