Saltar al contenido principal
buildradar
Sign in
Tema · speech-to-text

speech-to-text

Repositorios de código abierto monitorizados etiquetados con speech-to-text, ordenados por estrellas.

Repositorios
152
Estrellas totales
640.857
Estrellas de media
4216
Proporción
0,03%

Temas que aparecen con frecuencia junto a speech-to-text en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con speech-to-text.

  • audio.cpp@0xShug0

    Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.

    2214
  • LiveStream-Agent-Studio@HanyuanWang

    面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。

    965
  • Talkify@tornikegomareli

    Lightning-fast, free, local first voice dictation for macOS with on-device transcription

    541
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    541
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • whisper.cpp@ggml-org

    Puerto del modelo Whisper de OpenAI en C/C++

    53.389+103Variación de estrellas de los últimos 7 días
  • Handy@cjpais

    Una aplicación de conversión de voz a texto gratuita, de código abierto y extensible que funciona completamente sin conexión.

    30.916+280Variación de estrellas de los últimos 7 días
  • meetily@Zackriya-Solutions

    Asistente de reuniones de IA con prioridad en la privacidad, transcripción en vivo con Parakeet/Whisper 4 veces más rápida, diarización de hablantes y resumen con Ollama integrado en Rust. Procesamiento 100% local, sin necesidad de nube. Meetily (Meetly Ai - https://meetily.ai) es el anotador de reuniones de IA de código abierto y autohospedado número 1 para macOS y Windows. Comprende cómo redactar actas de reuniones

    30.252+195Variación de estrellas de los últimos 7 días
  • llamafile@mozilla-ai

    Distribuye y ejecuta LLMs con un solo archivo.

    25.859+113Variación de estrellas de los últimos 7 días
  • faster-whisper@SYSTRAN

    Transcripción de Whisper más rápida con CTranslate2

    25.206+71Variación de estrellas de los últimos 7 días
  • whisperX@m-bain

    WhisperX: Reconocimiento automático de voz con marcas de tiempo a nivel de palabra (y diarización).

    23.864+61Variación de estrellas de los últimos 7 días
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | Graba tu pantalla continuamente de forma local y proporciona contexto a tus agentes (Claude, Codex, Openclaw, Hermes, Runner...)

    21.376+80Variación de estrellas de los últimos 7 días
  • FunASR@modelscope

    Kit de herramientas de reconocimiento de voz de código abierto para entrenamiento, inferencia, ASR en streaming, VAD, puntuación, canalizaciones de diarización de altavoces y servicio compatible con OpenAI/MCP.

    20.136+64Variación de estrellas de los últimos 7 días
  • pyvideotrans@jianchang512

    Traduce el video de un idioma a otro e incorpora doblaje y subtítulos.

    18.871+38Variación de estrellas de los últimos 7 días
  • leon@leon-ai

    🧠 Leon es su asistente personal de código abierto.

    17.476+1Variación de estrellas de los últimos 7 días
  • kaldi@kaldi-asr

    kaldi-asr/kaldi es el repositorio oficial del proyecto Kaldi.

    15.474+3Variación de estrellas de los últimos 7 días
  • vosk-api@alphacep

    API de reconocimiento de voz sin conexión para Android, iOS, Raspberry Pi y servidores con Python, Java, C# y Node.

    15.101+17Variación de estrellas de los últimos 7 días
  • VoiceStudio@debpalash

    VoiceStudio es la alternativa a ElevenLabs de código abierto y totalmente local: clonación de voz, diseño de voz, doblaje de vídeo, dictado, transcripción y creación de audiolibros en 646 idiomas.

    14.835+2880Variación de estrellas de los últimos 7 días
  • sherpa-onnx@k2-fsa

    Conversión de voz a texto, de texto a voz, diarización de hablantes, mejora de voz, separación de fuentes y VAD utilizando la nueva generación de Kaldi con onnxruntime sin conexión a Internet. Soporta sistemas embebidos, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket y 12 lenguajes de programación.

    14.575+95Variación de estrellas de los últimos 7 días
  • speech-to-speech@huggingface

    Crea agentes de voz con modelos de código abierto

    13.015+82Variación de estrellas de los últimos 7 días
  • voice-pro@abus-aikorea

    Gradio WebUI para creadores y desarrolladores, con TTS clave (Edge-TTS, kokoro) y clonación de voz zero-shot (E2 & F5-TTS, CosyVoice), procesamiento de audio con Whisper, descarga de YouTube, aislamiento vocal con Demucs y traducción multilingüe.

    12.730+54Variación de estrellas de los últimos 7 días
  • speechbrain@speechbrain

    Un kit de herramientas de voz basado en PyTorch

    11.802+10Variación de estrellas de los últimos 7 días
  • WhisperLiveKit@QuentinFuxa

    Voz a texto local en tiempo real con ASR en streaming, diarización de hablantes, traducción y API compatibles con OpenAI/Deepgram.

    10.990+16Variación de estrellas de los últimos 7 días
  • RealtimeSTT@KoljaB

    Una biblioteca de conversión de voz a texto robusta, eficiente y de baja latencia, con detección avanzada de actividad de voz, activación por palabra clave y transcripción instantánea.

    10.108+18Variación de estrellas de los últimos 7 días
  • SenseVoice@QwenAudio

    Modelo de código abierto SenseVoiceSmall para ASR en mandarín, cantonés, inglés, japonés y coreano, identificación de idiomas, reconocimiento de emociones y detección de eventos de audio.

    9209+37Variación de estrellas de los últimos 7 días
  • Módulo de reconocimiento de voz para Python, compatible con varios motores y APIs, en línea y fuera de línea.

    8987+0Variación de estrellas de los últimos 7 días
  • Un sistema de reconocimiento de voz en chino basado en aprendizaje profundo

    8386+0Variación de estrellas de los últimos 7 días
  • mlx-audio@Blaizzy

    Una biblioteca de texto a voz (TTS), voz a texto (STT) y voz a voz (STS) construida sobre el framework MLX de Apple, que proporciona un análisis de voz eficiente en Apple Silicon.

    7826+23Variación de estrellas de los últimos 7 días
  • annyang@TalAter

    💬 Reconocimiento de voz para tu sitio

    6815-1Variación de estrellas de los últimos 7 días
  • argmax-oss-swift@argmaxinc

    IA de voz en el dispositivo para Apple Silicon.

    6353+8Variación de estrellas de los últimos 7 días
  • FunClip@modelscope

    Herramienta de transcripción de video, generación de subtítulos y recorte asistido por LLM basada en FunASR, con una interfaz de usuario local de Gradio

    6210+13Variación de estrellas de los últimos 7 días
  • openwhispr@OpenWhispr

    Aplicación de dictado de voz a texto con modelos locales (Nvidia Parakeet/Whisper) y en la nube (BYOK). Privacidad primero y multiplataforma.

    6133+305Variación de estrellas de los últimos 7 días
  • silero-models@snakers4

    Silero Models: modelos de texto a voz preentrenados hechos extremadamente sencillos

    6084-1Variación de estrellas de los últimos 7 días
  • ODS@Osmantic

    Convierte tu PC, Mac o equipo Linux en un servidor de IA. Inferencia de LLM, interfaz de chat, voz, agentes, flujos de trabajo, RAG y generación de imágenes.

    5931+1108Variación de estrellas de los últimos 7 días
  • whisper-diarization@MahmoudAshraf97

    Reconocimiento automático de voz con diarización de hablantes basado en OpenAI Whisper

    5634+1Variación de estrellas de los últimos 7 días
← Volver a temas