Pular para o conteúdo principal
buildradar
Sign in
Tópico · speech-to-text

speech-to-text

Repositórios de código aberto acompanhados marcados com speech-to-text, ordenados por estrelas.

Repositórios
152
Total de estrelas
640.857
Média de estrelas
4.216
Participação
0,03%

Tópicos que aparecem com frequência ao lado de speech-to-text no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com speech-to-text.

  • audio.cpp@0xShug0

    Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.

    2.214
  • LiveStream-Agent-Studio@HanyuanWang

    面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。

    970
  • Talkify@tornikegomareli

    Ditado por voz ultrarrápido, gratuito, local e com transcrição no próprio dispositivo para macOS

    541
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    541
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • whisper.cpp@ggml-org

    Port do modelo Whisper da OpenAI em C/C++

    53.389+103Variação de estrelas nos últimos 7 dias
  • Handy@cjpais

    Um aplicativo de fala para texto gratuito, de código aberto e extensível que funciona totalmente offline.

    30.916+280Variação de estrelas nos últimos 7 dias
  • meetily@Zackriya-Solutions

    Assistente de reuniões com IA focado em privacidade, com transcrição ao vivo 4x mais rápida via Parakeet/Whisper, diarização de falantes e resumos via Ollama, construído em Rust. Processamento 100% local, sem necessidade de nuvem.

    30.252+195Variação de estrelas nos últimos 7 dias
  • llamafile@mozilla-ai

    Distribua e execute LLMs com um único arquivo.

    25.859+113Variação de estrelas nos últimos 7 dias
  • faster-whisper@SYSTRAN

    Transcrição Whisper mais rápida com CTranslate2

    25.206+71Variação de estrelas nos últimos 7 dias
  • whisperX@m-bain

    WhisperX: Reconhecimento Automático de Fala com carimbos de data/hora no nível da palavra (& Diarização).

    23.864+61Variação de estrelas nos últimos 7 dias
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | Grave sua tela continuamente de forma local e forneça contexto aos seus agentes (Claude, Codex, Openclaw, Hermes, Runner...)

    21.376+80Variação de estrelas nos últimos 7 dias
  • FunASR@modelscope

    Kit de ferramentas de reconhecimento de fala de código aberto para treinamento, inferência, streaming ASR, VAD, pontuação, pipelines de diarização de locutores e atendimento compatível com OpenAI/MCP.

    20.136+64Variação de estrelas nos últimos 7 dias
  • pyvideotrans@jianchang512

    Traduza vídeos de um idioma para outro e incorpore dublagem e legendas.

    18.871+38Variação de estrelas nos últimos 7 dias
  • leon@leon-ai

    🧠 Leon é seu assistente pessoal de código aberto

    17.476+1Variação de estrelas nos últimos 7 dias
  • kaldi@kaldi-asr

    kaldi-asr/kaldi é o repositório oficial do projeto Kaldi.

    15.474+3Variação de estrelas nos últimos 7 dias
  • vosk-api@alphacep

    API de reconhecimento de fala offline para Android, iOS, Raspberry Pi e servidores com Python, Java, C# e Node.

    15.101+17Variação de estrelas nos últimos 7 dias
  • VoiceStudio@debpalash

    VoiceStudio é a alternativa ao ElevenLabs de código aberto e totalmente local — clonagem de voz, design de voz, dublagem de vídeo, ditado, transcrição e criação de audiolivros em 646 idiomas.

    14.835+2.880Variação de estrelas nos últimos 7 dias
  • sherpa-onnx@k2-fsa

    Speech-to-text, text-to-speech, diarização de locutor, aprimoramento de fala, separação de fontes e VAD usando a próxima geração do Kaldi com onnxruntime sem conexão com a Internet. Suporte a sistemas embarcados, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket e 12 linguagens de programação

    14.575+95Variação de estrelas nos últimos 7 dias
  • speech-to-speech@huggingface

    Crie agentes de voz com modelos de código aberto

    13.015+82Variação de estrelas nos últimos 7 dias
  • voice-pro@abus-aikorea

    Interface Web Gradio para criadores e desenvolvedores, apresentando TTS (Edge-TTS, kokoro) e clonagem de voz zero-shot (E2 & F5-TTS, CosyVoice), com processamento de áudio Whisper, download do YouTube, isolamento vocal Demucs e tradução multilíngue.

    12.730+54Variação de estrelas nos últimos 7 dias
  • speechbrain@speechbrain

    Um kit de ferramentas de fala baseado em PyTorch

    11.802+10Variação de estrelas nos últimos 7 dias
  • WhisperLiveKit@QuentinFuxa

    Conversão de fala em texto local e em tempo real com ASR por streaming, diarização de locutor, tradução e APIs compatíveis com OpenAI/Deepgram.

    10.990+16Variação de estrelas nos últimos 7 dias
  • RealtimeSTT@KoljaB

    Uma biblioteca de conversão de fala em texto robusta, eficiente e de baixa latência, com detecção avançada de atividade de voz, ativação por palavra-chave e transcrição instantânea.

    10.108+18Variação de estrelas nos últimos 7 dias
  • SenseVoice@QwenAudio

    Modelo SenseVoiceSmall de código aberto para ASR em mandarim, cantonês, inglês, japonês e coreano, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio.

    9.209+37Variação de estrelas nos últimos 7 dias
  • Módulo de reconhecimento de fala para Python, com suporte a diversos motores e APIs, online e offline.

    8.987+0Variação de estrelas nos últimos 7 dias
  • Um sistema de reconhecimento de fala em chinês baseado em Deep Learning

    8.386+0Variação de estrelas nos últimos 7 dias
  • mlx-audio@Blaizzy

    Uma biblioteca de text-to-speech (TTS), speech-to-text (STT) e speech-to-speech (STS) construída sobre o framework MLX da Apple, oferecendo análise de fala eficiente em Apple Silicon.

    7.826+23Variação de estrelas nos últimos 7 dias
  • annyang@TalAter

    💬 Reconhecimento de fala para o seu site

    6.815-1Variação de estrelas nos últimos 7 dias
  • argmax-oss-swift@argmaxinc

    IA de fala executada localmente no dispositivo para Apple Silicon

    6.353+8Variação de estrelas nos últimos 7 dias
  • FunClip@modelscope

    Ferramenta de transcrição de vídeo, geração de legendas e edição assistida por LLM baseada em FunASR, com interface Gradio local.

    6.210+13Variação de estrelas nos últimos 7 dias
  • openwhispr@OpenWhispr

    Aplicativo de ditado de voz para texto com modelos locais (Nvidia Parakeet/Whisper) e em nuvem (BYOK). Focado em privacidade e disponível em várias plataformas.

    6.133+305Variação de estrelas nos últimos 7 dias
  • silero-models@snakers4

    Silero Models: modelos de conversão de texto em fala pré-treinados feitos de forma extremamente simples

    6.084-1Variação de estrelas nos últimos 7 dias
  • ODS@Osmantic

    Transforme seu PC, Mac ou Linux em um servidor de IA. Inferência de LLM, interface de chat, voz, agentes, fluxos de trabalho, RAG e geração de imagens.

    5.931+1.108Variação de estrelas nos últimos 7 dias
  • whisper-diarization@MahmoudAshraf97

    Reconhecimento Automático de Fala com Diarização de Orador baseado no OpenAI Whisper

    5.634+1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos