speech-to-text
Repositórios de código aberto acompanhados marcados com speech-to-text, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de speech-to-text no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com speech-to-text.
- #1
Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.
★ 2.214 - #2
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 970 - #3
Ditado por voz ultrarrápido, gratuito, local e com transcrição no próprio dispositivo para macOS
★ 541 - #4
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 541 - #5
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501
- #1
Port do modelo Whisper da OpenAI em C/C++
★ 53.389+103Variação de estrelas nos últimos 7 dias - #2
Um aplicativo de fala para texto gratuito, de código aberto e extensível que funciona totalmente offline.
★ 30.916+280Variação de estrelas nos últimos 7 dias - #3
Assistente de reuniões com IA focado em privacidade, com transcrição ao vivo 4x mais rápida via Parakeet/Whisper, diarização de falantes e resumos via Ollama, construído em Rust. Processamento 100% local, sem necessidade de nuvem.
★ 30.252+195Variação de estrelas nos últimos 7 dias - #4★ 25.859+113Variação de estrelas nos últimos 7 dias
- #5
Transcrição Whisper mais rápida com CTranslate2
★ 25.206+71Variação de estrelas nos últimos 7 dias - #6
WhisperX: Reconhecimento Automático de Fala com carimbos de data/hora no nível da palavra (& Diarização).
★ 23.864+61Variação de estrelas nos últimos 7 dias - #7
YC (S26) | Open Computer History | Grave sua tela continuamente de forma local e forneça contexto aos seus agentes (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21.376+80Variação de estrelas nos últimos 7 dias - #8
Kit de ferramentas de reconhecimento de fala de código aberto para treinamento, inferência, streaming ASR, VAD, pontuação, pipelines de diarização de locutores e atendimento compatível com OpenAI/MCP.
★ 20.136+64Variação de estrelas nos últimos 7 dias - #9
Traduza vídeos de um idioma para outro e incorpore dublagem e legendas.
★ 18.871+38Variação de estrelas nos últimos 7 dias - #10★ 17.476+1Variação de estrelas nos últimos 7 dias
- #11★ 15.474+3Variação de estrelas nos últimos 7 dias
- #12
API de reconhecimento de fala offline para Android, iOS, Raspberry Pi e servidores com Python, Java, C# e Node.
★ 15.101+17Variação de estrelas nos últimos 7 dias - #13
VoiceStudio é a alternativa ao ElevenLabs de código aberto e totalmente local — clonagem de voz, design de voz, dublagem de vídeo, ditado, transcrição e criação de audiolivros em 646 idiomas.
★ 14.835+2.880Variação de estrelas nos últimos 7 dias - #14
Speech-to-text, text-to-speech, diarização de locutor, aprimoramento de fala, separação de fontes e VAD usando a próxima geração do Kaldi com onnxruntime sem conexão com a Internet. Suporte a sistemas embarcados, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket e 12 linguagens de programação
★ 14.575+95Variação de estrelas nos últimos 7 dias - #15
Crie agentes de voz com modelos de código aberto
★ 13.015+82Variação de estrelas nos últimos 7 dias - #16
Interface Web Gradio para criadores e desenvolvedores, apresentando TTS (Edge-TTS, kokoro) e clonagem de voz zero-shot (E2 & F5-TTS, CosyVoice), com processamento de áudio Whisper, download do YouTube, isolamento vocal Demucs e tradução multilíngue.
★ 12.730+54Variação de estrelas nos últimos 7 dias - #17
Um kit de ferramentas de fala baseado em PyTorch
★ 11.802+10Variação de estrelas nos últimos 7 dias - #18
Conversão de fala em texto local e em tempo real com ASR por streaming, diarização de locutor, tradução e APIs compatíveis com OpenAI/Deepgram.
★ 10.990+16Variação de estrelas nos últimos 7 dias - #19
Uma biblioteca de conversão de fala em texto robusta, eficiente e de baixa latência, com detecção avançada de atividade de voz, ativação por palavra-chave e transcrição instantânea.
★ 10.108+18Variação de estrelas nos últimos 7 dias - #20
Modelo SenseVoiceSmall de código aberto para ASR em mandarim, cantonês, inglês, japonês e coreano, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio.
★ 9.209+37Variação de estrelas nos últimos 7 dias - #21
Módulo de reconhecimento de fala para Python, com suporte a diversos motores e APIs, online e offline.
★ 8.987+0Variação de estrelas nos últimos 7 dias - #22
Um sistema de reconhecimento de fala em chinês baseado em Deep Learning
★ 8.386+0Variação de estrelas nos últimos 7 dias - #23
Uma biblioteca de text-to-speech (TTS), speech-to-text (STT) e speech-to-speech (STS) construída sobre o framework MLX da Apple, oferecendo análise de fala eficiente em Apple Silicon.
★ 7.826+23Variação de estrelas nos últimos 7 dias - #24★ 6.815-1Variação de estrelas nos últimos 7 dias
- #25
IA de fala executada localmente no dispositivo para Apple Silicon
★ 6.353+8Variação de estrelas nos últimos 7 dias - #26
Ferramenta de transcrição de vídeo, geração de legendas e edição assistida por LLM baseada em FunASR, com interface Gradio local.
★ 6.210+13Variação de estrelas nos últimos 7 dias - #27
Aplicativo de ditado de voz para texto com modelos locais (Nvidia Parakeet/Whisper) e em nuvem (BYOK). Focado em privacidade e disponível em várias plataformas.
★ 6.133+305Variação de estrelas nos últimos 7 dias - #28
Silero Models: modelos de conversão de texto em fala pré-treinados feitos de forma extremamente simples
★ 6.084-1Variação de estrelas nos últimos 7 dias - #29
Transforme seu PC, Mac ou Linux em um servidor de IA. Inferência de LLM, interface de chat, voz, agentes, fluxos de trabalho, RAG e geração de imagens.
★ 5.931+1.108Variação de estrelas nos últimos 7 dias - #30
Reconhecimento Automático de Fala com Diarização de Orador baseado no OpenAI Whisper
★ 5.634+1Variação de estrelas nos últimos 7 dias