speech-to-text
Repositórios de código aberto acompanhados marcados com speech-to-text, ordenados por estrelas.
- #31
Plataforma de voz AI de código aberto. Alternativa auto-hospedada ao Vapi e Retell. On-prem, BYOK para Speech to Speech ou LLM/STT/TTS, com construtor visual de fluxo de trabalho, suporte nativo a MCP e telefonia.
★ 5.568+45Variação de estrelas nos últimos 7 dias - #32
Ferramenta de código aberto para localização de vídeos por IA: automatiza o download de vídeos do YouTube/Bilibili, reconhecimento e tradução de legendas, clonagem de voz, mixagem de áudio e gravação de legendas.
★ 5.404+25Variação de estrelas nos últimos 7 dias - #33
Ferramenta de reconhecimento de voz para texto / Uma ferramenta local para transcrição de áudio e vídeo que roda offline, com saída em JSON, legendas SRT e formato de texto simples
★ 4.780+9Variação de estrelas nos últimos 7 dias - #34
Implementação em JAX do modelo Whisper da OpenAI para aceleração de até 70x em TPU.
★ 4.679-1Variação de estrelas nos últimos 7 dias - #35★ 4.624+0Variação de estrelas nos últimos 7 dias
- #36
Geração de legendas no dispositivo que se conecta diretamente ao DaVinci Resolve, Premiere e After Effects.
★ 4.122+20Variação de estrelas nos últimos 7 dias - #37
Ferramenta de tradução de áudio/fala em tempo real, leve e poderosa, baseada no Windows LiveCaptions.
★ 3.637+33Variação de estrelas nos últimos 7 dias - #38
Segure uma tecla, fale, solte — texto refinado por IA aparece no seu cursor em qualquer aplicativo. Entrada de voz de código aberto para macOS e Windows.
★ 3.403+44Variação de estrelas nos últimos 7 dias - #39
API de serviço web ASR para o OpenAI Whisper
★ 3.328+2Variação de estrelas nos últimos 7 dias - #40
Executáveis independentes do Whisper e Faster-Whisper para quem não quer lidar com Python.
★ 3.171+2Variação de estrelas nos últimos 7 dias - #41
LLaMA-Omni é um modelo de interação de voz end-to-end de baixa latência e alta qualidade construído sobre o Llama-3.1-8B-Instruct, visando alcançar capacidades de voz no nível do GPT-4o.
★ 3.147+1Variação de estrelas nos últimos 7 dias - #42
Alternativa de assistente de voz open source, local e auto-hospedada, concorrente do Amazon Echo/Google Home
★ 3.101+1Variação de estrelas nos últimos 7 dias - #43
Transcreva qualquer áudio para texto, traduza e edite legendas 100% localmente com uma interface web. Baseado em modelos whisper!
★ 3.068+2Variação de estrelas nos últimos 7 dias - #44★ 2.864+0Variação de estrelas nos últimos 7 dias
- #45
Reconhecimento automático de fala multilíngue com carimbos de data/hora em nível de palavra e confiança
★ 2.842+1Variação de estrelas nos últimos 7 dias - #46
API de transcrição de reuniões de código aberto para Google Meet, Microsoft Teams e Zoom. Bots de entrada automática, transcrições WebSocket em tempo real e servidor MCP para agentes de IA. Auto-hospedado ou via SaaS.
★ 2.741+15Variação de estrelas nos últimos 7 dias - #47
Modelos de áudio CoreML de ponta em seus aplicativos — texto para fala, fala para texto, detecção de atividade de voz e diarização de locutores. Em Swift, impulsionado por código aberto SOTA.
★ 2.723+13Variação de estrelas nos últimos 7 dias - #48
A alternativa de código aberto ao Cluely - Um assistente de IA extremamente rápido e focado em privacidade que funciona perfeitamente durante reuniões, entrevistas e conversas sem que ninguém perceba. Construído com Tauri para desempenho nativo, com apenas 10MB. Completamente indetectável em chamadas de vídeo, compartilhamentos de tela e gravações.
★ 2.619+12Variação de estrelas nos últimos 7 dias - #49
🐸STT - O kit de ferramentas de aprendizado profundo para Speech-to-Text. Treinar e implantar modelos STT nunca foi tão fácil.
★ 2.606+1Variação de estrelas nos últimos 7 dias - #50★ 2.537+6Variação de estrelas nos últimos 7 dias
- #51
Lista incrível para o Whisper — um sistema de reconhecimento de fala de código aberto baseado em IA desenvolvido pela OpenAI
★ 2.375+1Variação de estrelas nos últimos 7 dias - #52
Grave sua tela e publique uma demonstração. Gratuito e open-source, acelerado por GPU, sem marcas d'água e sem assinaturas. Disponível para Windows, macOS e Linux. Mantido ativamente.
★ 2.287+122Variação de estrelas nos últimos 7 dias - #53
Alternativa open source e gratuita ao Wispr Flow | Fluxo de trabalho de voz para desktop em chinês de próxima geração, integrando o modelo local FunASR e modelos de linguagem grandes configuráveis.
★ 2.278+5Variação de estrelas nos últimos 7 dias - #54
Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.
★ 2.214+115Variação de estrelas nos últimos 7 dias - #55
Gerador de legendas ASR/STT. Utiliza Qwen3-ASR, LLM local, Whisper e TEN-VAD. Robusto contra ruído para JAV.
★ 2.196+17Variação de estrelas nos últimos 7 dias - #56
🎙 Reconhecimento de fala usando o framework de deep learning tensorflow e redes neurais sequence-to-sequence.
★ 2.173+0Variação de estrelas nos últimos 7 dias - #57★ 2.170+3Variação de estrelas nos últimos 7 dias
- #58★ 2.046+1Variação de estrelas nos últimos 7 dias
- #59★ 1.892+2Variação de estrelas nos últimos 7 dias
- #60
Inferência de fala para texto ggml para mais de 16 famílias de modelos
★ 1.872+19Variação de estrelas nos últimos 7 dias