speech-to-text
Repositórios de código aberto acompanhados marcados com speech-to-text, ordenados por estrelas.
- #121
Coleção de recursos sobre as aplicações de Modelos de Linguagem Grande (LLMs) em Áudio AI.
★ 738+0Variação de estrelas nos últimos 7 dias - #122
Framework de reconhecimento automático de fala em PyTorch para streaming e não streaming, compatível com reconhecimento online e offline. Atualmente suporta os modelos Conformer, Squeezeformer e DeepSpeech2, além de vários métodos de aumento de dados.
★ 727+0Variação de estrelas nos últimos 7 dias - #123
Rapida é uma plataforma de orquestração de IA de voz de ponta a ponta para construir agentes de voz conversacionais em tempo real com streaming de áudio, STT, TTS, VAD, integração multicanal, gerenciamento de estado de agentes e observabilidade.
★ 723+4Variação de estrelas nos últimos 7 dias - #124★ 719+0Variação de estrelas nos últimos 7 dias
- #125
Legendas de fala para texto e entrada de KB para OBS, VRChat, chat do Twitch e Discord
★ 718-1Variação de estrelas nos últimos 7 dias - #126
Exemplo de API de voz
★ 707-1Variação de estrelas nos últimos 7 dias - #127
Framework de benchmark para conversão de fala em texto.
★ 698+1Variação de estrelas nos últimos 7 dias - #128
Um aplicativo de desktop local e gratuito para extrair legendas (SRT) de vídeos e traduzi-las para qualquer idioma — uso ilimitado, sem cadastro, sem nuvem.
★ 688+15Variação de estrelas nos últimos 7 dias - #129
Reconhecimento de fala para projetos React Native Expo
★ 678+4Variação de estrelas nos últimos 7 dias - #130
Transcreva e traduza áudio em arquivos LRC usando Whisper e LLMs (GPT, Claude, etc.).
★ 678+0Variação de estrelas nos últimos 7 dias - #131
Motor de conversão de fala em texto por streaming no dispositivo impulsionado por aprendizado profundo
★ 671+0Variação de estrelas nos últimos 7 dias - #132
:speech_balloon: /so.nus/ STT (speech to text) para Node com detecção de palavra-chave offline
★ 638+0Variação de estrelas nos últimos 7 dias - #133
Criando um software para monitoramento automático em proctoring online
★ 634-1Variação de estrelas nos últimos 7 dias - #134
Aplicativo de voz rápido, privado e local-first para Macs com Apple Silicon — ditado, transcrição de arquivos/mídia, gravação de reuniões, Transforms e uma CLI de automação pública. Gratuito e de código aberto.
★ 630+14Variação de estrelas nos últimos 7 dias - #135
Um aplicativo nativo para a barra de menus do macOS de ditado usando conversão de fala em texto local com o WhisperKit
★ 620+1Variação de estrelas nos últimos 7 dias - #136
Hub de tempo de execução C++ ggml para modelos ASR e TTS multilíngues: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., além de alinhamento forçado universal e mais
★ 614+11Variação de estrelas nos últimos 7 dias - #137
Transcrição em tempo real usando faster-whisper
★ 614+0Variação de estrelas nos últimos 7 dias - #138
Um IME (teclado) de voz emulador de dispositivo de código aberto para Android usando a biblioteca Vosk.
★ 582+3Variação de estrelas nos últimos 7 dias - #139
Uma biblioteca Python para resolver reCAPTCHA v2 e v3 com o Playwright
★ 579+3Variação de estrelas nos últimos 7 dias - #140
Um pipeline otimizado de Speech-to-Text para o modelo Whisper, suportando múltiplos motores de inferência
★ 578+0Variação de estrelas nos últimos 7 dias - #141
Uma linguagem de programação baseada em nós modular, criador de programas, sistema de animação, kit de ferramentas, roteador e depurador feitos para VRChat
★ 563+0Variação de estrelas nos últimos 7 dias - #142
Uma sobreposição que obtém a permissão de voz do usuário e a entrada como texto em uma interface personalizável
★ 557+1Variação de estrelas nos últimos 7 dias - #143
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 547+22Variação de estrelas nos últimos 7 dias - #144
Lista de APIs de reconhecimento de voz STT para o idioma coreano. Benchmarks de desempenho de cada uma.
★ 547+0Variação de estrelas nos últimos 7 dias - #145
Ditado por voz ultrarrápido, gratuito, local e com transcrição no próprio dispositivo para macOS
★ 544+11Variação de estrelas nos últimos 7 dias - #146
Uma biblioteca de reconhecimento de fala executada no navegador graças a uma compilação WebAssembly do Vosk
★ 529+1Variação de estrelas nos últimos 7 dias - #147
Phonetisaurus G2P
★ 521-1Variação de estrelas nos últimos 7 dias - #148
Esta ferramenta usa IA para avaliar sua pronúncia.
★ 518+1Variação de estrelas nos últimos 7 dias - #149
Software de código aberto para transcrição de áudio e vídeo
★ 515+0Variação de estrelas nos últimos 7 dias - #150
Servidor de inferência de linguagem de código aberto, local e auto-hospedado altamente otimizado com suporte a ASR/STT, TTS e LLM via WebRTC, REST e WS
★ 512+0Variação de estrelas nos últimos 7 dias