speech-recognition
Repositórios de código aberto acompanhados marcados com speech-recognition, ordenados por estrelas.
- #91
O hub para pesquisa de IA de áudio: artigos, modelos abertos, benchmarks e datasets sobre LLMs de áudio, reconhecimento de fala, TTS, música e geração de áudio.
★ 953+3Variação de estrelas nos últimos 7 dias - #92
Serviço de transcrição e diarização off-line auto-hospedado pronto para uso com resumo por LLM
★ 948+2Variação de estrelas nos últimos 7 dias - #93
Whisper.net. Fala para texto simplificada usando modelos Whisper
★ 941+1Variação de estrelas nos últimos 7 dias - #94
Espresso: Um kit de ferramentas de reconhecimento de fala neural rápido de ponta a ponta
★ 939+0Variação de estrelas nos últimos 7 dias - #95
Um assistente de voz de desktop baseado em Python capaz de executar comandos em nível de sistema, integrando reconhecimento de fala e conversão de texto em fala, e lidando com interações de usuário assíncronas.
★ 919+13Variação de estrelas nos últimos 7 dias - #96
Modelos Whisper otimizados para streaming e uso em dispositivos
★ 897+0Variação de estrelas nos últimos 7 dias - #97
Um LLM falante que roda no seu próprio computador sem precisar de internet.
★ 891+2Variação de estrelas nos últimos 7 dias - #98
:speech_balloon: SpeechPy - Uma biblioteca para processamento e reconhecimento de fala: http://speechpy.readthedocs.io/en/latest/
★ 883+0Variação de estrelas nos últimos 7 dias - #99
Implementação de reconhecimento de fala em chinês de ponta a ponta baseada em PaddlePaddle, do básico ao avançado, com exemplos simples e projetos corporativos práticos. Suporta os modelos DeepSpeech2, Conformer e Squeezeformer mais populares atualmente.
★ 870-1Variação de estrelas nos últimos 7 dias - #100
💬 Reconhecimento de fala para seu aplicativo React
★ 842+1Variação de estrelas nos últimos 7 dias - #101
Algoritmos de decodificação de Connectionist Temporal Classification (CTC): melhor caminho, busca em feixe (beam search), busca em léxico, busca de prefixo e passagem de token. Implementado em Python.
★ 836-1Variação de estrelas nos últimos 7 dias - #102
Crie aplicações web de speech2text em tempo real usando o Whisper da OpenAI https://openai.com/blog/whisper/
★ 835+0Variação de estrelas nos últimos 7 dias - #103★ 823-1Variação de estrelas nos últimos 7 dias
- #104
Ditado de voz gratuito, de código aberto e 100% offline para Linux. Fale e digite em qualquer lugar via motores whisper.cpp, Whisper e VOSK, acelerado por GPU, funciona em X11 + Wayland!
★ 806+21Variação de estrelas nos últimos 7 dias - #105
🎤 Lobe TTS - Uma biblioteca TTS/STT confiável e de alta qualidade para servidor e navegador.
★ 805+1Variação de estrelas nos últimos 7 dias - #106
Fala para Texto para Fala. Música tocando agora. Envia texto como mensagens OSC para o VRChat para exibir no avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 803+4Variação de estrelas nos últimos 7 dias - #107
Binding para React Native do whisper.cpp.
★ 800-1Variação de estrelas nos últimos 7 dias - #108
Chatbot de voz local para conversas envolventes, utilizando Ollama, Hugging Face Transformers e Coqui TTS Toolkit.
★ 788+1Variação de estrelas nos últimos 7 dias - #109
Projeto que permite usar um microfone com o OpenAI Whisper.
★ 787+0Variação de estrelas nos últimos 7 dias - #110★ 786+17Variação de estrelas nos últimos 7 dias
- #111
🎤 A maneira mais fácil de transcrever áudio em Swift
★ 785-1Variação de estrelas nos últimos 7 dias - #112
Um aplicativo de transcrição de voz por IA 100% privado que converte fala em texto em mais de 100 idiomas. Construído com Compose Multiplatform para Android e iOS usando Whisper AI - sem uploads para a nuvem, todo o processamento ocorre no dispositivo para total privacidade.
★ 777+1Variação de estrelas nos últimos 7 dias - #113
Conversão rápida entre números chineses e algarismos arábicos (recursos mais recentes: frações, datas, temperaturas, etc.).
★ 766+0Variação de estrelas nos últimos 7 dias - #114★ 763+1Variação de estrelas nos últimos 7 dias
- #115
Reconhecimento de fala em chinês implementado com base no PaddlePaddle. Projeto completo com excelentes resultados de reconhecimento. Suporta treinamento e predição em Windows e Linux, além de predição na placa Nvidia Jetson.
★ 762+0Variação de estrelas nos últimos 7 dias - #116★ 754+2Variação de estrelas nos últimos 7 dias
- #117
Executando o modelo de fala para texto (whisper.cpp) no Unity3d em sua máquina local.
★ 751+1Variação de estrelas nos últimos 7 dias - #118
Allosaurus é um reconhecedor universal de fonemas pré-treinado para mais de 2000 idiomas
★ 746+4Variação de estrelas nos últimos 7 dias - #119
Teclado e serviço de reconhecimento de fala privado e executado no dispositivo para Android.
★ 745+6Variação de estrelas nos últimos 7 dias - #120
Framework de reconhecimento automático de fala em PyTorch para streaming e não streaming, compatível com reconhecimento online e offline. Atualmente suporta os modelos Conformer, Squeezeformer e DeepSpeech2, além de vários métodos de aumento de dados.
★ 727+0Variação de estrelas nos últimos 7 dias