speech-recognition
Repositórios de código aberto acompanhados marcados com speech-recognition, ordenados por estrelas.
- #61
Uma lista de corpora de fala acessíveis para ASR, TTS e outras tecnologias de fala.
★ 1.399+0Variação de estrelas nos últimos 7 dias - #62
Faça o fine-tuning de LLMs no seu Mac com Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding e fine-tuning de OCR — nativamente no MLX. API compatível com Unsloth.
★ 1.398+8Variação de estrelas nos últimos 7 dias - #63
Transcrição controlável. Verbatim (cada palavra, preenchimento, pausa, gagueira, som vocal) ou pretendida (o que o falante quis dizer, otimizado para legibilidade) com carimbos de data/hora em nível de palavra.
★ 1.371+13Variação de estrelas nos últimos 7 dias - #64
Cliente de linha de comando para Whisper compatível com o cliente original da OpenAI, baseado em CTranslate2.
★ 1.346+2Variação de estrelas nos últimos 7 dias - #65
Assistente pessoal criado com bibliotecas Python. Realiza quase tudo, incluindo envio de e-mails, reconhecimento óptico de texto, relatórios dinâmicos de notícias com integração de API, gerador de lista de tarefas, abertura de sites por comando de voz, reprodução de música, busca na Wikipedia, dicionário com detecção inteligente (correção ortográfica automática) e relatórios meteorológicos (temperatura, velocidade do vento, umidade).
★ 1.341+5Variação de estrelas nos últimos 7 dias - #66★ 1.338+42Variação de estrelas nos últimos 7 dias
- #67
StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.
★ 1.288+0Variação de estrelas nos últimos 7 dias - #68
Pruna é um framework de otimização de modelos criado para desenvolvedores, permitindo entregar modelos mais rápidos e eficientes com o mínimo de sobrecarga.
★ 1.274+1Variação de estrelas nos últimos 7 dias - #69
Servidor de reconhecimento de fala via WebSocket, gRPC e WebRTC baseado nas bibliotecas Vosk e Kaldi.
★ 1.262+1Variação de estrelas nos últimos 7 dias - #70
Ajuste fino do modelo de reconhecimento de fala Whisper para suportar treinamento sem dados de timestamp, com dados de timestamp e sem dados de fala. Acelere a inferência e suporte a implantação na Web, desktop Windows e Android.
★ 1.222-1Variação de estrelas nos últimos 7 dias - #71★ 1.212-1Variação de estrelas nos últimos 7 dias
- #72
💁 Tesouro incrível de modelos Transformers para processamento de linguagem natural, contendo artigos, vídeos, blogs, repositório oficial e notebooks do Colab. 🛫☑️
★ 1.179+0Variação de estrelas nos últimos 7 dias - #73
Um laboratório prático para construir, testar e avaliar aplicativos com o framework de modelos de fundação da Apple.
★ 1.178+1Variação de estrelas nos últimos 7 dias - #74
Um diário privado com uma equipe de assistentes de IA pessoais. Os agentes leem o que você registra e propõem ações — você aprova as alterações. Sincronização com criptografia de ponta a ponta entre seus dispositivos; os servidores veem apenas texto cifrado. IA local opcional.
★ 1.168+3Variação de estrelas nos últimos 7 dias - #75
Toolkit de fala de IA para Apple Silicon — ASR, TTS, speech-to-speech, VAD e diarização alimentados por MLX e CoreML
★ 1.161+4Variação de estrelas nos últimos 7 dias - #76
Irina - assistente de voz em russo para uso offline. Suporta habilidades via plugins.
★ 1.153+0Variação de estrelas nos últimos 7 dias - #77
Ferramentas para manipular dados multimodais em projetos de aprendizado de máquina.
★ 1.149-1Variação de estrelas nos últimos 7 dias - #78
O sistema de auto-codificação para seu aplicativo — SDK Alan AI para Cordova.
★ 1.132+0Variação de estrelas nos últimos 7 dias - #79
[Não oficial] Implementação em PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)
★ 1.132+1Variação de estrelas nos últimos 7 dias - #80
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 1.118+143Variação de estrelas nos últimos 7 dias - #81
AI Vtuber para streaming no YouTube/Twitch
★ 1.115+1Variação de estrelas nos últimos 7 dias - #82
O aplicativo iOS de código aberto que torna a transcrição de voz de qualidade mais acessível em dispositivos móveis.
★ 1.102+8Variação de estrelas nos últimos 7 dias - #83
💬📝 Um pequeno aplicativo de ditado usando o modelo de reconhecimento de fala Whisper da OpenAI.
★ 1.100+2Variação de estrelas nos últimos 7 dias - #84
Servidor de reconhecimento de fala full-duplex em tempo real, baseado no kit de ferramentas Kaldi e no framework GStreamer.
★ 1.094+1Variação de estrelas nos últimos 7 dias - #85
Reconhecimento de fala offline para Android com a biblioteca Vosk.
★ 1.056+0Variação de estrelas nos últimos 7 dias - #86★ 1.040+1Variação de estrelas nos últimos 7 dias
- #87
:zap: TensorFlowASR: Reconhecimento automático de fala quase estado da arte em Tensorflow 2. Idiomas suportados que podem usar caracteres ou subpalavras
★ 1.010+0Variação de estrelas nos últimos 7 dias - #88
Uma ferramenta de edição que utiliza IA para transcrever, compreender o conteúdo e pesquisar qualquer coisa em suas filmagens, integrada ao ChatGPT e outros modelos de IA.
★ 1.009+2Variação de estrelas nos últimos 7 dias - #89★ 984+4Variação de estrelas nos últimos 7 dias
- #90
Transcrição de áudio em tempo quase real usando Whisper auto-hospedado e WebSocket em Python/JS
★ 960+1Variação de estrelas nos últimos 7 dias