Pular para o conteúdo principal
buildradar
Sign in
Tópico · speech-recognition

speech-recognition

Repositórios de código aberto acompanhados marcados com speech-recognition, ordenados por estrelas.

156 repositórios
  • Uma lista de corpora de fala acessíveis para ASR, TTS e outras tecnologias de fala.

    1.399+0Variação de estrelas nos últimos 7 dias
  • mlx-tune@ARahim3

    Faça o fine-tuning de LLMs no seu Mac com Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding e fine-tuning de OCR — nativamente no MLX. API compatível com Unsloth.

    1.398+8Variação de estrelas nos últimos 7 dias
  • CrisperWhisper@nyrahealth

    Transcrição controlável. Verbatim (cada palavra, preenchimento, pausa, gagueira, som vocal) ou pretendida (o que o falante quis dizer, otimizado para legibilidade) com carimbos de data/hora em nível de palavra.

    1.371+13Variação de estrelas nos últimos 7 dias
  • whisper-ctranslate2@Softcatala

    Cliente de linha de comando para Whisper compatível com o cliente original da OpenAI, baseado em CTranslate2.

    1.346+2Variação de estrelas nos últimos 7 dias
  • J.A.R.V.I.S@GauravSingh9356

    Assistente pessoal criado com bibliotecas Python. Realiza quase tudo, incluindo envio de e-mails, reconhecimento óptico de texto, relatórios dinâmicos de notícias com integração de API, gerador de lista de tarefas, abertura de sites por comando de voz, reprodução de música, busca na Wikipedia, dicionário com detecção inteligente (correção ortográfica automática) e relatórios meteorológicos (temperatura, velocidade do vento, umidade).

    1.341+5Variação de estrelas nos últimos 7 dias
  • voxtype@peteonrails

    Conversão de voz para texto com push-to-talk para compositores Wayland.

    1.338+42Variação de estrelas nos últimos 7 dias
  • StreamSpeech@ictnlp

    StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.

    1.288+0Variação de estrelas nos últimos 7 dias
  • pruna@PrunaAI

    Pruna é um framework de otimização de modelos criado para desenvolvedores, permitindo entregar modelos mais rápidos e eficientes com o mínimo de sobrecarga.

    1.274+1Variação de estrelas nos últimos 7 dias
  • vosk-server@alphacep

    Servidor de reconhecimento de fala via WebSocket, gRPC e WebRTC baseado nas bibliotecas Vosk e Kaldi.

    1.262+1Variação de estrelas nos últimos 7 dias
  • Whisper-Finetune@yeyupiaoling

    Ajuste fino do modelo de reconhecimento de fala Whisper para suportar treinamento sem dados de timestamp, com dados de timestamp e sem dados de fala. Acelere a inferência e suporte a implantação na Web, desktop Windows e Android.

    1.222-1Variação de estrelas nos últimos 7 dias
  • quillman@modal-labs

    Um aplicativo de chat por voz

    1.212-1Variação de estrelas nos últimos 7 dias
  • Treasure-of-Transformers@ashishpatel26

    💁 Tesouro incrível de modelos Transformers para processamento de linguagem natural, contendo artigos, vídeos, blogs, repositório oficial e notebooks do Colab. 🛫☑️

    1.179+0Variação de estrelas nos últimos 7 dias
  • Um laboratório prático para construir, testar e avaliar aplicativos com o framework de modelos de fundação da Apple.

    1.178+1Variação de estrelas nos últimos 7 dias
  • lotti@matthiasn

    Um diário privado com uma equipe de assistentes de IA pessoais. Os agentes leem o que você registra e propõem ações — você aprova as alterações. Sincronização com criptografia de ponta a ponta entre seus dispositivos; os servidores veem apenas texto cifrado. IA local opcional.

    1.168+3Variação de estrelas nos últimos 7 dias
  • speech-swift@soniqo

    Toolkit de fala de IA para Apple Silicon — ASR, TTS, speech-to-speech, VAD e diarização alimentados por MLX e CoreML

    1.161+4Variação de estrelas nos últimos 7 dias
  • Irina - assistente de voz em russo para uso offline. Suporta habilidades via plugins.

    1.153+0Variação de estrelas nos últimos 7 dias
  • lhotse@lhotse-speech

    Ferramentas para manipular dados multimodais em projetos de aprendizado de máquina.

    1.149-1Variação de estrelas nos últimos 7 dias
  • O sistema de auto-codificação para seu aplicativo — SDK Alan AI para Cordova.

    1.132+0Variação de estrelas nos últimos 7 dias
  • conformer@sooftware

    [Não oficial] Implementação em PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)

    1.132+1Variação de estrelas nos últimos 7 dias
  • sglang-omni@sgl-project

    O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.

    1.118+143Variação de estrelas nos últimos 7 dias
  • AI-Waifu-Vtuber@ardha27

    AI Vtuber para streaming no YouTube/Twitch

    1.115+1Variação de estrelas nos últimos 7 dias
  • Whisperboard@Saik0s

    O aplicativo iOS de código aberto que torna a transcrição de voz de qualidade mais acessível em dispositivos móveis.

    1.102+8Variação de estrelas nos últimos 7 dias
  • whisper-writer@savbell

    💬📝 Um pequeno aplicativo de ditado usando o modelo de reconhecimento de fala Whisper da OpenAI.

    1.100+2Variação de estrelas nos últimos 7 dias
  • Servidor de reconhecimento de fala full-duplex em tempo real, baseado no kit de ferramentas Kaldi e no framework GStreamer.

    1.094+1Variação de estrelas nos últimos 7 dias
  • Reconhecimento de fala offline para Android com a biblioteca Vosk.

    1.056+0Variação de estrelas nos últimos 7 dias
  • pykaldi@pykaldi

    Um wrapper Python para Kaldi

    1.040+1Variação de estrelas nos últimos 7 dias
  • TensorFlowASR@TensorSpeech

    :zap: TensorFlowASR: Reconhecimento automático de fala quase estado da arte em Tensorflow 2. Idiomas suportados que podem usar caracteres ou subpalavras

    1.010+0Variação de estrelas nos últimos 7 dias
  • StoryToolkitAI@octimot

    Uma ferramenta de edição que utiliza IA para transcrever, compreender o conteúdo e pesquisar qualquer coisa em suas filmagens, integrada ao ChatGPT e outros modelos de IA.

    1.009+2Variação de estrelas nos últimos 7 dias
  • sherpa@k2-fsa

    Framework de servidor de fala para texto (speech-to-text) com Kaldi de nova geração

    984+4Variação de estrelas nos últimos 7 dias
  • VoiceStreamAI@alesaccoia

    Transcrição de áudio em tempo quase real usando Whisper auto-hospedado e WebSocket em Python/JS

    960+1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos