Pular para o conteúdo principal
buildradar
Sign in
Tópico · asr

asr

Repositórios de código aberto acompanhados marcados com asr, ordenados por estrelas.

85 repositórios
  • sherpa-ncnn@k2-fsa

    Reconhecimento de fala em tempo real e detecção de atividade de voz (VAD) usando a nova geração do Kaldi com ncnn, sem necessidade de conexão com a Internet. Suporte para iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre outros.

    1.777-2Variação de estrelas nos últimos 7 dias
  • bailing@wwbin2017

    Bailing é um robô de diálogo por voz semelhante ao GPT-4o, implementado via ASR+LLM+TTS, integrado com grandes modelos como o DeepSeek R1 e openClaw. Um verdadeiro assistente de voz pessoal com latência de até 800ms, capaz de rodar em dispositivos de baixa configuração como Mac e com suporte a interrupções.

    1.759+2Variação de estrelas nos últimos 7 dias
  • dsnote@mkiol

    Aplicativo Speech Note para Linux. Tomada de notas, leitura e tradução com conversão de fala em texto, texto em fala e tradução automática offline.

    1.622+13Variação de estrelas nos últimos 7 dias
  • video-analyzer@byjlw

    Analise vídeos usando LLMs, Visão Computacional e Reconhecimento Automático de Fala

    1.570+11Variação de estrelas nos últimos 7 dias
  • amical@amicalhq

    🎙️ Aplicativo de Ditado por IA - Código Aberto e Local-first ⚡ Digite 3x mais rápido, sem precisar de teclado. 🆓 Desenvolvido com modelos de código aberto, funciona offline, de forma rápida e precisa.

    1.520+14Variação de estrelas nos últimos 7 dias
  • Fun-ASR@QwenAudio

    Família de modelos ASR de código aberto baseados em LLM para chinês, dialetos, sotaques e fala multilíngue, com runtimes FunASR, vLLM, streaming e llama.cpp.

    1.512+14Variação de estrelas nos últimos 7 dias
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge é um projeto desenvolvido em torno de modelos de geração TTS, implementando um servidor de API e uma interface web baseada em Gradio.

    1.418+2Variação de estrelas nos últimos 7 dias
  • SoniTranslate@R3gm

    Tradução sincronizada para vídeos. Dublagem de vídeo

    1.413+3Variação de estrelas nos últimos 7 dias
  • CrisperWhisper@nyrahealth

    Transcrição controlável. Verbatim (cada palavra, preenchimento, pausa, gagueira, som vocal) ou pretendida (o que o falante quis dizer, otimizado para legibilidade) com carimbos de data/hora em nível de palavra.

    1.371+21Variação de estrelas nos últimos 7 dias
  • voicemode@mbailey

    Conversas por voz natural com Claude Code

    1.347+6Variação de estrelas nos últimos 7 dias
  • VideoChat@Henry-23

    Humano digital interativo em tempo real, com aparência e voz personalizáveis, suporte a clonagem de voz e latência de resposta inicial de até 3s.

    1.303+0Variação de estrelas nos últimos 7 dias
  • StreamSpeech@ictnlp

    StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.

    1.288+1Variação de estrelas nos últimos 7 dias
  • vosk-server@alphacep

    Servidor de reconhecimento de fala via WebSocket, gRPC e WebRTC baseado nas bibliotecas Vosk e Kaldi.

    1.262+2Variação de estrelas nos últimos 7 dias
  • Whisper-Finetune@yeyupiaoling

    Ajuste fino do modelo de reconhecimento de fala Whisper para suportar treinamento sem dados de timestamp, com dados de timestamp e sem dados de fala. Acelere a inferência e suporte a implantação na Web, desktop Windows e Android.

    1.222-1Variação de estrelas nos últimos 7 dias
  • speech-swift@soniqo

    Toolkit de fala de IA para Apple Silicon — ASR, TTS, speech-to-speech, VAD e diarização alimentados por MLX e CoreML

    1.161+11Variação de estrelas nos últimos 7 dias
  • Mega-ASR@xzf-thu

    O primeiro ASR de fundação construído para o mundo real - 7 condições acústicas atômicas, 54 cenários compostos, 2,6 milhões de amostras e ganhos de até 30% sobre o estado da arte onde outros modelos falham.

    1.136+3Variação de estrelas nos últimos 7 dias
  • conformer@sooftware

    [Não oficial] Implementação em PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)

    1.132+1Variação de estrelas nos últimos 7 dias
  • sglang-omni@sgl-project

    O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.

    1.105+107Variação de estrelas nos últimos 7 dias
  • Reconhecimento de fala offline para Android com a biblioteca Vosk.

    1.056+0Variação de estrelas nos últimos 7 dias
  • violin@shang-zhu

    Skill de tradução de vídeo de código aberto.

    1.055+4Variação de estrelas nos últimos 7 dias
  • murmure@Kieirra

    Speech-to-Text totalmente local, privado e multiplataforma com pós-processamento por LLM

    1.051+13Variação de estrelas nos últimos 7 dias
  • pykaldi@pykaldi

    Um wrapper Python para Kaldi

    1.040+0Variação de estrelas nos últimos 7 dias
  • sherpa@k2-fsa

    Framework de servidor de fala para texto (speech-to-text) com Kaldi de nova geração

    984+2Variação de estrelas nos últimos 7 dias
  • espresso@freewym

    Espresso: Um kit de ferramentas de reconhecimento de fala neural rápido de ponta a ponta

    939+0Variação de estrelas nos últimos 7 dias
  • vocotype-cli@233stone

    VocoType é uma ferramenta de entrada de voz local, privada e segura que converte voz em texto em tempo real via atalhos de teclado. Suporta MCP de voz para texto, otimização de texto por IA, dicionários de substituição personalizados e transcrição de áudio/vídeo.

    924+2Variação de estrelas nos últimos 7 dias
  • whisper.api@innovatorved

    Este projeto fornece uma API com suporte de acesso em nível de usuário para transcrever fala em texto usando um modelo Whisper ASR ajustado e processado.

    914+0Variação de estrelas nos últimos 7 dias
  • SmartJavaAI@geekwenjie

    Caixa de ferramentas de algoritmos de IA offline gratuita em Java, suporta reconhecimento facial, deteção de vivacidade, reconhecimento de expressões, deteção de objetos, segmentação de instâncias, deteção de pedestres, reconhecimento de texto OCR, reconhecimento de matrículas, reconhecimento de tabelas, ASR+TTS, tradução automática e outras funções, disponível através de dependência Maven. Suporta PyTorch e TensorFlow, com modelos principais integrados como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) e Whisper

    908+1Variação de estrelas nos últimos 7 dias
  • Easy-Voice-Toolkit@Spr-Aachen

    Um kit de ferramentas amigável para reconhecimento/transcrição/conversão de voz, etc. | Caixa de ferramentas de voz simples e fácil de usar

    873+0Variação de estrelas nos últimos 7 dias
  • PPASR@yeyupiaoling

    Implementação de reconhecimento de fala em chinês de ponta a ponta baseada em PaddlePaddle, do básico ao avançado, com exemplos simples e projetos corporativos práticos. Suporta os modelos DeepSpeech2, Conformer e Squeezeformer mais populares atualmente.

    870+0Variação de estrelas nos últimos 7 dias
  • GLM-ASR@zai-org

    GLM-ASR-Nano: Um modelo de reconhecimento de fala robusto e de código aberto com 1,5 bilhão de parâmetros.

    854+4Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos