asr
Repositórios de código aberto acompanhados marcados com asr, ordenados por estrelas.
- #31
Reconhecimento de fala em tempo real e detecção de atividade de voz (VAD) usando a nova geração do Kaldi com ncnn, sem necessidade de conexão com a Internet. Suporte para iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre outros.
★ 1.777-2Variação de estrelas nos últimos 7 dias - #32
Bailing é um robô de diálogo por voz semelhante ao GPT-4o, implementado via ASR+LLM+TTS, integrado com grandes modelos como o DeepSeek R1 e openClaw. Um verdadeiro assistente de voz pessoal com latência de até 800ms, capaz de rodar em dispositivos de baixa configuração como Mac e com suporte a interrupções.
★ 1.759+2Variação de estrelas nos últimos 7 dias - #33
Aplicativo Speech Note para Linux. Tomada de notas, leitura e tradução com conversão de fala em texto, texto em fala e tradução automática offline.
★ 1.622+13Variação de estrelas nos últimos 7 dias - #34
Analise vídeos usando LLMs, Visão Computacional e Reconhecimento Automático de Fala
★ 1.570+11Variação de estrelas nos últimos 7 dias - #35
🎙️ Aplicativo de Ditado por IA - Código Aberto e Local-first ⚡ Digite 3x mais rápido, sem precisar de teclado. 🆓 Desenvolvido com modelos de código aberto, funciona offline, de forma rápida e precisa.
★ 1.520+14Variação de estrelas nos últimos 7 dias - #36
Família de modelos ASR de código aberto baseados em LLM para chinês, dialetos, sotaques e fala multilíngue, com runtimes FunASR, vLLM, streaming e llama.cpp.
★ 1.512+14Variação de estrelas nos últimos 7 dias - #37
🍦 Speech-AI-Forge é um projeto desenvolvido em torno de modelos de geração TTS, implementando um servidor de API e uma interface web baseada em Gradio.
★ 1.418+2Variação de estrelas nos últimos 7 dias - #38
Tradução sincronizada para vídeos. Dublagem de vídeo
★ 1.413+3Variação de estrelas nos últimos 7 dias - #39
Transcrição controlável. Verbatim (cada palavra, preenchimento, pausa, gagueira, som vocal) ou pretendida (o que o falante quis dizer, otimizado para legibilidade) com carimbos de data/hora em nível de palavra.
★ 1.371+21Variação de estrelas nos últimos 7 dias - #40★ 1.347+6Variação de estrelas nos últimos 7 dias
- #41
Humano digital interativo em tempo real, com aparência e voz personalizáveis, suporte a clonagem de voz e latência de resposta inicial de até 3s.
★ 1.303+0Variação de estrelas nos últimos 7 dias - #42
StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.
★ 1.288+1Variação de estrelas nos últimos 7 dias - #43
Servidor de reconhecimento de fala via WebSocket, gRPC e WebRTC baseado nas bibliotecas Vosk e Kaldi.
★ 1.262+2Variação de estrelas nos últimos 7 dias - #44
Ajuste fino do modelo de reconhecimento de fala Whisper para suportar treinamento sem dados de timestamp, com dados de timestamp e sem dados de fala. Acelere a inferência e suporte a implantação na Web, desktop Windows e Android.
★ 1.222-1Variação de estrelas nos últimos 7 dias - #45
Toolkit de fala de IA para Apple Silicon — ASR, TTS, speech-to-speech, VAD e diarização alimentados por MLX e CoreML
★ 1.161+11Variação de estrelas nos últimos 7 dias - #46
O primeiro ASR de fundação construído para o mundo real - 7 condições acústicas atômicas, 54 cenários compostos, 2,6 milhões de amostras e ganhos de até 30% sobre o estado da arte onde outros modelos falham.
★ 1.136+3Variação de estrelas nos últimos 7 dias - #47
[Não oficial] Implementação em PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)
★ 1.132+1Variação de estrelas nos últimos 7 dias - #48
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 1.105+107Variação de estrelas nos últimos 7 dias - #49
Reconhecimento de fala offline para Android com a biblioteca Vosk.
★ 1.056+0Variação de estrelas nos últimos 7 dias - #50★ 1.055+4Variação de estrelas nos últimos 7 dias
- #51
Speech-to-Text totalmente local, privado e multiplataforma com pós-processamento por LLM
★ 1.051+13Variação de estrelas nos últimos 7 dias - #52★ 1.040+0Variação de estrelas nos últimos 7 dias
- #53★ 984+2Variação de estrelas nos últimos 7 dias
- #54
Espresso: Um kit de ferramentas de reconhecimento de fala neural rápido de ponta a ponta
★ 939+0Variação de estrelas nos últimos 7 dias - #55
VocoType é uma ferramenta de entrada de voz local, privada e segura que converte voz em texto em tempo real via atalhos de teclado. Suporta MCP de voz para texto, otimização de texto por IA, dicionários de substituição personalizados e transcrição de áudio/vídeo.
★ 924+2Variação de estrelas nos últimos 7 dias - #56
Este projeto fornece uma API com suporte de acesso em nível de usuário para transcrever fala em texto usando um modelo Whisper ASR ajustado e processado.
★ 914+0Variação de estrelas nos últimos 7 dias - #57
Caixa de ferramentas de algoritmos de IA offline gratuita em Java, suporta reconhecimento facial, deteção de vivacidade, reconhecimento de expressões, deteção de objetos, segmentação de instâncias, deteção de pedestres, reconhecimento de texto OCR, reconhecimento de matrículas, reconhecimento de tabelas, ASR+TTS, tradução automática e outras funções, disponível através de dependência Maven. Suporta PyTorch e TensorFlow, com modelos principais integrados como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) e Whisper
★ 908+1Variação de estrelas nos últimos 7 dias - #58
Um kit de ferramentas amigável para reconhecimento/transcrição/conversão de voz, etc. | Caixa de ferramentas de voz simples e fácil de usar
★ 873+0Variação de estrelas nos últimos 7 dias - #59
Implementação de reconhecimento de fala em chinês de ponta a ponta baseada em PaddlePaddle, do básico ao avançado, com exemplos simples e projetos corporativos práticos. Suporta os modelos DeepSpeech2, Conformer e Squeezeformer mais populares atualmente.
★ 870+0Variação de estrelas nos últimos 7 dias - #60
GLM-ASR-Nano: Um modelo de reconhecimento de fala robusto e de código aberto com 1,5 bilhão de parâmetros.
★ 854+4Variação de estrelas nos últimos 7 dias