asr
Repositórios de código aberto acompanhados marcados com asr, ordenados por estrelas.
- #61
GLM-ASR-Nano: Um modelo de reconhecimento de fala robusto e de código aberto com 1,5 bilhão de parâmetros.
★ 854+3Variação de estrelas nos últimos 7 dias - #62
Voxtral ASR & TTS rodando nativamente e no navegador. Uma implementação em Rust do Voxtral mini realtime ASR / TTS do Mistral usando o framework Burn ML
★ 819+2Variação de estrelas nos últimos 7 dias - #63
🎙️ Um assistente de produtividade de voz inteligente que transforma fala em texto limpo, ações úteis e conhecimento estruturado. Ajuda os usuários a capturar ideias, comunicar-se naturalmente, automatizar tarefas repetitivas e manter a produtividade em diferentes aplicativos e fluxos de trabalho.
★ 807+5Variação de estrelas nos últimos 7 dias - #64
AI VTuber com LLM, ASR, TTS, OCR, CV e mais tecnologias para fazer transmissão ao vivo ou jogar Minecraft com você.
★ 803+5Variação de estrelas nos últimos 7 dias - #65
BiBi Keyboard: um aplicativo de teclado com método de entrada de voz por LLM e ASR para a plataforma Android baseado em Kotlin
★ 772+17Variação de estrelas nos últimos 7 dias - #66
Conversão rápida entre números chineses e algarismos arábicos (recursos mais recentes: frações, datas, temperaturas, etc.).
★ 766+0Variação de estrelas nos últimos 7 dias - #67
Reconhecimento de fala em chinês implementado com base no PaddlePaddle. Projeto completo com excelentes resultados de reconhecimento. Suporta treinamento e predição em Windows e Linux, além de predição na placa Nvidia Jetson.
★ 763+0Variação de estrelas nos últimos 7 dias - #68
Executando o modelo de fala para texto (whisper.cpp) no Unity3d em sua máquina local.
★ 751+1Variação de estrelas nos últimos 7 dias - #69
Framework de reconhecimento automático de fala em PyTorch para streaming e não streaming, compatível com reconhecimento online e offline. Atualmente suporta os modelos Conformer, Squeezeformer e DeepSpeech2, além de vários métodos de aumento de dados.
★ 727+0Variação de estrelas nos últimos 7 dias - #70
Toolkit de código aberto para reconhecimento de fala ponta a ponta utilizando PyTorch-Lightning e Hydra.
★ 714+0Variação de estrelas nos últimos 7 dias - #71
Reconhecimento de fala offline com OpenAI Whisper e TensorFlow Lite para Android
★ 688+0Variação de estrelas nos últimos 7 dias - #72
Artigos do INTERSPEECH 2023-2024: Uma coleção completa de artigos de pesquisa influentes e empolgantes da conferência INTERSPEECH 2023-24. Explore os avanços mais recentes em processamento de fala e linguagem. Código incluído. Dê uma estrela no repositório para apoiar o avanço da tecnologia de fala!
★ 684+0Variação de estrelas nos últimos 7 dias - #73★ 677+0Variação de estrelas nos últimos 7 dias
- #74
Um sistema ASR All-in-One de nível industrial SOTA com módulos ASR, VAD, LID e Punc. O FireRedASR2 suporta chinês (mandarim, mais de 20 dialetos/sotaques), inglês, alternância de código, e ASR de fala e canto. O FireRedVAD suporta fala/canto/música em mais de 100 idiomas. O FireRedLID suporta mais de 100 idiomas e mais de 20 dialetos chineses. O FireRedPunc suporta chinês e inglês.
★ 672+13Variação de estrelas nos últimos 7 dias - #75
Motor de conversão de fala em texto por streaming no dispositivo impulsionado por aprendizado profundo
★ 671+0Variação de estrelas nos últimos 7 dias - #76
Tradução de áudio em tempo real: captura o áudio do sistema e microfone, executa ASR (Whisper/SenseVoice) e traduz via API de LLM com exibição em streaming. Ideal para VTubers, streamers e consumo de conteúdo em idioma estrangeiro no Windows.
★ 626+38Variação de estrelas nos últimos 7 dias - #77
Teoria, artigos e apresentações sobre reconhecimento de voz
★ 618+0Variação de estrelas nos últimos 7 dias - #78
🤗 Optimum Intel: Acelere a inferência com ferramentas de otimização da Intel
★ 617+1Variação de estrelas nos últimos 7 dias - #79
📣 Biblioteca de reconhecimento automático de voz de nível comercial para código aberto, pronta para uso, com suporte a todas as plataformas e reconhecimento misto em chinês e inglês. Uma implementação multiplataforma de inferência ASR baseada em ONNXRuntime e FunASR. Fornecemos um conjunto de APIs mais fáceis para chamar modelos ASR.
★ 611+0Variação de estrelas nos últimos 7 dias - #80
Plataforma de Agente de Voz de Código Aberto
★ 592+2Variação de estrelas nos últimos 7 dias - #81
Um pipeline otimizado de Speech-to-Text para o modelo Whisper, suportando múltiplos motores de inferência
★ 578+1Variação de estrelas nos últimos 7 dias - #82
Um software multiplataforma de exibição de legendas em tempo real.
★ 578+4Variação de estrelas nos últimos 7 dias - #83
SpeechIO Leaderboard: uma plataforma de benchmarking ampla, robusta e abrangente para Reconhecimento Automático de Fala (ASR).
★ 553+3Variação de estrelas nos últimos 7 dias - #84
Uma biblioteca de reconhecimento de fala executada no navegador graças a uma compilação WebAssembly do Vosk
★ 529+1Variação de estrelas nos últimos 7 dias - #85
Artigos do ICASSP 2023-2024: Uma coleção completa de artigos de pesquisa influentes e empolgantes das conferências ICASSP 2023-24. Explore os avanços mais recentes em acústica, fala e processamento de sinais. Código incluído. Dê uma estrela no repositório para apoiar o avanço do processamento de áudio e sinais!
★ 526+1Variação de estrelas nos últimos 7 dias - #86
Chatbot de IA do tamanho do bolso construído usando um Raspberry Pi Zero 2W / 5
★ 513+10Variação de estrelas nos últimos 7 dias - #87
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501+7Variação de estrelas nos últimos 7 dias