Pular para o conteúdo principal
buildradar
Sign in
Tópico · asr

asr

Repositórios de código aberto acompanhados marcados com asr, ordenados por estrelas.

87 repositórios
  • GLM-ASR@zai-org

    GLM-ASR-Nano: Um modelo de reconhecimento de fala robusto e de código aberto com 1,5 bilhão de parâmetros.

    854+3Variação de estrelas nos últimos 7 dias
  • Voxtral ASR & TTS rodando nativamente e no navegador. Uma implementação em Rust do Voxtral mini realtime ASR / TTS do Mistral usando o framework Burn ML

    819+2Variação de estrelas nos últimos 7 dias
  • voxt@hehehai

    🎙️ Um assistente de produtividade de voz inteligente que transforma fala em texto limpo, ações úteis e conhecimento estruturado. Ajuda os usuários a capturar ideias, comunicar-se naturalmente, automatizar tarefas repetitivas e manter a produtividade em diferentes aplicativos e fluxos de trabalho.

    807+5Variação de estrelas nos últimos 7 dias
  • ZerolanLiveRobot@AkagawaTsurunaki

    AI VTuber com LLM, ASR, TTS, OCR, CV e mais tecnologias para fazer transmissão ao vivo ou jogar Minecraft com você.

    803+5Variação de estrelas nos últimos 7 dias
  • BiBi-Keyboard@BryceWG

    BiBi Keyboard: um aplicativo de teclado com método de entrada de voz por LLM e ASR para a plataforma Android baseado em Kotlin

    772+17Variação de estrelas nos últimos 7 dias
  • cn2an@Ailln

    Conversão rápida entre números chineses e algarismos arábicos (recursos mais recentes: frações, datas, temperaturas, etc.).

    766+0Variação de estrelas nos últimos 7 dias
  • PaddlePaddle-DeepSpeech@yeyupiaoling

    Reconhecimento de fala em chinês implementado com base no PaddlePaddle. Projeto completo com excelentes resultados de reconhecimento. Suporta treinamento e predição em Windows e Linux, além de predição na placa Nvidia Jetson.

    763+0Variação de estrelas nos últimos 7 dias
  • Executando o modelo de fala para texto (whisper.cpp) no Unity3d em sua máquina local.

    751+1Variação de estrelas nos últimos 7 dias
  • MASR@yeyupiaoling

    Framework de reconhecimento automático de fala em PyTorch para streaming e não streaming, compatível com reconhecimento online e offline. Atualmente suporta os modelos Conformer, Squeezeformer e DeepSpeech2, além de vários métodos de aumento de dados.

    727+0Variação de estrelas nos últimos 7 dias
  • openspeech@openspeech-team

    Toolkit de código aberto para reconhecimento de fala ponta a ponta utilizando PyTorch-Lightning e Hydra.

    714+0Variação de estrelas nos últimos 7 dias
  • Reconhecimento de fala offline com OpenAI Whisper e TensorFlow Lite para Android

    688+0Variação de estrelas nos últimos 7 dias
  • Artigos do INTERSPEECH 2023-2024: Uma coleção completa de artigos de pesquisa influentes e empolgantes da conferência INTERSPEECH 2023-24. Explore os avanços mais recentes em processamento de fala e linguagem. Código incluído. Dê uma estrela no repositório para apoiar o avanço da tecnologia de fala!

    684+0Variação de estrelas nos últimos 7 dias
  • pyannote-whisper@yinruiqing
    677+0Variação de estrelas nos últimos 7 dias
  • FireRedASR2S@FireRedTeam

    Um sistema ASR All-in-One de nível industrial SOTA com módulos ASR, VAD, LID e Punc. O FireRedASR2 suporta chinês (mandarim, mais de 20 dialetos/sotaques), inglês, alternância de código, e ASR de fala e canto. O FireRedVAD suporta fala/canto/música em mais de 100 idiomas. O FireRedLID suporta mais de 100 idiomas e mais de 20 dialetos chineses. O FireRedPunc suporta chinês e inglês.

    672+13Variação de estrelas nos últimos 7 dias
  • cheetah@Picovoice

    Motor de conversão de fala em texto por streaming no dispositivo impulsionado por aprendizado profundo

    671+0Variação de estrelas nos últimos 7 dias
  • LiveTranslate@TheDeathDragon

    Tradução de áudio em tempo real: captura o áudio do sistema e microfone, executa ASR (Whisper/SenseVoice) e traduz via API de LLM com exibição em streaming. Ideal para VTubers, streamers e consumo de conteúdo em idioma estrangeiro no Windows.

    626+38Variação de estrelas nos últimos 7 dias
  • ASR_Theory@zw76859420

    Teoria, artigos e apresentações sobre reconhecimento de voz

    618+0Variação de estrelas nos últimos 7 dias
  • optimum-intel@huggingface

    🤗 Optimum Intel: Acelere a inferência com ferramentas de otimização da Intel

    617+1Variação de estrelas nos últimos 7 dias
  • RapidASR@RapidAI

    📣 Biblioteca de reconhecimento automático de voz de nível comercial para código aberto, pronta para uso, com suporte a todas as plataformas e reconhecimento misto em chinês e inglês. Uma implementação multiplataforma de inferência ASR baseada em ONNXRuntime e FunASR. Fornecemos um conjunto de APIs mais fáceis para chamar modelos ASR.

    611+0Variação de estrelas nos últimos 7 dias
  • echokit_server@second-state

    Plataforma de Agente de Voz de Código Aberto

    592+2Variação de estrelas nos últimos 7 dias
  • WhisperS2T@shashikg

    Um pipeline otimizado de Speech-to-Text para o modelo Whisper, suportando múltiplos motores de inferência

    578+1Variação de estrelas nos últimos 7 dias
  • auto-caption@HiMeditator

    Um software multiplataforma de exibição de legendas em tempo real.

    578+4Variação de estrelas nos últimos 7 dias
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: uma plataforma de benchmarking ampla, robusta e abrangente para Reconhecimento Automático de Fala (ASR).

    553+3Variação de estrelas nos últimos 7 dias
  • vosk-browser@ccoreilly

    Uma biblioteca de reconhecimento de fala executada no navegador graças a uma compilação WebAssembly do Vosk

    529+1Variação de estrelas nos últimos 7 dias
  • ICASSP-2023-24-Papers@DmitryRyumin

    Artigos do ICASSP 2023-2024: Uma coleção completa de artigos de pesquisa influentes e empolgantes das conferências ICASSP 2023-24. Explore os avanços mais recentes em acústica, fala e processamento de sinais. Código incluído. Dê uma estrela no repositório para apoiar o avanço do processamento de áudio e sinais!

    526+1Variação de estrelas nos últimos 7 dias
  • whisplay-ai-chatbot@PiSugar

    Chatbot de IA do tamanho do bolso construído usando um Raspberry Pi Zero 2W / 5

    513+10Variação de estrelas nos últimos 7 dias
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501+7Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos