Pular para o conteúdo principal
buildradar
Sign in
Tópico · speech-recognition

speech-recognition

Repositórios de código aberto acompanhados marcados com speech-recognition, ordenados por estrelas.

156 repositórios
  • adapt@MycroftAI

    Interpretador de intenções Adapt

    719+0Variação de estrelas nos últimos 7 dias
  • curses@mmpneo

    Legendas de fala para texto e entrada de KB para OBS, VRChat, chat do Twitch e Discord

    718+0Variação de estrelas nos últimos 7 dias
  • openspeech@openspeech-team

    Toolkit de código aberto para reconhecimento de fala ponta a ponta utilizando PyTorch-Lightning e Hydra.

    714+0Variação de estrelas nos últimos 7 dias
  • rhino@Picovoice

    Motor de Speech-to-Intent em dispositivo alimentado por deep learning

    712+3Variação de estrelas nos últimos 7 dias
  • speech-demo@Baidu-AIP

    Exemplo de API de voz

    708+0Variação de estrelas nos últimos 7 dias
  • Framework de benchmark para conversão de fala em texto.

    697+0Variação de estrelas nos últimos 7 dias
  • Reconhecimento de fala offline com OpenAI Whisper e TensorFlow Lite para Android

    688+0Variação de estrelas nos últimos 7 dias
  • Artigos do INTERSPEECH 2023-2024: Uma coleção completa de artigos de pesquisa influentes e empolgantes da conferência INTERSPEECH 2023-24. Explore os avanços mais recentes em processamento de fala e linguagem. Código incluído. Dê uma estrela no repositório para apoiar o avanço da tecnologia de fala!

    684+0Variação de estrelas nos últimos 7 dias
  • Um conjunto de dados de áudio gratuito de dígitos falados. Uma versão em áudio do MNIST.

    678+0Variação de estrelas nos últimos 7 dias
  • Reconhecimento de fala para projetos React Native Expo

    677+6Variação de estrelas nos últimos 7 dias
  • cheetah@Picovoice

    Motor de conversão de fala em texto por streaming no dispositivo impulsionado por aprendizado profundo

    671+0Variação de estrelas nos últimos 7 dias
  • FireRedASR2S@FireRedTeam

    Um sistema ASR All-in-One de nível industrial SOTA com módulos ASR, VAD, LID e Punc. O FireRedASR2 suporta chinês (mandarim, mais de 20 dialetos/sotaques), inglês, alternância de código, e ASR de fala e canto. O FireRedVAD suporta fala/canto/música em mais de 100 idiomas. O FireRedLID suporta mais de 100 idiomas e mais de 20 dialetos chineses. O FireRedPunc suporta chinês e inglês.

    670+13Variação de estrelas nos últimos 7 dias
  • hear@sveinbjornt

    Interface de linha de comando para os recursos integrados de reconhecimento de fala e transcrição no macOS.

    669+0Variação de estrelas nos últimos 7 dias
  • gpt-home@judahpaul16

    ChatGPT em casa! Uma alternativa melhor aos assistentes domésticos inteligentes comerciais, construída no Raspberry Pi usando LiteLLM e LangGraph.

    648+1Variação de estrelas nos últimos 7 dias
  • sonus@evancohen

    :speech_balloon: /so.nus/ STT (speech to text) para Node com detecção de palavra-chave offline

    638+0Variação de estrelas nos últimos 7 dias
  • whisperIME@woheller69

    Editor de Método de Entrada (IME) para Android baseado no Whisper

    632+6Variação de estrelas nos últimos 7 dias
  • LiveTranslate@TheDeathDragon

    Tradução de áudio em tempo real: captura o áudio do sistema e microfone, executa ASR (Whisper/SenseVoice) e traduz via API de LLM com exibição em streaming. Ideal para VTubers, streamers e consumo de conteúdo em idioma estrangeiro no Windows.

    625+38Variação de estrelas nos últimos 7 dias
  • speech-to-text@reriiasu

    Transcrição em tempo real usando faster-whisper

    614+0Variação de estrelas nos últimos 7 dias
  • CrispASR@CrispStrobe

    Hub de tempo de execução C++ ggml para modelos ASR e TTS multilíngues: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., além de alinhamento forçado universal e mais

    609+20Variação de estrelas nos últimos 7 dias
  • CTCWordBeamSearch@githubharald

    Decodificador de Classificação Temporal Conexionista (CTC) com dicionário e modelo de linguagem.

    580+1Variação de estrelas nos últimos 7 dias
  • WhisperS2T@shashikg

    Um pipeline otimizado de Speech-to-Text para o modelo Whisper, suportando múltiplos motores de inferência

    578+1Variação de estrelas nos últimos 7 dias
  • O sistema de autoprogramação para seu aplicativo — Alan AI SDK para React Native

    575+0Variação de estrelas nos últimos 7 dias
  • VRCOSC@VolcanicArts

    Uma linguagem de programação baseada em nós modular, criador de programas, sistema de animação, kit de ferramentas, roteador e depurador feitos para VRChat

    563-1Variação de estrelas nos últimos 7 dias
  • Uma sobreposição que obtém a permissão de voz do usuário e a entrada como texto em uma interface personalizável

    557+1Variação de estrelas nos últimos 7 dias
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: uma plataforma de benchmarking ampla, robusta e abrangente para Reconhecimento Automático de Fala (ASR).

    553+3Variação de estrelas nos últimos 7 dias
  • Lista de APIs de reconhecimento de voz STT para o idioma coreano. Benchmarks de desempenho de cada uma.

    547+1Variação de estrelas nos últimos 7 dias
  • Talkify@tornikegomareli

    Ditado por voz ultrarrápido, gratuito, local e com transcrição no próprio dispositivo para macOS

    541+14Variação de estrelas nos últimos 7 dias
  • CleanS2S@opendilab

    Agente interativo de fala para fala (Speech-to-Speech) de alta qualidade e em streaming implementado em um único arquivo.

    540+0Variação de estrelas nos últimos 7 dias
  • parrots@shibing624

    Motor de Reconhecimento Automático de Fala (ASR) e Conversão de Texto em Fala (TTS). Reconhecimento de fala em chinês e inglês, síntese de voz com múltiplos papéis, suporte multilíngue e alta precisão

    530+1Variação de estrelas nos últimos 7 dias
  • vosk-browser@ccoreilly

    Uma biblioteca de reconhecimento de fala executada no navegador graças a uma compilação WebAssembly do Vosk

    529+1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos