speech-recognition
Repositórios de código aberto acompanhados marcados com speech-recognition, ordenados por estrelas.
- #121★ 719+0Variação de estrelas nos últimos 7 dias
- #122
Legendas de fala para texto e entrada de KB para OBS, VRChat, chat do Twitch e Discord
★ 718+0Variação de estrelas nos últimos 7 dias - #123
Toolkit de código aberto para reconhecimento de fala ponta a ponta utilizando PyTorch-Lightning e Hydra.
★ 714+0Variação de estrelas nos últimos 7 dias - #124★ 712+3Variação de estrelas nos últimos 7 dias
- #125
Exemplo de API de voz
★ 708+0Variação de estrelas nos últimos 7 dias - #126
Framework de benchmark para conversão de fala em texto.
★ 697+0Variação de estrelas nos últimos 7 dias - #127
Reconhecimento de fala offline com OpenAI Whisper e TensorFlow Lite para Android
★ 688+0Variação de estrelas nos últimos 7 dias - #128
Artigos do INTERSPEECH 2023-2024: Uma coleção completa de artigos de pesquisa influentes e empolgantes da conferência INTERSPEECH 2023-24. Explore os avanços mais recentes em processamento de fala e linguagem. Código incluído. Dê uma estrela no repositório para apoiar o avanço da tecnologia de fala!
★ 684+0Variação de estrelas nos últimos 7 dias - #129
Um conjunto de dados de áudio gratuito de dígitos falados. Uma versão em áudio do MNIST.
★ 678+0Variação de estrelas nos últimos 7 dias - #130
Reconhecimento de fala para projetos React Native Expo
★ 677+6Variação de estrelas nos últimos 7 dias - #131
Motor de conversão de fala em texto por streaming no dispositivo impulsionado por aprendizado profundo
★ 671+0Variação de estrelas nos últimos 7 dias - #132
Um sistema ASR All-in-One de nível industrial SOTA com módulos ASR, VAD, LID e Punc. O FireRedASR2 suporta chinês (mandarim, mais de 20 dialetos/sotaques), inglês, alternância de código, e ASR de fala e canto. O FireRedVAD suporta fala/canto/música em mais de 100 idiomas. O FireRedLID suporta mais de 100 idiomas e mais de 20 dialetos chineses. O FireRedPunc suporta chinês e inglês.
★ 670+13Variação de estrelas nos últimos 7 dias - #133
Interface de linha de comando para os recursos integrados de reconhecimento de fala e transcrição no macOS.
★ 669+0Variação de estrelas nos últimos 7 dias - #134
ChatGPT em casa! Uma alternativa melhor aos assistentes domésticos inteligentes comerciais, construída no Raspberry Pi usando LiteLLM e LangGraph.
★ 648+1Variação de estrelas nos últimos 7 dias - #135
:speech_balloon: /so.nus/ STT (speech to text) para Node com detecção de palavra-chave offline
★ 638+0Variação de estrelas nos últimos 7 dias - #136
Editor de Método de Entrada (IME) para Android baseado no Whisper
★ 632+6Variação de estrelas nos últimos 7 dias - #137
Tradução de áudio em tempo real: captura o áudio do sistema e microfone, executa ASR (Whisper/SenseVoice) e traduz via API de LLM com exibição em streaming. Ideal para VTubers, streamers e consumo de conteúdo em idioma estrangeiro no Windows.
★ 625+38Variação de estrelas nos últimos 7 dias - #138
Transcrição em tempo real usando faster-whisper
★ 614+0Variação de estrelas nos últimos 7 dias - #139
Hub de tempo de execução C++ ggml para modelos ASR e TTS multilíngues: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., além de alinhamento forçado universal e mais
★ 609+20Variação de estrelas nos últimos 7 dias - #140
Decodificador de Classificação Temporal Conexionista (CTC) com dicionário e modelo de linguagem.
★ 580+1Variação de estrelas nos últimos 7 dias - #141
Um pipeline otimizado de Speech-to-Text para o modelo Whisper, suportando múltiplos motores de inferência
★ 578+1Variação de estrelas nos últimos 7 dias - #142
O sistema de autoprogramação para seu aplicativo — Alan AI SDK para React Native
★ 575+0Variação de estrelas nos últimos 7 dias - #143
Uma linguagem de programação baseada em nós modular, criador de programas, sistema de animação, kit de ferramentas, roteador e depurador feitos para VRChat
★ 563-1Variação de estrelas nos últimos 7 dias - #144
Uma sobreposição que obtém a permissão de voz do usuário e a entrada como texto em uma interface personalizável
★ 557+1Variação de estrelas nos últimos 7 dias - #145
SpeechIO Leaderboard: uma plataforma de benchmarking ampla, robusta e abrangente para Reconhecimento Automático de Fala (ASR).
★ 553+3Variação de estrelas nos últimos 7 dias - #146
Lista de APIs de reconhecimento de voz STT para o idioma coreano. Benchmarks de desempenho de cada uma.
★ 547+1Variação de estrelas nos últimos 7 dias - #147
Ditado por voz ultrarrápido, gratuito, local e com transcrição no próprio dispositivo para macOS
★ 541+14Variação de estrelas nos últimos 7 dias - #148
Agente interativo de fala para fala (Speech-to-Speech) de alta qualidade e em streaming implementado em um único arquivo.
★ 540+0Variação de estrelas nos últimos 7 dias - #149
Motor de Reconhecimento Automático de Fala (ASR) e Conversão de Texto em Fala (TTS). Reconhecimento de fala em chinês e inglês, síntese de voz com múltiplos papéis, suporte multilíngue e alta precisão
★ 530+1Variação de estrelas nos últimos 7 dias - #150
Uma biblioteca de reconhecimento de fala executada no navegador graças a uma compilação WebAssembly do Vosk
★ 529+1Variação de estrelas nos últimos 7 dias