speech-recognition
Repositórios de código aberto acompanhados marcados com speech-recognition, ordenados por estrelas.
- #31
Implementação em JAX do modelo Whisper da OpenAI para aceleração de até 70x em TPU.
★ 4.679-1Variação de estrelas nos últimos 7 dias - #32
Um pequeno reconhecedor de fala.
★ 4.337+2Variação de estrelas nos últimos 7 dias - #33
Variante destilada do Whisper para reconhecimento de fala. 6x mais rápido, 50% menor, com margem de erro de palavras inferior a 1%.
★ 4.114+2Variação de estrelas nos últimos 7 dias - #34
API de serviço web ASR para o OpenAI Whisper
★ 3.328+2Variação de estrelas nos últimos 7 dias - #35
Executáveis independentes do Whisper e Faster-Whisper para quem não quer lidar com Python.
★ 3.171+2Variação de estrelas nos últimos 7 dias - #36
Alternativa de assistente de voz open source, local e auto-hospedada, concorrente do Amazon Echo/Google Home
★ 3.101+1Variação de estrelas nos últimos 7 dias - #37
Transcreva qualquer áudio para texto, traduza e edite legendas 100% localmente com uma interface web. Baseado em modelos whisper!
★ 3.068+2Variação de estrelas nos últimos 7 dias - #38★ 2.864+0Variação de estrelas nos últimos 7 dias
- #39
Reconhecimento automático de fala multilíngue com carimbos de data/hora em nível de palavra e confiança
★ 2.842+1Variação de estrelas nos últimos 7 dias - #40
🐸STT - O kit de ferramentas de aprendizado profundo para Speech-to-Text. Treinar e implantar modelos STT nunca foi tão fácil.
★ 2.606+1Variação de estrelas nos últimos 7 dias - #41
Um runtime de voz em tempo real que mantém agentes falando, trabalhando e presentes. Runtime de voz em tempo real para agentes de IA
★ 2.362+72Variação de estrelas nos últimos 7 dias - #42
🎙 Reconhecimento de fala usando o framework de deep learning tensorflow e redes neurais sequence-to-sequence.
★ 2.173+0Variação de estrelas nos últimos 7 dias - #43
IA multimodal em tempo real executada no dispositivo, com recursos semelhantes ao GPT-Live.
★ 2.048+7Variação de estrelas nos últimos 7 dias - #44
Modelos ASR de nível industrial de código aberto que suportam mandarim, dialetos chineses e inglês, alcançando um novo SOTA em benchmarks públicos de ASR em mandarim, oferecendo também excelente capacidade de reconhecimento de letras de músicas.
★ 1.975+2Variação de estrelas nos últimos 7 dias - #45★ 1.968+0Variação de estrelas nos últimos 7 dias
- #46
Motor de reconhecimento de fala contínua de grande vocabulário de código aberto
★ 1.935+1Variação de estrelas nos últimos 7 dias - #47
Uma lista selecionada de artigos, bibliotecas, conjuntos de dados e outros recursos incríveis sobre Diarização de Locutores.
★ 1.894+1Variação de estrelas nos últimos 7 dias - #48
O sistema de auto-codificação para seu aplicativo — Alan AI SDK para iOS
★ 1.878-3Variação de estrelas nos últimos 7 dias - #49
O sistema de autocodificação para seu aplicativo — Alan AI SDK para Android
★ 1.807-1Variação de estrelas nos últimos 7 dias - #50
Whisper multiplataforma com aceleração por GPU 🏎️
★ 1.794+0Variação de estrelas nos últimos 7 dias - #51
Reconhecimento de fala em tempo real e detecção de atividade de voz (VAD) usando a nova geração do Kaldi com ncnn, sem necessidade de conexão com a Internet. Suporte para iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre outros.
★ 1.777-1Variação de estrelas nos últimos 7 dias - #52
O sistema de autocodificação para seu aplicativo — Alan AI SDK para Flutter.
★ 1.756-1Variação de estrelas nos últimos 7 dias - #53
O sistema de auto-codificação para seu aplicativo — Alan AI SDK para Ionic
★ 1.649-1Variação de estrelas nos últimos 7 dias - #54
Aplicativo Speech Note para Linux. Tomada de notas, leitura e tradução com conversão de fala em texto, texto em fala e tradução automática offline.
★ 1.622+8Variação de estrelas nos últimos 7 dias - #55
Plugin OBS para reconhecimento de fala local e legendagem usando IA.
★ 1.597+8Variação de estrelas nos últimos 7 dias - #56
Amica é uma interface de código aberto para comunicação interativa com personagens 3D, utilizando síntese de voz e reconhecimento de fala.
★ 1.591-2Variação de estrelas nos últimos 7 dias - #57
Nós personalizados que estendem as capacidades do Comfyui
★ 1.525+1Variação de estrelas nos últimos 7 dias - #58★ 1.521+3Variação de estrelas nos últimos 7 dias
- #59
Família de modelos ASR de código aberto baseados em LLM para chinês, dialetos, sotaques e fala multilíngue, com runtimes FunASR, vLLM, streaming e llama.cpp.
★ 1.512+10Variação de estrelas nos últimos 7 dias - #60
Pré-treinamento multimodal de fala e texto para processamento de linguagem falada
★ 1.449+0Variação de estrelas nos últimos 7 dias