Pular para o conteúdo principal
buildradar
Sign in
Tópico · speech-recognition

speech-recognition

Repositórios de código aberto acompanhados marcados com speech-recognition, ordenados por estrelas.

156 repositórios
  • whisper-jax@sanchit-gandhi

    Implementação em JAX do modelo Whisper da OpenAI para aceleração de até 70x em TPU.

    4.679-1Variação de estrelas nos últimos 7 dias
  • pocketsphinx@cmusphinx

    Um pequeno reconhecedor de fala.

    4.337+2Variação de estrelas nos últimos 7 dias
  • distil-whisper@huggingface

    Variante destilada do Whisper para reconhecimento de fala. 6x mais rápido, 50% menor, com margem de erro de palavras inferior a 1%.

    4.114+2Variação de estrelas nos últimos 7 dias
  • API de serviço web ASR para o OpenAI Whisper

    3.328+2Variação de estrelas nos últimos 7 dias
  • Executáveis independentes do Whisper e Faster-Whisper para quem não quer lidar com Python.

    3.171+2Variação de estrelas nos últimos 7 dias
  • willow@HeyWillow

    Alternativa de assistente de voz open source, local e auto-hospedada, concorrente do Amazon Echo/Google Home

    3.101+1Variação de estrelas nos últimos 7 dias
  • whishper@pluja

    Transcreva qualquer áudio para texto, traduza e edite legendas 100% localmente com uma interface web. Baseado em modelos whisper!

    3.068+2Variação de estrelas nos últimos 7 dias
  • lingvo@tensorflow

    Lingvo

    2.864+0Variação de estrelas nos últimos 7 dias
  • whisper-timestamped@linto-ai

    Reconhecimento automático de fala multilíngue com carimbos de data/hora em nível de palavra e confiança

    2.842+1Variação de estrelas nos últimos 7 dias
  • STT@coqui-ai

    🐸STT - O kit de ferramentas de aprendizado profundo para Speech-to-Text. Treinar e implantar modelos STT nunca foi tão fácil.

    2.606+1Variação de estrelas nos últimos 7 dias
  • qwen-audio-agent@QwenAudio

    Um runtime de voz em tempo real que mantém agentes falando, trabalhando e presentes. Runtime de voz em tempo real para agentes de IA

    2.362+72Variação de estrelas nos últimos 7 dias
  • 🎙 Reconhecimento de fala usando o framework de deep learning tensorflow e redes neurais sequence-to-sequence.

    2.173+0Variação de estrelas nos últimos 7 dias
  • parlor@fikrikarim

    IA multimodal em tempo real executada no dispositivo, com recursos semelhantes ao GPT-Live.

    2.048+7Variação de estrelas nos últimos 7 dias
  • FireRedASR@FireRedTeam

    Modelos ASR de nível industrial de código aberto que suportam mandarim, dialetos chineses e inglês, alcançando um novo SOTA em benchmarks públicos de ASR em mandarim, oferecendo também excelente capacidade de reconhecimento de letras de músicas.

    1.975+2Variação de estrelas nos últimos 7 dias
  • masr@nobody132

    Reconhecimento de voz em mandarim; Mandarin Automatic Speech Recognition;

    1.968+0Variação de estrelas nos últimos 7 dias
  • julius@julius-speech

    Motor de reconhecimento de fala contínua de grande vocabulário de código aberto

    1.935+1Variação de estrelas nos últimos 7 dias
  • Uma lista selecionada de artigos, bibliotecas, conjuntos de dados e outros recursos incríveis sobre Diarização de Locutores.

    1.894+1Variação de estrelas nos últimos 7 dias
  • alan-sdk-ios@alan-ai

    O sistema de auto-codificação para seu aplicativo — Alan AI SDK para iOS

    1.878-3Variação de estrelas nos últimos 7 dias
  • O sistema de autocodificação para seu aplicativo — Alan AI SDK para Android

    1.807-1Variação de estrelas nos últimos 7 dias
  • whisper-turbo@FL33TW00D

    Whisper multiplataforma com aceleração por GPU 🏎️

    1.794+0Variação de estrelas nos últimos 7 dias
  • sherpa-ncnn@k2-fsa

    Reconhecimento de fala em tempo real e detecção de atividade de voz (VAD) usando a nova geração do Kaldi com ncnn, sem necessidade de conexão com a Internet. Suporte para iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre outros.

    1.777-1Variação de estrelas nos últimos 7 dias
  • O sistema de autocodificação para seu aplicativo — Alan AI SDK para Flutter.

    1.756-1Variação de estrelas nos últimos 7 dias
  • alan-sdk-ionic@alan-ai

    O sistema de auto-codificação para seu aplicativo — Alan AI SDK para Ionic

    1.649-1Variação de estrelas nos últimos 7 dias
  • dsnote@mkiol

    Aplicativo Speech Note para Linux. Tomada de notas, leitura e tradução com conversão de fala em texto, texto em fala e tradução automática offline.

    1.622+8Variação de estrelas nos últimos 7 dias
  • Plugin OBS para reconhecimento de fala local e legendagem usando IA.

    1.597+8Variação de estrelas nos últimos 7 dias
  • amica@semperai

    Amica é uma interface de código aberto para comunicação interativa com personagens 3D, utilizando síntese de voz e reconhecimento de fala.

    1.591-2Variação de estrelas nos últimos 7 dias
  • Nós personalizados que estendem as capacidades do Comfyui

    1.525+1Variação de estrelas nos últimos 7 dias
  • SALMONN@bytedance

    Família SALMONN: Um conjunto de LLMs multimodais avançados

    1.521+3Variação de estrelas nos últimos 7 dias
  • Fun-ASR@QwenAudio

    Família de modelos ASR de código aberto baseados em LLM para chinês, dialetos, sotaques e fala multilíngue, com runtimes FunASR, vLLM, streaming e llama.cpp.

    1.512+10Variação de estrelas nos últimos 7 dias
  • SpeechT5@microsoft

    Pré-treinamento multimodal de fala e texto para processamento de linguagem falada

    1.449+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos