voice-activity-detection
Repositórios de código aberto acompanhados marcados com voice-activity-detection, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de voice-activity-detection no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com voice-activity-detection.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Kit de ferramentas de reconhecimento de fala de código aberto para treinamento, inferência, streaming ASR, VAD, pontuação, pipelines de diarização de locutores e atendimento compatível com OpenAI/MCP.
★ 20.136+64Variação de estrelas nos últimos 7 dias - #2
Blocos de construção neural para diarização de locutores: detecção de atividade de fala, detecção de mudança de locutor, detecção de fala sobreposta, embutimento de locutor
★ 10.500+16Variação de estrelas nos últimos 7 dias - #3
Supressão de ruído de microfone em tempo real no Linux.
★ 10.315+2Variação de estrelas nos últimos 7 dias - #4
Silero VAD: Detector de Atividade de Voz pré-treinado de nível empresarial
★ 10.112+29Variação de estrelas nos últimos 7 dias - #5★ 7.864+7Variação de estrelas nos últimos 7 dias
- #6
Modelos de áudio CoreML de ponta em seus aplicativos — texto para fala, fala para texto, detecção de atividade de voz e diarização de locutores. Em Swift, impulsionado por código aberto SOTA.
★ 2.723+13Variação de estrelas nos últimos 7 dias - #7
A alternativa de código aberto ao Cluely - Um assistente de IA extremamente rápido e focado em privacidade que funciona perfeitamente durante reuniões, entrevistas e conversas sem que ninguém perceba. Construído com Tauri para desempenho nativo, com apenas 10MB. Completamente indetectável em chamadas de vídeo, compartilhamentos de tela e gravações.
★ 2.619+12Variação de estrelas nos últimos 7 dias - #8★ 2.256+7Variação de estrelas nos últimos 7 dias
- #9
🔊 Uma lista abrangente de conjuntos de dados de código aberto para computação de voz e som (mais de 95 conjuntos de dados).
★ 2.223+1Variação de estrelas nos últimos 7 dias - #10★ 2.046+1Variação de estrelas nos últimos 7 dias
- #11★ 2.024+1Variação de estrelas nos últimos 7 dias
- #12
Reconhecimento de fala em tempo real e detecção de atividade de voz (VAD) usando a nova geração do Kaldi com ncnn, sem necessidade de conexão com a Internet. Suporte para iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, entre outros.
★ 1.777-1Variação de estrelas nos últimos 7 dias - #13
Uma lista de corpora de fala acessíveis para ASR, TTS e outras tecnologias de fala.
★ 1.399+0Variação de estrelas nos últimos 7 dias - #14
Toolkit de fala de IA para Apple Silicon — ASR, TTS, speech-to-speech, VAD e diarização alimentados por MLX e CoreML
★ 1.161+4Variação de estrelas nos últimos 7 dias - #15
Assistente de IA em Python 🧠
★ 1.014+0Variação de estrelas nos últimos 7 dias - #16
Whisper.net. Fala para texto simplificada usando modelos Whisper
★ 941+1Variação de estrelas nos últimos 7 dias - #17
Kit de ferramentas de segmentação de áudio baseado em CNN. Permite detectar fala, música, ruído e gênero do locutor. Foi projetado para estudos de igualdade de gênero em larga escala baseados no tempo de fala por gênero.
★ 910+1Variação de estrelas nos últimos 7 dias - #18★ 860+1Variação de estrelas nos últimos 7 dias
- #19
Um sistema ASR All-in-One de nível industrial SOTA com módulos ASR, VAD, LID e Punc. O FireRedASR2 suporta chinês (mandarim, mais de 20 dialetos/sotaques), inglês, alternância de código, e ASR de fala e canto. O FireRedVAD suporta fala/canto/música em mais de 100 idiomas. O FireRedLID suporta mais de 100 idiomas e mais de 20 dialetos chineses. O FireRedPunc suporta chinês e inglês.
★ 672+13Variação de estrelas nos últimos 7 dias - #20
Um pipeline otimizado de Speech-to-Text para o modelo Whisper, suportando múltiplos motores de inferência
★ 578+1Variação de estrelas nos últimos 7 dias - #21
Detecção de atividade de voz e eventos de áudio de nível industrial SOTA, suportando mais de 100 idiomas, superando Silero-VAD, TEN-VAD, FunASR-VAD e WebRTC-VAD
★ 521+6Variação de estrelas nos últimos 7 dias - #22
Sincronize e traduza legendas automaticamente, ou crie novas por meio de transcrição, usando DNNs pré-treinados, alinhamentos forçados e Transformers. https://subaligner.readthedocs.io/
★ 509+0Variação de estrelas nos últimos 7 dias - #23
Biblioteca de Detecção de Atividade de Voz (VAD) para Android. Suporta modelos WebRTC VAD GMM, Silero VAD DNN e Yamnet VAD DNN.
★ 506+1Variação de estrelas nos últimos 7 dias