voice-activity-detection
Dépôts open source suivis étiquetés voice-activity-detection, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de voice-activity-detection sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés voice-activity-detection.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Boîte à outils de reconnaissance vocale open source pour l'entraînement, l'inférence, l'ASR en streaming, le VAD, la ponctuation, les pipelines de diarisation du locuteur et le service compatible OpenAI/MCP.
★ 20 136+64Évolution des étoiles sur les 7 derniers jours - #2
Blocs de construction neuronaux pour la diarisation du locuteur : détection d'activité vocale, détection de changement de locuteur, détection de chevauchement vocal, et embedding de locuteur.
★ 10 500+16Évolution des étoiles sur les 7 derniers jours - #3
Suppression du bruit du microphone en temps réel sous Linux.
★ 10 315+2Évolution des étoiles sur les 7 derniers jours - #4
Silero VAD : détecteur d'activité vocale pré-entraîné de qualité professionnelle.
★ 10 112+29Évolution des étoiles sur les 7 derniers jours - #5★ 7 864+7Évolution des étoiles sur les 7 derniers jours
- #6
Modèles audio CoreML de pointe dans vos applications : synthèse vocale, reconnaissance vocale, détection d'activité vocale et diarisation des locuteurs. En Swift, propulsé par des solutions open source SOTA.
★ 2 723+13Évolution des étoiles sur les 7 derniers jours - #7
L'alternative open source à Cluely - Un assistant IA ultra-rapide axé sur la confidentialité, fonctionnant en toute transparence pendant les réunions, entretiens et conversations sans être détecté. Construit avec Tauri pour des performances natives, seulement 10 Mo. Totalement indétectable lors des appels vidéo, partages d'écran et enregistrements.
★ 2 619+12Évolution des étoiles sur les 7 derniers jours - #8
Détecteur d'activité vocale (VAD) : faible latence, haute performance et léger.
★ 2 256+7Évolution des étoiles sur les 7 derniers jours - #9
🔊 Une liste exhaustive de jeux de données open source pour le traitement de la voix et du son (plus de 95 jeux de données).
★ 2 223+1Évolution des étoiles sur les 7 derniers jours - #10★ 2 046+1Évolution des étoiles sur les 7 derniers jours
- #11★ 2 024+1Évolution des étoiles sur les 7 derniers jours
- #12
Reconnaissance vocale en temps réel et détection d'activité vocale (VAD) utilisant la nouvelle génération de Kaldi avec ncnn, sans connexion Internet. Supporte iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, etc.
★ 1 777-1Évolution des étoiles sur les 7 derniers jours - #13
Une liste de corpus vocaux accessibles pour l'ASR, le TTS et d'autres technologies vocales.
★ 1 399+0Évolution des étoiles sur les 7 derniers jours - #14
Boîte à outils vocale IA pour Apple Silicon — ASR, TTS, speech-to-speech, VAD et diarisation propulsés par MLX et CoreML
★ 1 161+4Évolution des étoiles sur les 7 derniers jours - #15
Assistant IA en Python 🧠
★ 1 014+0Évolution des étoiles sur les 7 derniers jours - #16
Whisper.net. La conversion parole-texte simplifiée grâce aux modèles Whisper.
★ 941+1Évolution des étoiles sur les 7 derniers jours - #17
Boîte à outils de segmentation audio basée sur les CNN. Permet de détecter la parole, la musique, le bruit et le genre du locuteur. Conçue pour des études à grande échelle sur l'égalité des genres basées sur le temps de parole par genre.
★ 910+1Évolution des étoiles sur les 7 derniers jours - #18★ 860+1Évolution des étoiles sur les 7 derniers jours
- #19
Système ASR industriel tout-en-un de pointe incluant des modules ASR, VAD, LID et de ponctuation. FireRedASR2 prend en charge le chinois, l'anglais, le code-switching ainsi que la reconnaissance de la parole et du chant.
★ 670+12Évolution des étoiles sur les 7 derniers jours - #20
Un pipeline de transcription (Speech-to-Text) optimisé pour le modèle Whisper prenant en charge plusieurs moteurs d'inférence
★ 578+1Évolution des étoiles sur les 7 derniers jours - #21
Détection d'activité vocale et d'événements audio de niveau industriel, prenant en charge plus de 100 langues et surpassant Silero-VAD, TEN-VAD, FunASR-VAD et WebRTC-VAD
★ 520+5Évolution des étoiles sur les 7 derniers jours - #22
Synchronisation et traduction automatique de sous-titres, ou création de nouveaux par transcription, utilisant des DNN pré-entraînés, l'alignement forcé et des Transformers.
★ 509+0Évolution des étoiles sur les 7 derniers jours - #23
Bibliothèque de détection d'activité vocale (VAD) pour Android. Supporte les modèles WebRTC VAD GMM, Silero VAD DNN et Yamnet VAD DNN.
★ 506+1Évolution des étoiles sur les 7 derniers jours