voice-activity-detection
Erfasste Open-Source-Repos mit dem Tag voice-activity-detection, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit voice-activity-detection am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit voice-activity-detection getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Open-Source-Spracherkennungs-Toolkit für Training, Inferenz, Streaming-ASR, VAD, Interpunktion, Sprecherdiarisierungs-Pipelines und OpenAI-kompatibles/MCP-Serving.
★ 20.136+64Sterne-Änderung der letzten 7 Tage - #2
Neuronale Bausteine für Speaker Diarization: Spracherkennungsaktivität, Sprecherwechselerkennung, Erkennung überlappender Sprache, Sprecher-Embedding
★ 10.500+16Sterne-Änderung der letzten 7 Tage - #3
Echtzeit-Mikrofonrauschunterdrückung unter Linux.
★ 10.315+2Sterne-Änderung der letzten 7 Tage - #4
Silero VAD: vortrainierter Spracherkennungsdetektor (Voice Activity Detector) auf Unternehmensebene
★ 10.112+29Sterne-Änderung der letzten 7 Tage - #5★ 7.864+7Sterne-Änderung der letzten 7 Tage
- #6
Modernste CoreML-Audiomodelle in Ihren Apps — Text-to-Speech, Speech-to-Text, Spracherkennung und Sprecherdiarisierung. In Swift, angetrieben von SOTA Open Source.
★ 2.723+13Sterne-Änderung der letzten 7 Tage - #7
Die Open-Source-Alternative zu Cluely – Ein blitzschneller, datenschutzorientierter KI-Assistent, der unbemerkt bei Meetings, Interviews und Gesprächen unterstützt. Mit Tauri für native Performance entwickelt, nur 10 MB groß. In Videoanrufen, Bildschirmfreigaben und Aufnahmen völlig unsichtbar.
★ 2.619+12Sterne-Änderung der letzten 7 Tage - #8
Sprachaktivitätserkennung (VAD): Latenzarm, leistungsstark und leichtgewichtig
★ 2.256+7Sterne-Änderung der letzten 7 Tage - #9
🔊 Eine umfassende Liste von Open-Source-Datensätzen für Sprach- und Sound-Computing (über 95 Datensätze).
★ 2.223+1Sterne-Änderung der letzten 7 Tage - #10★ 2.046+1Sterne-Änderung der letzten 7 Tage
- #11★ 2.024+1Sterne-Änderung der letzten 7 Tage
- #12
Echtzeit-Spracherkennung und Spracherkennungs-Erkennung (VAD) mit der nächsten Generation von Kaldi und ncnn ohne Internetverbindung. Unterstützt iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A usw.
★ 1.777-1Sterne-Änderung der letzten 7 Tage - #13
💎 Eine Liste barrierefreier Sprachkorpora für ASR, TTS und andere Sprachtechnologien
★ 1.399+0Sterne-Änderung der letzten 7 Tage - #14
KI-Sprach-Toolkit für Apple Silicon – ASR, TTS, Speech-to-Speech, VAD und Diarisierung, angetrieben durch MLX und CoreML
★ 1.161+4Sterne-Änderung der letzten 7 Tage - #15
Python-KI-Assistent 🧠
★ 1.014+0Sterne-Änderung der letzten 7 Tage - #16
Whisper.net. Spracherkennung leicht gemacht mit Whisper Modellen.
★ 941+1Sterne-Änderung der letzten 7 Tage - #17
CNN-basiertes Toolkit zur Audiosegmentierung. Ermöglicht das Erkennen von Sprache, Musik, Rauschen und Sprechergeschlecht. Wurde für großangelegte Studien zur Geschlechtergerechtigkeit auf Basis der Sprechzeit pro Geschlecht entwickelt.
★ 910+1Sterne-Änderung der letzten 7 Tage - #18★ 860+1Sterne-Änderung der letzten 7 Tage
- #19
Ein industrietaugliches All-in-One-ASR-System auf dem neuesten Stand der Technik mit ASR-, VAD-, LID- und Punc-Modulen. FireRedASR2 unterstützt Chinesisch (Mandarin, über 20 Dialekte/Akzente), Englisch, Code-Switching sowie Sprache- und Gesangs-ASR. FireRedVAD unterstützt Sprache/Gesang/Musik in über 100 Sprachen. FireRedLID unterstützt über 100 Sprachen und über 20 chinesische Dialekte. FireRedPunc unterstützt Chinesisch und Englisch.
★ 672+13Sterne-Änderung der letzten 7 Tage - #20
Eine optimierte Speech-to-Text-Pipeline für das Whisper-Modell mit Unterstützung für mehrere Inferenz-Engines
★ 578+1Sterne-Änderung der letzten 7 Tage - #21
Eine industrielle SOTA-Lösung zur Spracherkennungs- und Audioereigniserkennung, die über 100 Sprachen unterstützt und Silero-VAD, TEN-VAD, FunASR-VAD sowie WebRTC-VAD übertrifft.
★ 521+6Sterne-Änderung der letzten 7 Tage - #22
Untertitel automatisch synchronisieren und übersetzen oder durch Transkription neu erstellen, unter Verwendung von vortrainierten DNNs, Forced Alignments und Transformern. https://subaligner.readthedocs.io/
★ 509+0Sterne-Änderung der letzten 7 Tage - #23
Android-Bibliothek für Voice Activity Detection (VAD). Unterstützt WebRTC VAD GMM, Silero VAD DNN und Yamnet VAD DNN Modelle.
★ 506+1Sterne-Änderung der letzten 7 Tage