Zum Hauptinhalt springen
buildradar
Sign in
Thema · voice-activity-detection

voice-activity-detection

Erfasste Open-Source-Repos mit dem Tag voice-activity-detection, sortiert nach Sternen.

Repos
23
Sterne gesamt
83.655
Sterne im Schnitt
3.637
Anteil
0,00%

Themen, die häufig gemeinsam mit voice-activity-detection am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit voice-activity-detection getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • FunASR@modelscope

    Open-Source-Spracherkennungs-Toolkit für Training, Inferenz, Streaming-ASR, VAD, Interpunktion, Sprecherdiarisierungs-Pipelines und OpenAI-kompatibles/MCP-Serving.

    20.136+64Sterne-Änderung der letzten 7 Tage
  • pyannote-audio@pyannote

    Neuronale Bausteine für Speaker Diarization: Spracherkennungsaktivität, Sprecherwechselerkennung, Erkennung überlappender Sprache, Sprecher-Embedding

    10.500+16Sterne-Änderung der letzten 7 Tage
  • NoiseTorch@noisetorch

    Echtzeit-Mikrofonrauschunterdrückung unter Linux.

    10.315+2Sterne-Änderung der letzten 7 Tage
  • silero-vad@snakers4

    Silero VAD: vortrainierter Spracherkennungsdetektor (Voice Activity Detector) auf Unternehmensebene

    10.112+29Sterne-Änderung der letzten 7 Tage
  • ffsubsync@smacke

    Untertitel automatisch mit Videos synchronisieren.

    7.864+7Sterne-Änderung der letzten 7 Tage
  • FluidAudio@FluidInference

    Modernste CoreML-Audiomodelle in Ihren Apps — Text-to-Speech, Speech-to-Text, Spracherkennung und Sprecherdiarisierung. In Swift, angetrieben von SOTA Open Source.

    2.723+13Sterne-Änderung der letzten 7 Tage
  • pluely@iamsrikanthnani

    Die Open-Source-Alternative zu Cluely – Ein blitzschneller, datenschutzorientierter KI-Assistent, der unbemerkt bei Meetings, Interviews und Gesprächen unterstützt. Mit Tauri für native Performance entwickelt, nur 10 MB groß. In Videoanrufen, Bildschirmfreigaben und Aufnahmen völlig unsichtbar.

    2.619+12Sterne-Änderung der letzten 7 Tage
  • ten-vad@TEN-framework

    Sprachaktivitätserkennung (VAD): Latenzarm, leistungsstark und leichtgewichtig

    2.256+7Sterne-Änderung der letzten 7 Tage
  • voice_datasets@jim-schwoebel

    🔊 Eine umfassende Liste von Open-Source-Datensätzen für Sprach- und Sound-Computing (über 95 Datensätze).

    2.223+1Sterne-Änderung der letzten 7 Tage
  • vad@ricky0123

    Sprachaktivierungserkennung (VAD) für den Browser mit einer einfachen API

    2.046+1Sterne-Änderung der letzten 7 Tage
  • diart@juanmc2005

    Ein Python-Paket zum Erstellen von KI-gestützten Echtzeit-Audioanwendungen

    2.024+1Sterne-Änderung der letzten 7 Tage
  • sherpa-ncnn@k2-fsa

    Echtzeit-Spracherkennung und Spracherkennungs-Erkennung (VAD) mit der nächsten Generation von Kaldi und ncnn ohne Internetverbindung. Unterstützt iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A usw.

    1.777-1Sterne-Änderung der letzten 7 Tage
  • 💎 Eine Liste barrierefreier Sprachkorpora für ASR, TTS und andere Sprachtechnologien

    1.399+0Sterne-Änderung der letzten 7 Tage
  • speech-swift@soniqo

    KI-Sprach-Toolkit für Apple Silicon – ASR, TTS, Speech-to-Speech, VAD und Diarisierung, angetrieben durch MLX und CoreML

    1.161+4Sterne-Änderung der letzten 7 Tage
  • Python-KI-Assistent 🧠

    1.014+0Sterne-Änderung der letzten 7 Tage
  • whisper.net@sandrohanea

    Whisper.net. Spracherkennung leicht gemacht mit Whisper Modellen.

    941+1Sterne-Änderung der letzten 7 Tage
  • inaSpeechSegmenter@ina-foss

    CNN-basiertes Toolkit zur Audiosegmentierung. Ermöglicht das Erkennen von Sprache, Musik, Rauschen und Sprechergeschlecht. Wurde für großangelegte Studien zur Geschlechtergerechtigkeit auf Basis der Sprechzeit pro Geschlecht entwickelt.

    910+1Sterne-Änderung der letzten 7 Tage
  • auditok@amsehili

    Ein Werkzeug zur Spracherkennung (VAD) und Audiosegmentierung

    860+1Sterne-Änderung der letzten 7 Tage
  • FireRedASR2S@FireRedTeam

    Ein industrietaugliches All-in-One-ASR-System auf dem neuesten Stand der Technik mit ASR-, VAD-, LID- und Punc-Modulen. FireRedASR2 unterstützt Chinesisch (Mandarin, über 20 Dialekte/Akzente), Englisch, Code-Switching sowie Sprache- und Gesangs-ASR. FireRedVAD unterstützt Sprache/Gesang/Musik in über 100 Sprachen. FireRedLID unterstützt über 100 Sprachen und über 20 chinesische Dialekte. FireRedPunc unterstützt Chinesisch und Englisch.

    672+13Sterne-Änderung der letzten 7 Tage
  • WhisperS2T@shashikg

    Eine optimierte Speech-to-Text-Pipeline für das Whisper-Modell mit Unterstützung für mehrere Inferenz-Engines

    578+1Sterne-Änderung der letzten 7 Tage
  • FireRedVAD@FireRedTeam

    Eine industrielle SOTA-Lösung zur Spracherkennungs- und Audioereigniserkennung, die über 100 Sprachen unterstützt und Silero-VAD, TEN-VAD, FunASR-VAD sowie WebRTC-VAD übertrifft.

    521+6Sterne-Änderung der letzten 7 Tage
  • subaligner@baxtree

    Untertitel automatisch synchronisieren und übersetzen oder durch Transkription neu erstellen, unter Verwendung von vortrainierten DNNs, Forced Alignments und Transformern. https://subaligner.readthedocs.io/

    509+0Sterne-Änderung der letzten 7 Tage
  • android-vad@gkonovalov

    Android-Bibliothek für Voice Activity Detection (VAD). Unterstützt WebRTC VAD GMM, Silero VAD DNN und Yamnet VAD DNN Modelle.

    506+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen