voice-activity-detection
voice-activity-detection がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
voice-activity-detection と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、voice-activity-detection がタグ付けされたリポジトリ。
直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。
- #1
トレーニング、推論、ストリーミングASR、VAD、句読点、話者ダイアライゼーションパイプライン、およびOpenAI互換/MCPサービングのためのオープンソース音声認識ツールキット
★ 20,136+64直近 7 日のスター増減 - #2
話者ダイアライゼーションのためのニューラルビルディングブロック:音声活動検出、話者切り替わり検出、オーバーラップ音声検出、話者埋め込み。
★ 10,500+16直近 7 日のスター増減 - #3
Linux上でのリアルタイムマイクノイズ抑制。
★ 10,315+2直近 7 日のスター増減 - #4
Silero VAD: 事前学習済みエンタープライズグレードの音声活動検出器
★ 10,112+29直近 7 日のスター増減 - #5★ 7,864+7直近 7 日のスター増減
- #6
アプリ内で最先端の CoreML 音声モデルを利用可能に — テキスト読み上げ、音声認識、音声区間検出、話者ダイアライゼーション。Swift 製、SOTA のオープンソースを活用。
★ 2,723+13直近 7 日のスター増減 - #7
Cluely のオープンソース代替品 - 会議、面接、会話中に誰にも気づかれることなくシームレスに動作する、超高速でプライバシーファーストな AI アシスタント。Tauri製でネイティブのパフォーマンスを実現し、わずか 10MB。ビデオ通話、画面共有、録画でも完全に検出されません。
★ 2,619+12直近 7 日のスター増減 - #8★ 2,256+7直近 7 日のスター増減
- #9
🔊 音声およびサウンドコンピューティング向けのオープンソースデータセットの包括的なリスト(95以上のデータセット)
★ 2,223+1直近 7 日のスター増減 - #10★ 2,046+1直近 7 日のスター増減
- #11★ 2,024+1直近 7 日のスター増減
- #12
インターネット接続なしで次世代Kaldiとncnnを使用したリアルタイム音声認識および音声区間検出(VAD)。iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4Aなどをサポート
★ 1,777-1直近 7 日のスター増減 - #13
💎 ASR、TTS、その他の音声技術向けにアクセス可能な音声コーパスのリスト
★ 1,399+0直近 7 日のスター増減 - #14
Apple Silicon 向け AI 音声ツールキット — MLX と CoreML を活用した ASR、TTS、音声対音声、VAD、話者分離
★ 1,161+4直近 7 日のスター増減 - #15
Python製AIアシスタント 🧠
★ 1,014+0直近 7 日のスター増減 - #16
Whisper.net。Whisperモデルを使用して音声認識をシンプルに実現
★ 941+1直近 7 日のスター増減 - #17
CNNベースの音声セグメンテーションツールキット。音声、音楽、ノイズ、話者の性別の検出が可能。性別ごとの発話時間に基づく大規模な男女平等調査向けに設計されています。
★ 910+1直近 7 日のスター増減 - #18★ 860+1直近 7 日のスター増減
- #19
ASR、VAD、LID、Punc モジュールを備えた SOTA の産業グレードオールインワン ASR システム。FireRedASR2 は中国語(標準語、20以上の方言/アクセント)、英語、コードスイッチング、音声および歌唱の ASR をサポートします。FireRedVAD は 100 以上の言語で音声/歌唱/音楽をサポートします。FireRedLID は 100 以上の言語と 20 以上の中国語方言をサポートします。FireRedPunc は中国語と英語をサポートします。
★ 672+13直近 7 日のスター増減 - #20
複数の推論エンジンをサポートする、Whisperモデル向けの最適化されたSpeech-to-Textパイプライン
★ 578+1直近 7 日のスター増減 - #21
100以上の言語をサポートし、Silero-VAD、TEN-VAD、FunASR-VAD、WebRTC-VAD を凌駕する、SOTA の産業グレードの音声アクティビティ検出(VAD)および音声イベント検出ライブラリ。
★ 521+6直近 7 日のスター増減 - #22
事前トレーニング済み DNN、強制アライメント(Forced Alignment)、Transformer を使用して、字幕の自動同期と翻訳を行うか、文字起こしによって新しい字幕を作成します。https://subaligner.readthedocs.io/
★ 509+0直近 7 日のスター増減 - #23
Android 音声活動検出 (VAD) ライブラリ。WebRTC VAD GMM、Silero VAD DNN、Yamnet VAD DNN モデルをサポート。
★ 506+1直近 7 日のスター増減