voice-activity-detection
标记 voice-activity-detection 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 voice-activity-detection 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 voice-activity-detection 主题的项目。
近 90 天内还没有新项目标记这个主题。
- #1★ 20,136+0近 7 天星标变化
- #2
用于说话者分割的神经构建模块:语音活动检测、说话者变换检测、重叠语音检测、说话者嵌入
★ 10,500+0近 7 天星标变化 - #3
Linux 上的实时麦克风噪声抑制
★ 10,315+0近 7 天星标变化 - #4
Silero VAD:预训练的企业级语音活动检测器
★ 10,112+0近 7 天星标变化 - #5★ 7,864+0近 7 天星标变化
- #6
在你的应用中使用前沿的 CoreML 音频模型——文字转语音、语音转文字、语音活动检测与发言者分离。使用 Swift 开发,由 SOTA 开源技术驱动。
★ 2,723+0近 7 天星标变化 - #7
Cluely 的开源替代方案 - 一款极速、注重隐私的 AI 助理,能在会议、面试和对话期间无缝运作且不被察觉。使用 Tauri 构建以获得原生性能,仅 10MB。在视频通话、画面共享和录制中完全无法被检测。
★ 2,619+0近 7 天星标变化 - #8★ 2,256+0近 7 天星标变化
- #9
🔊 语音与声音计算开源数据集的完整清单(95+ 个数据集)。
★ 2,223+0近 7 天星标变化 - #10★ 2,046+0近 7 天星标变化
- #11★ 2,024+0近 7 天星标变化
- #12
使用新一代 Kaldi 与 ncnn 在无网络连接下进行实时语音识别与语音活动检测(VAD)。支持 iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4A 等。
★ 1,777+0近 7 天星标变化 - #13
💎 适用于 ASR、TTS 及其他语音技术的无障碍语音语料库列表
★ 1,399+0近 7 天星标变化 - #14
适用于 Apple Silicon 的 AI 语音工具组 — 由 MLX 与 CoreML 驱动的 ASR、TTS、语音转语音、VAD 与说话者分段
★ 1,161+0近 7 天星标变化 - #15
Python AI 助手 🧠
★ 1,013-1近 7 天星标变化 - #16
Whisper.net。使用 Whisper Models 轻松实现语音转文字
★ 942+1近 7 天星标变化 - #17
基于 CNN 的音频分割工具包。可用于检测语音、音乐、噪音与说话者性别,专为基于各性别说话时间的大规模两性平等研究而设计。
★ 910+0近 7 天星标变化 - #18★ 860+0近 7 天星标变化
- #19
一个 SOTA 工业级一体化 ASR 系统,包含 ASR、VAD、LID 和 Punc 模块。FireRedASR2 支持中文(普通话、20+ 种方言/口音)、英文、中英夹杂(code-switching),以及语音和歌唱的 ASR。FireRedVAD 支持 100+ 种语言的语音/歌唱/音乐。FireRedLID 支持 100+ 种语言和 20+ 种中文方言。FireRedPunc 支持中英文。
★ 676+11近 7 天星标变化 - #20
支持多种推理引擎的 Whisper 模型语音转文字优化流水线。
★ 578+0近 7 天星标变化 - #21
工业级语音活动检测与音频事件检测技术,支持超过 100 种语言,性能优于 Silero-VAD、TEN-VAD、FunASR-VAD 与 WebRTC-VAD。
★ 526+7近 7 天星标变化 - #22
使用预训练 DNN、强制对齐与 Transformer 自动同步与翻译字幕,或通过转录创建新字幕。https://subaligner.readthedocs.io/
★ 510+1近 7 天星标变化 - #23
Android 语音活动检测 (VAD) 库。支持 WebRTC VAD GMM、Silero VAD DNN 与 Yamnet VAD DNN 模型。
★ 507+1近 7 天星标变化