voice-activity-detection
Các kho mã nguồn mở đang theo dõi được gắn thẻ voice-activity-detection, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng voice-activity-detection trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ voice-activity-detection.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.
★ 20.136+64Thay đổi số sao trong 7 ngày qua - #2
Khối xây dựng thần kinh cho việc phân đoạn người nói: phát hiện hoạt động giọng nói, phát hiện thay đổi người nói, phát hiện giọng nói chồng chéo, nhúng người nói
★ 10.500+16Thay đổi số sao trong 7 ngày qua - #3
Khử nhiễu micro thời gian thực trên Linux.
★ 10.315+2Thay đổi số sao trong 7 ngày qua - #4
Silero VAD: Trình phát hiện hoạt động giọng nói cấp doanh nghiệp đã được huấn luyện sẵn
★ 10.112+29Thay đổi số sao trong 7 ngày qua - #5★ 7.864+7Thay đổi số sao trong 7 ngày qua
- #6
Các mô hình âm thanh CoreML tiên tiến trong ứng dụng của bạn — chuyển văn bản thành giọng nói, chuyển giọng nói thành văn bản, phát hiện hoạt động giọng nói và phân đoạn người nói. Viết bằng Swift, cung cấp bởi các mã nguồn mở SOTA.
★ 2.723+13Thay đổi số sao trong 7 ngày qua - #7
Giải pháp thay thế mã nguồn mở cho Cluely - Trợ lý AI siêu nhanh, ưu tiên quyền riêng tư, hoạt động mượt mà trong các cuộc họp, phỏng vấn và trò chuyện mà không ai biết. Được xây dựng bằng Tauri cho hiệu năng nguyên bản, dung lượng chỉ 10MB. Hoàn toàn không thể bị phát hiện trong cuộc gọi video, chia sẻ màn hình và bản ghi.
★ 2.619+12Thay đổi số sao trong 7 ngày qua - #8★ 2.256+7Thay đổi số sao trong 7 ngày qua
- #9
🔊 Danh sách toàn diện các tập dữ liệu mã nguồn mở cho điện toán giọng nói và âm thanh (hơn 95 tập dữ liệu).
★ 2.223+1Thay đổi số sao trong 7 ngày qua - #10★ 2.046+1Thay đổi số sao trong 7 ngày qua
- #11★ 2.024+1Thay đổi số sao trong 7 ngày qua
- #12
Nhận dạng giọng nói thời gian thực và phát hiện hoạt động giọng nói (VAD) sử dụng Kaldi thế hệ mới với ncnn mà không cần kết nối Internet. Hỗ trợ iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, v.v.
★ 1.777-1Thay đổi số sao trong 7 ngày qua - #13
💎 Danh sách các kho ngữ liệu giọng nói có thể truy cập cho ASR, TTS và các Công nghệ Giọng nói khác
★ 1.399+0Thay đổi số sao trong 7 ngày qua - #14
Bộ công cụ giọng nói AI dành cho Apple Silicon — ASR, TTS, chuyển đổi giọng nói thành giọng nói, VAD và phân đoạn người nói được hỗ trợ bởi MLX và CoreML
★ 1.161+4Thay đổi số sao trong 7 ngày qua - #15
Trợ lý AI bằng Python
★ 1.014+0Thay đổi số sao trong 7 ngày qua - #16
Whisper.net. Chuyển đổi giọng nói thành văn bản đơn giản bằng các mô hình Whisper
★ 941+1Thay đổi số sao trong 7 ngày qua - #17
Bộ công cụ phân đoạn âm thanh dựa trên CNN. Cho phép phát hiện giọng nói, âm nhạc, tiếng ồn và giới tính người nói. Được thiết kế cho các nghiên cứu bình đẳng giới quy mô lớn dựa trên thời gian nói theo giới tính.
★ 910+1Thay đổi số sao trong 7 ngày qua - #18★ 860+1Thay đổi số sao trong 7 ngày qua
- #19
Hệ thống ASR tất cả trong một cấp công nghiệp SOTA với các mô-đun ASR, VAD, LID và Punc. FireRedASR2 hỗ trợ tiếng Trung (Quan thoại, 20+ phương ngữ/giọng), tiếng Anh, chuyển đổi mã, và ASR cho cả giọng nói lẫn hát. FireRedVAD hỗ trợ giọng nói/hát/nhạc bằng 100+ ngôn ngữ. FireRedLID hỗ trợ 100+ ngôn ngữ và 20+ phương ngữ tiếng Trung. FireRedPunc hỗ trợ tiếng Trung và tiếng Anh.
★ 672+15Thay đổi số sao trong 7 ngày qua - #20
Pipeline chuyển đổi giọng nói thành văn bản được tối ưu hóa cho mô hình Whisper, hỗ trợ nhiều công cụ suy luận.
★ 578+1Thay đổi số sao trong 7 ngày qua - #21
Công cụ phát hiện hoạt động giọng nói và sự kiện âm thanh cấp công nghiệp SOTA, hỗ trợ hơn 100 ngôn ngữ, vượt trội hơn Silero-VAD, TEN-VAD, FunASR-VAD và WebRTC-VAD
★ 521+7Thay đổi số sao trong 7 ngày qua - #22
Tự động đồng bộ và dịch phụ đề, hoặc tạo phụ đề mới bằng cách chuyển đổi giọng nói thành văn bản, sử dụng DNN tiền huấn luyện, Forced Alignments và Transformers.
★ 510+0Thay đổi số sao trong 7 ngày qua - #23
Thư viện Phát hiện Hoạt động Giọng nói (VAD) cho Android. Hỗ trợ các mô hình WebRTC VAD GMM, Silero VAD DNN và Yamnet VAD DNN.
★ 506+1Thay đổi số sao trong 7 ngày qua