Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · voice-activity-detection

voice-activity-detection

Các kho mã nguồn mở đang theo dõi được gắn thẻ voice-activity-detection, sắp xếp theo số sao.

Kho mã
23
Tổng số sao
83.655
Số sao trung bình
3.637
Tỷ trọng
0,00%

Những chủ đề thường xuất hiện cùng voice-activity-detection trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ voice-activity-detection.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • FunASR@modelscope

    Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.

    20.136+64Thay đổi số sao trong 7 ngày qua
  • pyannote-audio@pyannote

    Khối xây dựng thần kinh cho việc phân đoạn người nói: phát hiện hoạt động giọng nói, phát hiện thay đổi người nói, phát hiện giọng nói chồng chéo, nhúng người nói

    10.500+16Thay đổi số sao trong 7 ngày qua
  • NoiseTorch@noisetorch

    Khử nhiễu micro thời gian thực trên Linux.

    10.315+2Thay đổi số sao trong 7 ngày qua
  • silero-vad@snakers4

    Silero VAD: Trình phát hiện hoạt động giọng nói cấp doanh nghiệp đã được huấn luyện sẵn

    10.112+29Thay đổi số sao trong 7 ngày qua
  • ffsubsync@smacke

    Tự động đồng bộ phụ đề với video một cách kỳ diệu.

    7.864+7Thay đổi số sao trong 7 ngày qua
  • FluidAudio@FluidInference

    Các mô hình âm thanh CoreML tiên tiến trong ứng dụng của bạn — chuyển văn bản thành giọng nói, chuyển giọng nói thành văn bản, phát hiện hoạt động giọng nói và phân đoạn người nói. Viết bằng Swift, cung cấp bởi các mã nguồn mở SOTA.

    2.723+13Thay đổi số sao trong 7 ngày qua
  • pluely@iamsrikanthnani

    Giải pháp thay thế mã nguồn mở cho Cluely - Trợ lý AI siêu nhanh, ưu tiên quyền riêng tư, hoạt động mượt mà trong các cuộc họp, phỏng vấn và trò chuyện mà không ai biết. Được xây dựng bằng Tauri cho hiệu năng nguyên bản, dung lượng chỉ 10MB. Hoàn toàn không thể bị phát hiện trong cuộc gọi video, chia sẻ màn hình và bản ghi.

    2.619+12Thay đổi số sao trong 7 ngày qua
  • ten-vad@TEN-framework

    Trình phát hiện hoạt động giọng nói (VAD): độ trễ thấp, hiệu suất cao và nhẹ

    2.256+7Thay đổi số sao trong 7 ngày qua
  • voice_datasets@jim-schwoebel

    🔊 Danh sách toàn diện các tập dữ liệu mã nguồn mở cho điện toán giọng nói và âm thanh (hơn 95 tập dữ liệu).

    2.223+1Thay đổi số sao trong 7 ngày qua
  • vad@ricky0123

    Bộ phát hiện hoạt động giọng nói (VAD) cho trình duyệt với API đơn giản

    2.046+1Thay đổi số sao trong 7 ngày qua
  • diart@juanmc2005

    Một gói python để xây dựng các ứng dụng âm thanh thời gian thực được hỗ trợ bởi AI

    2.024+1Thay đổi số sao trong 7 ngày qua
  • sherpa-ncnn@k2-fsa

    Nhận dạng giọng nói thời gian thực và phát hiện hoạt động giọng nói (VAD) sử dụng Kaldi thế hệ mới với ncnn mà không cần kết nối Internet. Hỗ trợ iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, v.v.

    1.777-1Thay đổi số sao trong 7 ngày qua
  • 💎 Danh sách các kho ngữ liệu giọng nói có thể truy cập cho ASR, TTS và các Công nghệ Giọng nói khác

    1.399+0Thay đổi số sao trong 7 ngày qua
  • speech-swift@soniqo

    Bộ công cụ giọng nói AI dành cho Apple Silicon — ASR, TTS, chuyển đổi giọng nói thành giọng nói, VAD và phân đoạn người nói được hỗ trợ bởi MLX và CoreML

    1.161+4Thay đổi số sao trong 7 ngày qua
  • Trợ lý AI bằng Python

    1.014+0Thay đổi số sao trong 7 ngày qua
  • whisper.net@sandrohanea

    Whisper.net. Chuyển đổi giọng nói thành văn bản đơn giản bằng các mô hình Whisper

    941+1Thay đổi số sao trong 7 ngày qua
  • inaSpeechSegmenter@ina-foss

    Bộ công cụ phân đoạn âm thanh dựa trên CNN. Cho phép phát hiện giọng nói, âm nhạc, tiếng ồn và giới tính người nói. Được thiết kế cho các nghiên cứu bình đẳng giới quy mô lớn dựa trên thời gian nói theo giới tính.

    910+1Thay đổi số sao trong 7 ngày qua
  • auditok@amsehili

    Công cụ phát hiện hoạt động giọng nói và phân đoạn âm thanh

    860+1Thay đổi số sao trong 7 ngày qua
  • FireRedASR2S@FireRedTeam

    Hệ thống ASR tất cả trong một cấp công nghiệp SOTA với các mô-đun ASR, VAD, LID và Punc. FireRedASR2 hỗ trợ tiếng Trung (Quan thoại, 20+ phương ngữ/giọng), tiếng Anh, chuyển đổi mã, và ASR cho cả giọng nói lẫn hát. FireRedVAD hỗ trợ giọng nói/hát/nhạc bằng 100+ ngôn ngữ. FireRedLID hỗ trợ 100+ ngôn ngữ và 20+ phương ngữ tiếng Trung. FireRedPunc hỗ trợ tiếng Trung và tiếng Anh.

    672+15Thay đổi số sao trong 7 ngày qua
  • WhisperS2T@shashikg

    Pipeline chuyển đổi giọng nói thành văn bản được tối ưu hóa cho mô hình Whisper, hỗ trợ nhiều công cụ suy luận.

    578+1Thay đổi số sao trong 7 ngày qua
  • FireRedVAD@FireRedTeam

    Công cụ phát hiện hoạt động giọng nói và sự kiện âm thanh cấp công nghiệp SOTA, hỗ trợ hơn 100 ngôn ngữ, vượt trội hơn Silero-VAD, TEN-VAD, FunASR-VAD và WebRTC-VAD

    521+7Thay đổi số sao trong 7 ngày qua
  • subaligner@baxtree

    Tự động đồng bộ và dịch phụ đề, hoặc tạo phụ đề mới bằng cách chuyển đổi giọng nói thành văn bản, sử dụng DNN tiền huấn luyện, Forced Alignments và Transformers.

    510+0Thay đổi số sao trong 7 ngày qua
  • android-vad@gkonovalov

    Thư viện Phát hiện Hoạt động Giọng nói (VAD) cho Android. Hỗ trợ các mô hình WebRTC VAD GMM, Silero VAD DNN và Yamnet VAD DNN.

    506+1Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề