speaker-diarization
Các kho mã nguồn mở đang theo dõi được gắn thẻ speaker-diarization, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng speaker-diarization trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ speaker-diarization.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.
★ 20.136+64Thay đổi số sao trong 7 ngày qua - #2
Bộ công cụ nhận diện giọng nói dựa trên PyTorch
★ 11.802+10Thay đổi số sao trong 7 ngày qua - #3
Chuyển đổi giọng nói thành văn bản cục bộ, thời gian thực với ASR phát trực tuyến, phân đoạn người nói, dịch thuật và các API tương thích với OpenAI/Deepgram.
★ 10.990+16Thay đổi số sao trong 7 ngày qua - #4
Khối xây dựng thần kinh cho việc phân đoạn người nói: phát hiện hoạt động giọng nói, phát hiện thay đổi người nói, phát hiện giọng nói chồng chéo, nhúng người nói
★ 10.500+16Thay đổi số sao trong 7 ngày qua - #5★ 9.949+3Thay đổi số sao trong 7 ngày qua
- #6
AI giọng nói trên thiết bị dành cho Apple Silicon
★ 6.353+8Thay đổi số sao trong 7 ngày qua - #7
Nhận dạng giọng nói tự động kết hợp phân đoạn người nói dựa trên OpenAI Whisper
★ 5.634+1Thay đổi số sao trong 7 ngày qua - #8
Các tệp thực thi độc lập của Whisper và Faster-Whisper dành cho những ai không muốn bận tâm về Python.
★ 3.171+2Thay đổi số sao trong 7 ngày qua - #9
Kho lưu trữ dành cho Xác thực người nói đơn và đa phương thức, Nhận diện người nói và Phân đoạn người nói
★ 3.128+3Thay đổi số sao trong 7 ngày qua - #10
Nhận dạng Tự động Tiếng nói Đa ngôn ngữ với mốc thời gian cấp độ từ và độ tin cậy
★ 2.842+1Thay đổi số sao trong 7 ngày qua - #11
Các mô hình âm thanh CoreML tiên tiến trong ứng dụng của bạn — chuyển văn bản thành giọng nói, chuyển giọng nói thành văn bản, phát hiện hoạt động giọng nói và phân đoạn người nói. Viết bằng Swift, cung cấp bởi các mã nguồn mở SOTA.
★ 2.723+13Thay đổi số sao trong 7 ngày qua - #12★ 2.024+1Thay đổi số sao trong 7 ngày qua
- #13
Danh sách tổng hợp các bài báo, thư viện, tập dữ liệu và các tài nguyên tuyệt vời khác về Phân đoạn Người nói.
★ 1.894+1Thay đổi số sao trong 7 ngày qua - #14
Dòng mô hình ASR dựa trên LLM mã nguồn mở cho tiếng Trung, phương ngữ, tiếng địa phương và giọng nói đa ngôn ngữ, với các thời gian chạy FunASR, vLLM, streaming và llama.cpp.
★ 1.512+10Thay đổi số sao trong 7 ngày qua - #15
Bộ công cụ xác thực, nhận dạng và phân đoạn người nói hướng đến nghiên cứu và sản xuất
★ 1.402+8Thay đổi số sao trong 7 ngày qua - #16
Bộ công cụ giọng nói AI dành cho Apple Silicon — ASR, TTS, chuyển đổi giọng nói thành giọng nói, VAD và phân đoạn người nói được hỗ trợ bởi MLX và CoreML
★ 1.161+4Thay đổi số sao trong 7 ngày qua - #17
Dịch vụ phiên âm và phân chia đoạn hội thoại ngoại tuyến, tự lưu trữ, sẵn sàng sử dụng kèm tóm tắt bằng LLM
★ 948+2Thay đổi số sao trong 7 ngày qua - #18
Phần mềm tạo phụ đề tự động tất cả trong một, bao gồm toàn bộ quy trình tải xuống, phiên âm, dịch thuật và đóng phụ đề mà không cần sự can thiệp của con người.
★ 810+3Thay đổi số sao trong 7 ngày qua - #19★ 677+0Thay đổi số sao trong 7 ngày qua
- #20
Triển khai lại bằng Python các thuật toán phân cụm phổ (có ràng buộc) được sử dụng trong các bài báo về phân đoạn người nói của Google.
★ 555+0Thay đổi số sao trong 7 ngày qua