speech-recognition
Các kho mã nguồn mở đang theo dõi được gắn thẻ speech-recognition, sắp xếp theo số sao.
- #121★ 719+0Thay đổi số sao trong 7 ngày qua
- #122
Chuyển đổi giọng nói thành văn bản và phụ đề nhập liệu KB cho OBS, VRChat, Twitch chat và Discord
★ 718+0Thay đổi số sao trong 7 ngày qua - #123
Bộ công cụ mã nguồn mở cho nhận dạng giọng nói đầu-cuối, tận dụng PyTorch-Lightning và Hydra.
★ 714-1Thay đổi số sao trong 7 ngày qua - #124
Công cụ chuyển đổi giọng nói thành ý định (Speech-to-Intent) trên thiết bị được hỗ trợ bởi học sâu
★ 711+1Thay đổi số sao trong 7 ngày qua - #125
Ví dụ về API giọng nói.
★ 708+0Thay đổi số sao trong 7 ngày qua - #126
Khung đánh giá hiệu năng chuyển đổi giọng nói thành văn bản
★ 697+0Thay đổi số sao trong 7 ngày qua - #127
Nhận dạng giọng nói ngoại tuyến với OpenAI Whisper và TensorFlow Lite cho Android
★ 688-1Thay đổi số sao trong 7 ngày qua - #128
Các bài báo INTERSPEECH 2023-2024: Bộ sưu tập đầy đủ các bài nghiên cứu có ảnh hưởng và thú vị từ hội nghị INTERSPEECH 2023-24. Khám phá những tiến bộ mới nhất trong xử lý ngôn ngữ và giọng nói. Bao gồm mã nguồn. Hãy gắn sao cho kho lưu trữ để ủng hộ sự phát triển của công nghệ giọng nói!
★ 684-1Thay đổi số sao trong 7 ngày qua - #129
Một bộ dữ liệu âm thanh miễn phí về các chữ số được đọc. Phiên bản âm thanh của MNIST.
★ 678+0Thay đổi số sao trong 7 ngày qua - #130
Nhận dạng giọng nói cho các dự án React Native Expo
★ 676+6Thay đổi số sao trong 7 ngày qua - #131
Công cụ chuyển đổi giọng nói thành văn bản trực tuyến trên thiết bị dựa trên học sâu
★ 671+0Thay đổi số sao trong 7 ngày qua - #132
Giao diện dòng lệnh cho các tính năng nhận dạng và chuyển đổi giọng nói tích hợp sẵn trên macOS.
★ 669-1Thay đổi số sao trong 7 ngày qua - #133
Hệ thống ASR tất cả trong một cấp công nghiệp SOTA với các mô-đun ASR, VAD, LID và Punc. FireRedASR2 hỗ trợ tiếng Trung (Quan thoại, 20+ phương ngữ/giọng), tiếng Anh, chuyển đổi mã, và ASR cho cả giọng nói lẫn hát. FireRedVAD hỗ trợ giọng nói/hát/nhạc bằng 100+ ngôn ngữ. FireRedLID hỗ trợ 100+ ngôn ngữ và 20+ phương ngữ tiếng Trung. FireRedPunc hỗ trợ tiếng Trung và tiếng Anh.
★ 669+10Thay đổi số sao trong 7 ngày qua - #134
ChatGPT tại nhà! Một giải pháp thay thế tốt hơn cho các trợ lý nhà thông minh thương mại, được xây dựng trên Raspberry Pi sử dụng LiteLLM và LangGraph.
★ 648+0Thay đổi số sao trong 7 ngày qua - #135
:speech_balloon: /so.nus/ STT (speech to text) cho Node với tính năng phát hiện từ khóa ngoại tuyến
★ 638+0Thay đổi số sao trong 7 ngày qua - #136
Trình soạn thảo phương thức nhập (IME) cho Android dựa trên Whisper
★ 630+5Thay đổi số sao trong 7 ngày qua - #137
Dịch âm thanh thời gian thực, thu âm thanh hệ thống và micro, chạy ASR (Whisper/SenseVoice), dịch qua API LLM với hiển thị luồng. Phù hợp cho VTuber, người livestream và xem nội dung nước ngoài.
★ 621+18Thay đổi số sao trong 7 ngày qua - #138
Chuyển đổi giọng nói thành văn bản thời gian thực sử dụng faster-whisper.
★ 614+0Thay đổi số sao trong 7 ngày qua - #139
C++ ggml runtime hub cho các mô hình ASR và TTS đa ngôn ngữ: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, cùng với tính năng căn chỉnh bắt buộc phổ quát và nhiều hơn nữa
★ 610+14Thay đổi số sao trong 7 ngày qua - #140
Bộ giải mã Connectionist Temporal Classification (CTC) với từ điển và mô hình ngôn ngữ.
★ 580+1Thay đổi số sao trong 7 ngày qua - #141
Pipeline chuyển đổi giọng nói thành văn bản được tối ưu hóa cho mô hình Whisper, hỗ trợ nhiều công cụ suy luận.
★ 578+1Thay đổi số sao trong 7 ngày qua - #142
Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho React Native.
★ 575+0Thay đổi số sao trong 7 ngày qua - #143
Một ngôn ngữ lập trình node mô-đun, trình tạo chương trình, hệ thống hoạt ảnh, bộ công cụ, bộ định tuyến và trình gỡ lỗi được tạo cho VRChat
★ 563-1Thay đổi số sao trong 7 ngày qua - #144
Một lớp phủ (overlay) lấy quyền truy cập giọng nói của người dùng và chuyển đổi đầu vào thành văn bản trong giao diện tùy chỉnh
★ 557+0Thay đổi số sao trong 7 ngày qua - #145
SpeechIO Leaderboard: nền tảng đánh giá hiệu năng toàn diện, mạnh mẽ và quy mô lớn cho Nhận dạng giọng nói tự động (ASR).
★ 553+3Thay đổi số sao trong 7 ngày qua - #146
Danh sách API nhận dạng giọng nói tiếng Hàn (STT). Đi kèm đánh giá hiệu năng.
★ 547+1Thay đổi số sao trong 7 ngày qua - #147
Tác nhân tương tác giọng nói hai chiều (Speech-to-Speech) chất lượng cao và hỗ trợ streaming trong một tệp duy nhất.
★ 541+0Thay đổi số sao trong 7 ngày qua - #148
Công cụ đọc chính tả bằng giọng nói cục bộ, miễn phí, tốc độ cao cho macOS với khả năng chuyển đổi văn bản trên thiết bị
★ 533+16Thay đổi số sao trong 7 ngày qua - #149
Thư viện nhận dạng giọng nói chạy trên trình duyệt nhờ bản dựng WebAssembly của Vosk
★ 529+0Thay đổi số sao trong 7 ngày qua - #150
Công cụ nhận dạng giọng nói (ASR) và chuyển văn bản thành giọng nói (TTS). Hỗ trợ nhận dạng giọng nói tiếng Trung và tiếng Anh, tổng hợp giọng nói đa nhân vật, hỗ trợ đa ngôn ngữ với độ chính xác cao.
★ 528+0Thay đổi số sao trong 7 ngày qua