speech-recognition
Các kho mã nguồn mở đang theo dõi được gắn thẻ speech-recognition, sắp xếp theo số sao.
- #91
Trung tâm nghiên cứu AI âm thanh: các bài báo, mô hình mở, điểm chuẩn và tập dữ liệu trên audio LLMs, nhận dạng giọng nói, TTS, tạo nhạc và âm thanh.
★ 953+3Thay đổi số sao trong 7 ngày qua - #92
Dịch vụ phiên âm và phân chia đoạn hội thoại ngoại tuyến, tự lưu trữ, sẵn sàng sử dụng kèm tóm tắt bằng LLM
★ 948+2Thay đổi số sao trong 7 ngày qua - #93
Whisper.net. Chuyển đổi giọng nói thành văn bản đơn giản bằng các mô hình Whisper
★ 941+1Thay đổi số sao trong 7 ngày qua - #94★ 939+0Thay đổi số sao trong 7 ngày qua
- #95
Trợ lý giọng nói trên máy tính dựa trên Python, có khả năng thực thi các lệnh cấp hệ thống, tích hợp nhận dạng giọng nói và chuyển đổi văn bản thành giọng nói, đồng thời xử lý các tương tác người dùng bất đồng bộ.
★ 919+13Thay đổi số sao trong 7 ngày qua - #96
Các mô hình Whisper được tối ưu hóa cho việc truyền phát và sử dụng trên thiết bị.
★ 897+0Thay đổi số sao trong 7 ngày qua - #97
Một LLM có khả năng trò chuyện chạy trên máy tính cá nhân của bạn mà không cần kết nối Internet.
★ 891+2Thay đổi số sao trong 7 ngày qua - #98
:speech_balloon: SpeechPy - Thư viện xử lý và nhận dạng giọng nói: http://speechpy.readthedocs.io/en/latest/
★ 883+0Thay đổi số sao trong 7 ngày qua - #99
Triển khai nhận dạng giọng nói tiếng Trung đầu cuối dựa trên PaddlePaddle, từ cơ bản đến thực tế, với các ví dụ nhập môn đơn giản và dự án doanh nghiệp thiết thực. Hỗ trợ các mô hình phổ biến hiện nay như DeepSpeech2, Conformer và Squeezeformer.
★ 870-1Thay đổi số sao trong 7 ngày qua - #100
Nhận dạng giọng nói cho ứng dụng React của bạn
★ 842+1Thay đổi số sao trong 7 ngày qua - #101
Các thuật toán giải mã Connectionist Temporal Classification (CTC): best path, beam search, lexicon search, prefix search và token passing. Được triển khai bằng Python
★ 836-1Thay đổi số sao trong 7 ngày qua - #102
Xây dựng ứng dụng web chuyển đổi giọng nói thành văn bản thời gian thực sử dụng Whisper của OpenAI https://openai.com/blog/whisper/
★ 835+0Thay đổi số sao trong 7 ngày qua - #103★ 823-1Thay đổi số sao trong 7 ngày qua
- #104
Công cụ đọc chính tả bằng giọng nói miễn phí, mã nguồn mở và hoạt động 100% ngoại tuyến cho Linux. Nói và nhập liệu ở bất kỳ đâu thông qua các engine whisper.cpp, Whisper và VOSK, có hỗ trợ tăng tốc GPU và hoạt động trên X11 + Wayland!
★ 806+21Thay đổi số sao trong 7 ngày qua - #105
Lobe TTS - Thư viện TTS/STT chất lượng cao và đáng tin cậy cho máy chủ và trình duyệt.
★ 805+1Thay đổi số sao trong 7 ngày qua - #106
Chuyển đổi giọng nói thành văn bản rồi thành giọng nói (Speech to Text to Speech). Gửi văn bản dưới dạng thông điệp OSC tới VRChat để hiển thị trên avatar.
★ 803+4Thay đổi số sao trong 7 ngày qua - #107
Binding React Native cho whisper.cpp.
★ 800-1Thay đổi số sao trong 7 ngày qua - #108
Chatbot giọng nói cục bộ cho các cuộc hội thoại hấp dẫn, được hỗ trợ bởi Ollama, Hugging Face Transformers và Coqui TTS Toolkit
★ 788+1Thay đổi số sao trong 7 ngày qua - #109
Dự án cho phép sử dụng micro với OpenAI whisper.
★ 787+0Thay đổi số sao trong 7 ngày qua - #110★ 786+17Thay đổi số sao trong 7 ngày qua
- #111
🎤 Cách dễ nhất để chuyển đổi âm thanh thành văn bản trong Swift
★ 785-1Thay đổi số sao trong 7 ngày qua - #112
Một ứng dụng chuyển đổi giọng nói thành văn bản AI bảo mật 100%, hỗ trợ hơn 100 ngôn ngữ. Được xây dựng bằng Compose Multiplatform cho Android & iOS sử dụng Whisper AI - không tải lên đám mây, mọi quá trình xử lý diễn ra trên thiết bị để đảm bảo quyền riêng tư tuyệt đối.
★ 777+1Thay đổi số sao trong 7 ngày qua - #113
Chuyển đổi nhanh giữa số tiếng Trung và số Ả Rập (tính năng mới nhất: chuyển đổi phân số, ngày tháng, nhiệt độ, v.v.).
★ 766+0Thay đổi số sao trong 7 ngày qua - #114★ 763+1Thay đổi số sao trong 7 ngày qua
- #115
Nhận dạng giọng nói tiếng Trung dựa trên PaddlePaddle. Dự án hoàn thiện với hiệu suất nhận dạng tốt. Hỗ trợ huấn luyện và dự đoán trên Windows, Linux, cũng như hỗ trợ dự đoán trên bo mạch phát triển Nvidia Jetson.
★ 762+0Thay đổi số sao trong 7 ngày qua - #116★ 754+2Thay đổi số sao trong 7 ngày qua
- #117
Chạy mô hình chuyển đổi giọng nói thành văn bản (whisper.cpp) trong Unity3d trên máy cục bộ của bạn.
★ 751+1Thay đổi số sao trong 7 ngày qua - #118
Allosaurus là bộ nhận diện âm vị phổ quát được huấn luyện trước cho hơn 2000 ngôn ngữ.
★ 746+4Thay đổi số sao trong 7 ngày qua - #119
Bàn phím và dịch vụ nhận dạng giọng nói riêng tư, chạy trên thiết bị dành cho Android.
★ 745+6Thay đổi số sao trong 7 ngày qua - #120
Khung nhận dạng giọng nói tự động (ASR) dựa trên PyTorch, hỗ trợ cả chế độ trực tuyến và ngoại tuyến, các mô hình Conformer, Squeezeformer, DeepSpeech2 và nhiều phương pháp tăng cường dữ liệu
★ 727+0Thay đổi số sao trong 7 ngày qua