speech-recognition
Các kho mã nguồn mở đang theo dõi được gắn thẻ speech-recognition, sắp xếp theo số sao.
- #61
💎 Danh sách các kho ngữ liệu giọng nói có thể truy cập cho ASR, TTS và các Công nghệ Giọng nói khác
★ 1.399+0Thay đổi số sao trong 7 ngày qua - #62
Tinh chỉnh LLM trên máy Mac của bạn với Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding và tinh chỉnh OCR — chạy gốc trên MLX. API tương thích với Unsloth.
★ 1.398+8Thay đổi số sao trong 7 ngày qua - #63
Bản ghi âm có thể điều khiển. Nguyên văn (mọi từ đệm, khoảng dừng, lắp bắp, âm thanh phát ra), hoặc theo ý định (ý người nói muốn diễn đạt, được tối ưu hóa cho khả năng đọc) với dấu thời gian ở cấp độ từ.
★ 1.371+13Thay đổi số sao trong 7 ngày qua - #64
Client dòng lệnh Whisper tương thích với client gốc của OpenAI dựa trên CTranslate2.
★ 1.346+2Thay đổi số sao trong 7 ngày qua - #65
Trợ lý cá nhân được xây dựng bằng các thư viện python. Nó có thể thực hiện hầu như mọi thứ bao gồm gửi email, nhận dạng văn bản quang học, báo cáo tin tức động bất cứ lúc nào với tích hợp API, tạo danh sách việc cần làm, mở bất kỳ trang web nào chỉ bằng lệnh thoại, phát nhạc, tìm kiếm Wikipedia, từ điển có cảm biến thông minh tức là tự động kiểm tra chính tả, báo cáo thời tiết tức là nhiệt độ, tốc độ gió, độ ẩm.
★ 1.341+5Thay đổi số sao trong 7 ngày qua - #66
Chuyển giọng nói thành văn bản với tính năng nhấn để nói dành cho Wayland compositor
★ 1.338+42Thay đổi số sao trong 7 ngày qua - #67
StreamSpeech là một mô hình liền mạch "tất cả trong một" dành cho nhận dạng giọng nói ngoại tuyến và đồng thời, dịch giọng nói và tổng hợp giọng nói.
★ 1.288+0Thay đổi số sao trong 7 ngày qua - #68
Pruna là một framework tối ưu hóa mô hình được xây dựng cho các nhà phát triển, giúp bạn cung cấp các mô hình nhanh hơn, hiệu quả hơn với chi phí tối thiểu.
★ 1.274+1Thay đổi số sao trong 7 ngày qua - #69
Máy chủ nhận diện giọng nói WebSocket, gRPC và WebRTC dựa trên các thư viện Vosk và Kaldi
★ 1.262+1Thay đổi số sao trong 7 ngày qua - #70
Tinh chỉnh mô hình nhận dạng giọng nói Whisper để hỗ trợ huấn luyện không có dữ liệu dấu thời gian, huấn luyện có dữ liệu dấu thời gian và huấn luyện không có dữ liệu giọng nói. Tăng tốc suy luận và hỗ trợ triển khai Web, Windows desktop và Android
★ 1.222-1Thay đổi số sao trong 7 ngày qua - #71★ 1.212-1Thay đổi số sao trong 7 ngày qua
- #72
💁 Kho tàng tuyệt vời các mô hình Transformers cho Xử lý ngôn ngữ tự nhiên, bao gồm các bài báo, video, blog, kho lưu trữ chính thức cùng với các Colab Notebook. 🛫☑️
★ 1.179+0Thay đổi số sao trong 7 ngày qua - #73
Phòng thí nghiệm thực tế để xây dựng, kiểm thử và đánh giá các ứng dụng sử dụng framework Foundation Models của Apple.
★ 1.178+1Thay đổi số sao trong 7 ngày qua - #74
Nhật ký riêng tư với đội ngũ trợ lý AI cá nhân. Các agent đọc những gì bạn ghi lại và đề xuất hành động tiếp theo — bạn phê duyệt các thay đổi. Đồng bộ hóa mã hóa end-to-end giữa các thiết bị của bạn — máy chủ chỉ thấy bản mã. AI cục bộ tùy chọn.
★ 1.168+3Thay đổi số sao trong 7 ngày qua - #75
Bộ công cụ giọng nói AI dành cho Apple Silicon — ASR, TTS, chuyển đổi giọng nói thành giọng nói, VAD và phân đoạn người nói được hỗ trợ bởi MLX và CoreML
★ 1.161+4Thay đổi số sao trong 7 ngày qua - #76
Irina - trợ lý giọng nói tiếng Nga hoạt động ngoại tuyến. Hỗ trợ kỹ năng thông qua các plugin.
★ 1.153+0Thay đổi số sao trong 7 ngày qua - #77★ 1.149-1Thay đổi số sao trong 7 ngày qua
- #78
[Không chính thức] Triển khai bằng PyTorch của "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)
★ 1.132+1Thay đổi số sao trong 7 ngày qua - #79
Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho Cordova
★ 1.132+0Thay đổi số sao trong 7 ngày qua - #80
SGLang-Omni hỗ trợ phục vụ hiệu suất cao cho TTS, ASR, các mô hình giọng nói và đa năng (omni).
★ 1.118+143Thay đổi số sao trong 7 ngày qua - #81
AI Vtuber để phát trực tuyến trên Youtube/Twitch
★ 1.116+2Thay đổi số sao trong 7 ngày qua - #82
Ứng dụng iOS mã nguồn mở giúp việc chuyển đổi giọng nói thành văn bản chất lượng cao trở nên dễ tiếp cận hơn trên thiết bị di động.
★ 1.102+8Thay đổi số sao trong 7 ngày qua - #83
💬📝 Một ứng dụng chính tả nhỏ sử dụng mô hình nhận dạng giọng nói Whisper của OpenAI.
★ 1.100+2Thay đổi số sao trong 7 ngày qua - #84
Server nhận diện giọng nói song công toàn phần thời gian thực, dựa trên bộ công cụ Kaldi và framework GStreamer.
★ 1.094+1Thay đổi số sao trong 7 ngày qua - #85
Nhận diện giọng nói ngoại tuyến cho Android với thư viện Vosk.
★ 1.056+0Thay đổi số sao trong 7 ngày qua - #86★ 1.040+1Thay đổi số sao trong 7 ngày qua
- #87
:zap: TensorFlowASR: Nhận dạng giọng nói tự động gần đạt mức tiên tiến nhất trong Tensorflow 2. Hỗ trợ các ngôn ngữ có thể sử dụng ký tự hoặc từ phụ
★ 1.010+0Thay đổi số sao trong 7 ngày qua - #88
Công cụ chỉnh sửa sử dụng AI để chuyển đổi giọng nói thành văn bản, hiểu nội dung và tìm kiếm bất kỳ thứ gì trong cảnh quay của bạn, tích hợp với ChatGPT và các mô hình AI khác
★ 1.009+2Thay đổi số sao trong 7 ngày qua - #89★ 984+4Thay đổi số sao trong 7 ngày qua
- #90
Chuyển đổi âm thanh thành văn bản gần như thời gian thực sử dụng Whisper tự lưu trữ và WebSocket bằng Python/JS
★ 960+1Thay đổi số sao trong 7 ngày qua