asr
Các kho mã nguồn mở đang theo dõi được gắn thẻ asr, sắp xếp theo số sao.
- #31
Nhận dạng giọng nói thời gian thực và phát hiện hoạt động giọng nói (VAD) sử dụng Kaldi thế hệ mới với ncnn mà không cần kết nối Internet. Hỗ trợ iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, v.v.
★ 1.777-1Thay đổi số sao trong 7 ngày qua - #32
Bailing là một robot trò chuyện bằng giọng nói tương tự GPT-4o, được triển khai thông qua ASR+LLM+TTS, tích hợp các mô hình ngôn ngữ lớn xuất sắc như DeepSeek R1, kết nối với openClaw, là trợ lý giọng nói cá nhân thực thụ với độ trễ thấp tới 800ms, có thể chạy trên các cấu hình thấp như Mac và hỗ trợ ngắt lời
★ 1.759+2Thay đổi số sao trong 7 ngày qua - #33
Ứng dụng Speech Note trên Linux. Ghi chú, đọc và dịch với tính năng Chuyển giọng nói thành văn bản, Chuyển văn bản thành giọng nói và Dịch máy ngoại tuyến.
★ 1.622+8Thay đổi số sao trong 7 ngày qua - #34
Phân tích video sử dụng LLM, Thị giác máy tính và Nhận dạng giọng nói tự động
★ 1.570+8Thay đổi số sao trong 7 ngày qua - #35
🎙️ Ứng dụng đọc chính tả AI - Mã nguồn mở và ưu tiên cục bộ ⚡ Gõ nhanh hơn 3 lần, không cần bàn phím. 🆓 Được hỗ trợ bởi các mô hình mã nguồn mở, hoạt động ngoại tuyến, nhanh chóng và chính xác.
★ 1.520+8Thay đổi số sao trong 7 ngày qua - #36
Dòng mô hình ASR dựa trên LLM mã nguồn mở cho tiếng Trung, phương ngữ, tiếng địa phương và giọng nói đa ngôn ngữ, với các thời gian chạy FunASR, vLLM, streaming và llama.cpp.
★ 1.512+10Thay đổi số sao trong 7 ngày qua - #37
🍦 Speech-AI-Forge là một dự án phát triển xung quanh mô hình tạo TTS, tích hợp API Server và WebUI dựa trên Gradio.
★ 1.418+0Thay đổi số sao trong 7 ngày qua - #38
Dịch đồng bộ cho video. Lồng tiếng video
★ 1.413+2Thay đổi số sao trong 7 ngày qua - #39
Bản ghi âm có thể điều khiển. Nguyên văn (mọi từ đệm, khoảng dừng, lắp bắp, âm thanh phát ra), hoặc theo ý định (ý người nói muốn diễn đạt, được tối ưu hóa cho khả năng đọc) với dấu thời gian ở cấp độ từ.
★ 1.371+13Thay đổi số sao trong 7 ngày qua - #40★ 1.347+6Thay đổi số sao trong 7 ngày qua
- #41
Người ảo tương tác giọng nói thời gian thực, có thể tùy chỉnh ngoại hình và giọng nói, hỗ trợ nhân bản giọng nói, độ trễ phản hồi thấp tới 3 giây.
★ 1.303-1Thay đổi số sao trong 7 ngày qua - #42
StreamSpeech là một mô hình liền mạch "tất cả trong một" dành cho nhận dạng giọng nói ngoại tuyến và đồng thời, dịch giọng nói và tổng hợp giọng nói.
★ 1.288+0Thay đổi số sao trong 7 ngày qua - #43
Máy chủ nhận diện giọng nói WebSocket, gRPC và WebRTC dựa trên các thư viện Vosk và Kaldi
★ 1.262+1Thay đổi số sao trong 7 ngày qua - #44
Tinh chỉnh mô hình nhận dạng giọng nói Whisper để hỗ trợ huấn luyện không có dữ liệu dấu thời gian, huấn luyện có dữ liệu dấu thời gian và huấn luyện không có dữ liệu giọng nói. Tăng tốc suy luận và hỗ trợ triển khai Web, Windows desktop và Android
★ 1.222-1Thay đổi số sao trong 7 ngày qua - #45
Bộ công cụ giọng nói AI dành cho Apple Silicon — ASR, TTS, chuyển đổi giọng nói thành giọng nói, VAD và phân đoạn người nói được hỗ trợ bởi MLX và CoreML
★ 1.161+4Thay đổi số sao trong 7 ngày qua - #46
Nền tảng ASR đầu tiên được xây dựng cho thế giới thực - 7 điều kiện âm học nguyên tử, 54 kịch bản phức hợp, 2,6 triệu mẫu, và đạt mức tăng trưởng lên tới ~30% so với SOTA trong các trường hợp mô hình khác thất bại. Bạn sẽ quay lại với MEGA-ASR sau khi các giải pháp khác không hoạt động hiệu quả trong thực tế.
★ 1.136+3Thay đổi số sao trong 7 ngày qua - #47
[Không chính thức] Triển khai bằng PyTorch của "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)
★ 1.132+1Thay đổi số sao trong 7 ngày qua - #48
SGLang-Omni hỗ trợ phục vụ hiệu suất cao cho TTS, ASR, các mô hình giọng nói và đa năng (omni).
★ 1.118+143Thay đổi số sao trong 7 ngày qua - #49★ 1.057+8Thay đổi số sao trong 7 ngày qua
- #50
Nhận diện giọng nói ngoại tuyến cho Android với thư viện Vosk.
★ 1.056+0Thay đổi số sao trong 7 ngày qua - #51
Công cụ chuyển đổi giọng nói thành văn bản hoàn toàn nội bộ, bảo mật và đa nền tảng với tính năng hậu xử lý bằng LLM
★ 1.053+15Thay đổi số sao trong 7 ngày qua - #52★ 1.040+1Thay đổi số sao trong 7 ngày qua
- #53★ 984+4Thay đổi số sao trong 7 ngày qua
- #54★ 939+0Thay đổi số sao trong 7 ngày qua
- #55
VocoType là một công cụ nhập liệu bằng giọng nói bảo mật và riêng tư chạy hoàn toàn trên thiết bị cục bộ. Cho phép chuyển đổi giọng nói thành văn bản theo thời gian thực và tự động nhập vào ứng dụng hiện tại thông qua phím tắt. Hỗ trợ tính năng chuyển giọng nói thành văn bản MCP, tối ưu hóa văn bản bằng AI, từ điển thay thế tùy chỉnh, chuyển đổi bản ghi âm và video thành văn bản, giúp việc nhập liệu bằng giọng nói hiệu quả và an toàn hơn.
★ 928+9Thay đổi số sao trong 7 ngày qua - #56
Dự án này cung cấp một API hỗ trợ quyền truy cập ở cấp độ người dùng để chuyển đổi giọng nói thành văn bản bằng mô hình Whisper ASR đã qua tinh chỉnh và xử lý.
★ 914+0Thay đổi số sao trong 7 ngày qua - #57
Bộ công cụ thuật toán AI ngoại tuyến miễn phí bằng Java, hỗ trợ nhận dạng khuôn mặt, phát hiện liveness, nhận dạng biểu cảm, phát hiện đối tượng, phân đoạn thực thể, phát hiện người đi bộ, nhận dạng văn bản OCR, nhận dạng biển số xe, nhận dạng bảng biểu, ASR+TTS, dịch máy và các chức năng khác, chỉ cần thêm phụ thuộc Maven là có thể sử dụng. Hỗ trợ PyTorch, Tensorflow, đã tích hợp các mô hình phổ biến như Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5), Whisper
★ 908+3Thay đổi số sao trong 7 ngày qua - #58
Bộ công cụ thân thiện với người dùng để nhận dạng/chuyển đổi/ghi âm giọng nói, v.v.
★ 873+0Thay đổi số sao trong 7 ngày qua - #59
Triển khai nhận dạng giọng nói tiếng Trung đầu cuối dựa trên PaddlePaddle, từ cơ bản đến thực tế, với các ví dụ nhập môn đơn giản và dự án doanh nghiệp thiết thực. Hỗ trợ các mô hình phổ biến hiện nay như DeepSpeech2, Conformer và Squeezeformer.
★ 870-1Thay đổi số sao trong 7 ngày qua - #60
GLM-ASR-Nano: Một mô hình nhận dạng giọng nói mã nguồn mở mạnh mẽ với 1,5 tỷ tham số
★ 854+3Thay đổi số sao trong 7 ngày qua