funasr
Các kho mã nguồn mở đang theo dõi được gắn thẻ funasr, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng funasr trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ funasr.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.
★ 20.136+64Thay đổi số sao trong 7 ngày qua - #2
Mô hình SenseVoiceSmall mã nguồn mở cho ASR tiếng Quan Thoại, Quảng Đông, Anh, Nhật và Hàn, nhận diện ngôn ngữ, cảm xúc và sự kiện âm thanh.
★ 9.209+37Thay đổi số sao trong 7 ngày qua - #3
Công cụ chuyển biên video, tạo phụ đề và cắt ghép video hỗ trợ bởi LLM, hoạt động dựa trên FunASR với giao diện Gradio cục bộ.
★ 6.210+13Thay đổi số sao trong 7 ngày qua - #4
Công cụ máy tính để bàn mã nguồn mở, miễn phí tất cả trong một dành cho chuyển đổi video thành phụ đề, dịch phụ đề, lồng tiếng AI và nhân bản giọng nói, nhúng phụ đề. Dựa trên các mô hình cục bộ như Whisper / FunASR để chuyển giọng nói thành văn bản ngoại tuyến, xử lý hàng loạt + tăng tốc GPU toàn nền tảng, chéo Windows / macOS / Linux.
★ 4.863+48Thay đổi số sao trong 7 ngày qua - #5
Trích xuất nhanh nội dung âm thanh và video, tổng hợp thành ghi chú markdown có cấu trúc
★ 2.483+7Thay đổi số sao trong 7 ngày qua - #6
Giải pháp thay thế Wispr Flow mã nguồn mở miễn phí | Quy trình làm việc bằng giọng nói trên máy tính để bàn tiếng Trung thế hệ tiếp theo tích hợp mô hình cục bộ FunASR và mô hình ngôn ngữ lớn có thể cấu hình
★ 2.278+5Thay đổi số sao trong 7 ngày qua - #7
Bailing là một robot trò chuyện bằng giọng nói tương tự GPT-4o, được triển khai thông qua ASR+LLM+TTS, tích hợp các mô hình ngôn ngữ lớn xuất sắc như DeepSeek R1, kết nối với openClaw, là trợ lý giọng nói cá nhân thực thụ với độ trễ thấp tới 800ms, có thể chạy trên các cấu hình thấp như Mac và hỗ trợ ngắt lời
★ 1.759+2Thay đổi số sao trong 7 ngày qua - #8
Dòng mô hình ASR dựa trên LLM mã nguồn mở cho tiếng Trung, phương ngữ, tiếng địa phương và giọng nói đa ngôn ngữ, với các thời gian chạy FunASR, vLLM, streaming và llama.cpp.
★ 1.512+10Thay đổi số sao trong 7 ngày qua - #9
MTools là một ứng dụng máyδ để bàn đa chức năng mạnh mẽ, tích hợp các công cụ xử lý âm thanh/video, chỉnh sửa hình ảnh, thao tác văn bản và mã hóa, với các tính năng nâng cao bằng AI tích hợp. Được thiết kế để đơn giản hóa quy trình làm việc và nâng cao năng suất của bạn.
★ 1.305+5Thay đổi số sao trong 7 ngày qua - #10
VocoType là một công cụ nhập liệu bằng giọng nói bảo mật và riêng tư chạy hoàn toàn trên thiết bị cục bộ. Cho phép chuyển đổi giọng nói thành văn bản theo thời gian thực và tự động nhập vào ứng dụng hiện tại thông qua phím tắt. Hỗ trợ tính năng chuyển giọng nói thành văn bản MCP, tối ưu hóa văn bản bằng AI, từ điển thay thế tùy chỉnh, chuyển đổi bản ghi âm và video thành văn bản, giúp việc nhập liệu bằng giọng nói hiệu quả và an toàn hơn.
★ 928+9Thay đổi số sao trong 7 ngày qua - #11
Dịch âm thanh thời gian thực, thu âm thanh hệ thống và micro, chạy ASR (Whisper/SenseVoice), dịch qua API LLM với hiển thị luồng. Phù hợp cho VTuber, người livestream và xem nội dung nước ngoài.
★ 626+38Thay đổi số sao trong 7 ngày qua