asr
Các kho mã nguồn mở đang theo dõi được gắn thẻ asr, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng asr trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ asr.
- #1
Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.
★ 2.214 - #2
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501 - #3
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 327
- #1
WhisperX: Nhận diện giọng nói tự động với mốc thời gian cấp độ từ (và phân đoạn người nói)
★ 23.864+61Thay đổi số sao trong 7 ngày qua - #2
Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.
★ 20.136+64Thay đổi số sao trong 7 ngày qua - #3
Một framework AI tạo sinh có khả năng mở rộng được xây dựng cho các nhà nghiên cứu và lập trình viên làm việc về Mô hình Ngôn ngữ Lớn, Đa phương thức và AI Giọng nói (Nhận dạng Giọng nói Tự động và Chuyển văn bản thành giọng nói)
★ 18.379+21Thay đổi số sao trong 7 ngày qua - #4
API nhận diện giọng nói ngoại tuyến cho Android, iOS, Raspberry Pi và máy chủ với Python, Java, C# và Node
★ 15.101+17Thay đổi số sao trong 7 ngày qua - #5
Chuyển đổi giọng nói thành văn bản, văn bản thành giọng nói, phân đoạn người nói, cải thiện giọng nói, tách nguồn âm thanh và VAD sử dụng Kaldi thế hệ mới với onnxruntime không cần kết nối Internet. Hỗ trợ hệ thống nhúng, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, máy chủ x86_64, websocket server/client, hỗ trợ 12 ngôn ngữ lập trình
★ 14.575+95Thay đổi số sao trong 7 ngày qua - #6
Bộ công cụ xử lý giọng nói dễ sử dụng, bao gồm mô hình tự giám sát (Self-Supervised Learning), SOTA/Streaming ASR có dấu câu, Streaming TTS tích hợp frontend văn bản, Hệ thống xác thực người nói, Dịch giọng nói đầu cuối và Nhận diện từ khóa. Đạt giải Demo xuất sắc nhất tại NAACL 2022.
★ 12.676+5Thay đổi số sao trong 7 ngày qua - #7
Bộ công cụ nhận diện giọng nói dựa trên PyTorch
★ 11.802+10Thay đổi số sao trong 7 ngày qua - #8
Mô hình SenseVoiceSmall mã nguồn mở cho ASR tiếng Quan Thoại, Quảng Đông, Anh, Nhật và Hàn, nhận diện ngôn ngữ, cảm xúc và sự kiện âm thanh.
★ 9.209+37Thay đổi số sao trong 7 ngày qua - #9
Đây là Python API cho phép bạn lấy bản ghi / phụ đề cho một video YouTube bất kỳ. Nó cũng hoạt động với phụ đề được tạo tự động và không yêu cầu khóa API hay trình duyệt headless như các giải pháp dựa trên Selenium khác!
★ 8.143+14Thay đổi số sao trong 7 ngày qua - #10
🤖 wukong-robot là một dự án chatbot/loa thông minh bằng giọng nói tiếng Trung đơn giản, linh hoạt và thanh lịch, hỗ trợ khả năng trò chuyện nhiều lượt với ChatGPT, và có thể là dự án loa thông minh mã nguồn mở đầu tiên hỗ trợ tương tác não-máy tính.
★ 7.126+2Thay đổi số sao trong 7 ngày qua - #11
Công cụ chuyển biên video, tạo phụ đề và cắt ghép video hỗ trợ bởi LLM, hoạt động dựa trên FunASR với giao diện Gradio cục bộ.
★ 6.210+13Thay đổi số sao trong 7 ngày qua - #12
Nhận dạng giọng nói tự động kết hợp phân đoạn người nói dựa trên OpenAI Whisper
★ 5.634+1Thay đổi số sao trong 7 ngày qua - #13
Thư viện ghi âm HTML5 JS hỗ trợ các định dạng mp3, wav, ogg, webm, amr, g711a, g711u; hỗ trợ PC, một số trình duyệt web trên Android và iOS, Hybrid App (cung cấp mã nguồn App Android và iOS), WeChat; cung cấp tính năng chuyển đổi giọng nói thành văn bản ASR, mẫu trò chuyện gọi thoại H5 và mã hóa/giải mã DTMF
★ 5.631+3Thay đổi số sao trong 7 ngày qua - #14
Bộ công cụ nhận dạng giọng nói đầu-cuối (End-to-End) ưu tiên môi trường production và sẵn sàng cho production
★ 5.229+1Thay đổi số sao trong 7 ngày qua - #15
Trình phát đa phương tiện hỗ trợ học ngoại ngữ với phụ đề kép, phụ đề tạo bởi AI, dịch thời gian thực và nhiều tính năng khác!
★ 4.070+12Thay đổi số sao trong 7 ngày qua - #16
Streamer-Sales: Mô hình ngôn ngữ lớn (LLM) dành cho streamer bán hàng 🛒🎁, có khả năng giải thích sản phẩm dựa trên các đặc điểm đã cho nhằm kích thích ý định mua hàng của người dùng. 🚀⭐ Bao gồm quy trình tạo dữ liệu chi tiết ❗ 📦 Tích hợp tăng tốc suy luận LMDeploy 🚀, RAG (Tạo tăng cường truy xuất) 📚, TTS (Chuyển văn bản thành giọng nói) 🔊, tạo người ảo 🦸, Agent sử dụng web để tra cứu thông tin thời gian thực 🌐, ASR (Nhận diện giọng nói thành văn bản) 🎙️, frontend xây dựng bằng hệ sinh thái Vue 🍍, backend xây dựng bằng FastAPI 🗝️, đóng gói và triển khai bằng Docker-compose 🐋
★ 3.764+1Thay đổi số sao trong 7 ngày qua - #17
Giữ phím, nói, thả ra — văn bản được AI trau chuốt sẽ xuất hiện tại con trỏ của bạn trong bất kỳ ứng dụng nào. Công cụ nhập giọng nói mã nguồn mở cho macOS & Windows.
★ 3.403+44Thay đổi số sao trong 7 ngày qua - #18
API dịch vụ web ASR OpenAI Whisper
★ 3.328+2Thay đổi số sao trong 7 ngày qua - #19
Các tệp thực thi độc lập của Whisper và Faster-Whisper dành cho những ai không muốn bận tâm về Python.
★ 3.171+2Thay đổi số sao trong 7 ngày qua - #20
[AutoArk] GPA (General Purpose Audio) có thể thực hiện ASR, TTS và chuyển đổi giọng nói chỉ với một mô hình nhỏ gọn!
★ 3.061+164Thay đổi số sao trong 7 ngày qua - #21
Giao diện đồ họa cho faster_whisper sử dụng PySide6
★ 2.995+4Thay đổi số sao trong 7 ngày qua - #22★ 2.864+0Thay đổi số sao trong 7 ngày qua
- #23
Nhận dạng Tự động Tiếng nói Đa ngôn ngữ với mốc thời gian cấp độ từ và độ tin cậy
★ 2.842+1Thay đổi số sao trong 7 ngày qua - #24
Các mô hình âm thanh CoreML tiên tiến trong ứng dụng của bạn — chuyển văn bản thành giọng nói, chuyển giọng nói thành văn bản, phát hiện hoạt động giọng nói và phân đoạn người nói. Viết bằng Swift, cung cấp bởi các mã nguồn mở SOTA.
★ 2.723+13Thay đổi số sao trong 7 ngày qua - #25
🐸STT - Bộ công cụ học sâu cho Speech-to-Text. Việc huấn luyện và triển khai các mô hình STT chưa bao giờ dễ dàng đến thế.
★ 2.606+1Thay đổi số sao trong 7 ngày qua - #26
Trích xuất nhanh nội dung âm thanh và video, tổng hợp thành ghi chú markdown có cấu trúc
★ 2.483+7Thay đổi số sao trong 7 ngày qua - #27
Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.
★ 2.214+115Thay đổi số sao trong 7 ngày qua - #28
Các mô hình ASR cấp công nghiệp mã nguồn mở hỗ trợ tiếng Quan Thoại, các phương ngữ tiếng Trung và tiếng Anh, đạt SOTA mới trên các benchmark ASR tiếng Quan Thoại công khai, đồng thời cung cấp khả năng nhận dạng lời bài hát xuất sắc.
★ 1.975+2Thay đổi số sao trong 7 ngày qua - #29
Suy luận chuyển giọng nói thành văn bản bằng ggml cho hơn 16 họ mô hình
★ 1.872+19Thay đổi số sao trong 7 ngày qua - #30
Khung AI+IoT thế hệ mới cho T2/T3/T5AI/ESP32 và nhiều hơn nữa – Tích hợp phần cứng IoT và AI Agent nhanh chóng
★ 1.816+5Thay đổi số sao trong 7 ngày qua