speech-to-text
Các kho mã nguồn mở đang theo dõi được gắn thẻ speech-to-text, sắp xếp theo số sao.
- #31
Nền tảng voice AI mã nguồn mở. Giải pháp thay thế tự lưu trữ cho Vapi và Retell. On Prem, BYOK qua Speech to Speech hoặc LLM/STT/TTS, tích hợp trình xây dựng quy trình trực quan, hỗ trợ MCP native và điện thoại.
★ 5.568+0Thay đổi số sao trong 7 ngày qua - #32
Công cụ bản địa hóa video AI mã nguồn mở: tự động tải xuống video YouTube/Bilibili, nhận diện và dịch phụ đề, lồng tiếng nhân bản giọng nói, trộn âm thanh và chèn phụ đề.
★ 5.404+0Thay đổi số sao trong 7 ngày qua - #33
Công cụ nhận diện giọng nói thành văn bản / Công cụ chuyển đổi âm thanh và video cục bộ chạy ngoại tuyến thành phụ kiện, hỗ trợ xuất định dạng json, phụ đề srt và văn bản thuần túy
★ 4.780+0Thay đổi số sao trong 7 ngày qua - #34
Bản cài đặt JAX của mô hình Whisper từ OpenAI giúp tăng tốc lên tới 70 lần trên TPU.
★ 4.679+0Thay đổi số sao trong 7 ngày qua - #35★ 4.624+0Thay đổi số sao trong 7 ngày qua
- #36
Tạo phụ đề trên thiết bị kết nối trực tiếp với DaVinci Resolve, Premiere và After Effects.
★ 4.122+0Thay đổi số sao trong 7 ngày qua - #37
Công cụ dịch âm thanh/giọng nói thời gian thực nhẹ và mạnh mẽ dựa trên Windows LiveCaptions.
★ 3.637+0Thay đổi số sao trong 7 ngày qua - #38
Giữ phím, nói, thả ra — văn bản được AI trau chuốt sẽ xuất hiện tại con trỏ của bạn trong bất kỳ ứng dụng nào. Công cụ nhập giọng nói mã nguồn mở cho macOS & Windows.
★ 3.403+0Thay đổi số sao trong 7 ngày qua - #39
API dịch vụ web ASR OpenAI Whisper
★ 3.328+0Thay đổi số sao trong 7 ngày qua - #40
Các tệp thực thi độc lập của Whisper và Faster-Whisper dành cho những ai không muốn bận tâm về Python.
★ 3.171+0Thay đổi số sao trong 7 ngày qua - #41
LLaMA-Omni là mô hình tương tác giọng nói đầu cuối có độ trễ thấp và chất lượng cao được xây dựng trên nền tảng Llama-3.1-8B-Instruct, nhằm đạt được khả năng giọng nói ở cấp độ GPT-4o.
★ 3.147+0Thay đổi số sao trong 7 ngày qua - #42
Giải pháp thay thế trợ lý giọng nói cạnh tranh với Amazon Echo/Google Home, mã nguồn mở, chạy cục bộ và tự lưu trữ
★ 3.101+0Thay đổi số sao trong 7 ngày qua - #43
Chuyển đổi mọi âm thanh thành văn bản, dịch và chỉnh sửa phụ đề hoàn toàn ngoại tuyến với giao diện web UI. Được hỗ trợ bởi các mô hình whisper!
★ 3.068+0Thay đổi số sao trong 7 ngày qua - #44★ 2.864+0Thay đổi số sao trong 7 ngày qua
- #45
Nhận dạng Tự động Tiếng nói Đa ngôn ngữ với mốc thời gian cấp độ từ và độ tin cậy
★ 2.842+0Thay đổi số sao trong 7 ngày qua - #46
API phiên âm cuộc họp mã nguồn mở cho Google Meet, Microsoft Teams & Zoom. Bot tự join, bản ghi WebSocket thời gian thực, máy chủ MCP cho AI agent. Tự host hoặc sử dụng dịch vụ SaaS.
★ 2.741+0Thay đổi số sao trong 7 ngày qua - #47
Các mô hình âm thanh CoreML tiên tiến trong ứng dụng của bạn — chuyển văn bản thành giọng nói, chuyển giọng nói thành văn bản, phát hiện hoạt động giọng nói và phân đoạn người nói. Viết bằng Swift, cung cấp bởi các mã nguồn mở SOTA.
★ 2.723+0Thay đổi số sao trong 7 ngày qua - #48
Giải pháp thay thế mã nguồn mở cho Cluely - Trợ lý AI siêu nhanh, ưu tiên quyền riêng tư, hoạt động mượt mà trong các cuộc họp, phỏng vấn và trò chuyện mà không ai biết. Được xây dựng bằng Tauri cho hiệu năng nguyên bản, dung lượng chỉ 10MB. Hoàn toàn không thể bị phát hiện trong cuộc gọi video, chia sẻ màn hình và bản ghi.
★ 2.619+0Thay đổi số sao trong 7 ngày qua - #49
🐸STT - Bộ công cụ học sâu cho Speech-to-Text. Việc huấn luyện và triển khai các mô hình STT chưa bao giờ dễ dàng đến thế.
★ 2.606+0Thay đổi số sao trong 7 ngày qua - #50★ 2.537+0Thay đổi số sao trong 7 ngày qua
- #51
🔊 Danh sách tổng hợp tuyệt vời cho Whisper — hệ thống nhận dạng giọng nói tích hợp AI mã nguồn mở do OpenAI phát triển
★ 2.375+0Thay đổi số sao trong 7 ngày qua - #52
Ghi màn hình, xuất bản bản demo. Miễn phí và mã nguồn mở, tăng tốc GPU, không watermark, không phí đăng ký. Windows, macOS, Linux. Được duy trì phát triển tích cực.
★ 2.287+0Thay đổi số sao trong 7 ngày qua - #53
Giải pháp thay thế Wispr Flow mã nguồn mở miễn phí | Quy trình làm việc bằng giọng nói trên máy tính để bàn tiếng Trung thế hệ tiếp theo tích hợp mô hình cục bộ FunASR và mô hình ngôn ngữ lớn có thể cấu hình
★ 2.278+0Thay đổi số sao trong 7 ngày qua - #54
Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.
★ 2.214+0Thay đổi số sao trong 7 ngày qua - #55
Công cụ tạo phụ đề ASR/STT. Sử dụng Qwen3-ASR, LLM cục bộ, Whisper, TEN-VAD. Kháng nhiễu hiệu quả cho JAV
★ 2.196+0Thay đổi số sao trong 7 ngày qua - #56
🎙 Nhận dạng giọng nói sử dụng framework học sâu tensorflow, mạng thần kinh chuỗi-sang-chuỗi (sequence-to-sequence)
★ 2.173+0Thay đổi số sao trong 7 ngày qua - #57★ 2.170+0Thay đổi số sao trong 7 ngày qua
- #58★ 2.046+0Thay đổi số sao trong 7 ngày qua
- #59
Trình chỉnh sửa âm thanh lời nói tích hợp tự động chuyển âm thanh thành văn bản.
★ 1.892+0Thay đổi số sao trong 7 ngày qua - #60
Suy luận chuyển giọng nói thành văn bản bằng ggml cho hơn 16 họ mô hình
★ 1.872+0Thay đổi số sao trong 7 ngày qua