speech-to-text
Các kho mã nguồn mở đang theo dõi được gắn thẻ speech-to-text, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng speech-to-text trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ speech-to-text.
- #1
Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.
★ 2.128 - #2
Studio AI cục bộ không kiểm duyệt dành cho Windows, Linux và macOS. Giao diện đồ họa thiết lập bằng không cho Tạo ảnh, GGUF LLM, Chuyển văn bản thành giọng nói & Chuyển giọng nói thành văn bản
★ 1.048 - #3
Công cụ đọc chính tả bằng giọng nói cục bộ, miễn phí, tốc độ cao cho macOS với khả năng chuyển đổi văn bản trên thiết bị
★ 531 - #4
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 494 - #5
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 460
- #1
Chuyển đổi mô hình Whisper của OpenAI sang C/C++
★ 53.286+193Thay đổi số sao trong 7 ngày qua - #2
Ứng dụng chuyển đổi giọng nói thành văn bản miễn phí, mã nguồn mở và có thể mở rộng, hoạt động hoàn toàn ngoại tuyến.
★ 30.636+554Thay đổi số sao trong 7 ngày qua - #3
Trợ lý họp AI ưu tiên quyền riêng tư với bản ghi âm trực tiếp Parakeet/Whisper nhanh hơn 4 lần, phân đoạn người nói và tóm tắt bằng Ollama được xây dựng bằng Rust. Xử lý cục bộ 100%, không cần đám mây.
★ 30.057+325Thay đổi số sao trong 7 ngày qua - #4★ 25.746+78Thay đổi số sao trong 7 ngày qua
- #5
Chuyển đổi giọng nói thành văn bản Whisper nhanh hơn với CTranslate2
★ 25.135+108Thay đổi số sao trong 7 ngày qua - #6
WhisperX: Nhận diện giọng nói tự động với mốc thời gian cấp độ từ (và phân đoạn người nói)
★ 23.803+117Thay đổi số sao trong 7 ngày qua - #7
YC (S26) | Open Computer History | Ghi lại màn hình của bạn liên tục trên máy cục bộ và cung cấp ngữ cảnh cho các agent của bạn (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21.296+133Thay đổi số sao trong 7 ngày qua - #8
Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.
★ 20.072+108Thay đổi số sao trong 7 ngày qua - #9
Dịch video từ ngôn ngữ này sang ngôn ngữ khác và chèn lồng tiếng & phụ đề.
★ 18.833+65Thay đổi số sao trong 7 ngày qua - #10★ 17.475+22Thay đổi số sao trong 7 ngày qua
- #11★ 15.471+7Thay đổi số sao trong 7 ngày qua
- #12
API nhận diện giọng nói ngoại tuyến cho Android, iOS, Raspberry Pi và máy chủ với Python, Java, C# và Node
★ 15.084+17Thay đổi số sao trong 7 ngày qua - #13
Chuyển đổi giọng nói thành văn bản, văn bản thành giọng nói, phân đoạn người nói, cải thiện giọng nói, tách nguồn âm thanh và VAD sử dụng Kaldi thế hệ mới với onnxruntime không cần kết nối Internet. Hỗ trợ hệ thống nhúng, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, máy chủ x86_64, websocket server/client, hỗ trợ 12 ngôn ngữ lập trình
★ 14.480+169Thay đổi số sao trong 7 ngày qua - #14
Xây dựng các tác nhân giọng nói với các mô hình mã nguồn mở
★ 12.933+180Thay đổi số sao trong 7 ngày qua - #15
Gradio WebUI dành cho người sáng tạo và nhà phát triển, tích hợp các tính năng TTS chính (Edge-TTS, kokoro) và nhân bản giọng nói zero-shot (E2 & F5-TTS, CosyVoice), xử lý âm thanh Whisper, tải xuống YouTube, tách giọng hát Demucs và dịch đa ngôn ngữ.
★ 12.676+100Thay đổi số sao trong 7 ngày qua - #16
VoiceStudio là giải pháp thay thế ElevenLabs mã nguồn mở, chạy hoàn toàn cục bộ — nhân bản giọng nói, thiết kế giọng nói, lồng tiếng video, đọc chính tả, chuyển đổi văn bản thành giọng nói và tạo sách nói bằng 646 ngôn ngữ.
★ 11.955+853Thay đổi số sao trong 7 ngày qua - #17
Bộ công cụ nhận diện giọng nói dựa trên PyTorch
★ 11.792+22Thay đổi số sao trong 7 ngày qua - #18
Chuyển đổi giọng nói thành văn bản cục bộ, thời gian thực với ASR phát trực tuyến, phân đoạn người nói, dịch thuật và các API tương thích với OpenAI/Deepgram.
★ 10.974+75Thay đổi số sao trong 7 ngày qua - #19
Thư viện chuyển đổi giọng nói thành văn bản mạnh mẽ, hiệu quả, độ trễ thấp với khả năng phát hiện hoạt động giọng nói nâng cao, kích hoạt bằng từ khóa và phiên dịch tức thì.
★ 10.090+20Thay đổi số sao trong 7 ngày qua - #20
Mô hình SenseVoiceSmall mã nguồn mở cho ASR tiếng Quan Thoại, Quảng Đông, Anh, Nhật và Hàn, nhận diện ngôn ngữ, cảm xúc và sự kiện âm thanh.
★ 9.172+51Thay đổi số sao trong 7 ngày qua - #21
Mô-đun nhận dạng giọng nói cho Python, hỗ trợ nhiều engine và API, trực tuyến và ngoại tuyến.
★ 8.987+2Thay đổi số sao trong 7 ngày qua - #22
Hệ thống nhận dạng giọng nói tiếng Trung dựa trên Deep Learning
★ 8.386+5Thay đổi số sao trong 7 ngày qua - #23
Một thư viện chuyển đổi văn bản thành giọng nói (TTS), giọng nói thành văn bản (STT) và giọng nói thành giọng nói (STS) được xây dựng trên framework MLX của Apple, cung cấp khả năng phân tích giọng nói hiệu quả trên Apple Silicon.
★ 7.803+31Thay đổi số sao trong 7 ngày qua - #24★ 6.816+1Thay đổi số sao trong 7 ngày qua
- #25
AI giọng nói trên thiết bị dành cho Apple Silicon
★ 6.345+11Thay đổi số sao trong 7 ngày qua - #26
Công cụ chuyển biên video, tạo phụ đề và cắt ghép video hỗ trợ bởi LLM, hoạt động dựa trên FunASR với giao diện Gradio cục bộ.
★ 6.197+25Thay đổi số sao trong 7 ngày qua - #27
Silero Models: các mô hình chuyển văn bản thành giọng nói được huấn luyện trước trở nên vô cùng đơn giản
★ 6.085+11Thay đổi số sao trong 7 ngày qua - #28
Ứng dụng đọc chính tả giọng nói thành văn bản hỗ trợ mô hình cục bộ (Nvidia Parakeet/Whisper) và đám mây (BYOK). Ưu tiên quyền riêng tư và hỗ trợ đa nền tảng.
★ 5.828+193Thay đổi số sao trong 7 ngày qua - #29
Nhận dạng giọng nói tự động kết hợp phân đoạn người nói dựa trên OpenAI Whisper
★ 5.633+7Thay đổi số sao trong 7 ngày qua - #30
Nền tảng voice AI mã nguồn mở. Giải pháp thay thế tự lưu trữ cho Vapi và Retell. On Prem, BYOK qua Speech to Speech hoặc LLM/STT/TTS, tích hợp trình xây dựng quy trình trực quan, hỗ trợ MCP native và điện thoại.
★ 5.523+64Thay đổi số sao trong 7 ngày qua