Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · speech-to-text

speech-to-text

Các kho mã nguồn mở đang theo dõi được gắn thẻ speech-to-text, sắp xếp theo số sao.

Kho mã
148
Tổng số sao
633.219
Số sao trung bình
4.279
Tỷ trọng
0,03%

Những chủ đề thường xuất hiện cùng speech-to-text trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ speech-to-text.

  • audio.cpp@0xShug0

    Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.

    2.128
  • Uncensored-Local-Studio@techjarves

    Studio AI cục bộ không kiểm duyệt dành cho Windows, Linux và macOS. Giao diện đồ họa thiết lập bằng không cho Tạo ảnh, GGUF LLM, Chuyển văn bản thành giọng nói & Chuyển giọng nói thành văn bản

    1.048
  • Talkify@tornikegomareli

    Công cụ đọc chính tả bằng giọng nói cục bộ, miễn phí, tốc độ cao cho macOS với khả năng chuyển đổi văn bản trên thiết bị

    531
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    494
  • LiveStream-Agent-Studio@HanyuanWang

    面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。

    460
  • whisper.cpp@ggml-org

    Chuyển đổi mô hình Whisper của OpenAI sang C/C++

    53.286+193Thay đổi số sao trong 7 ngày qua
  • Handy@cjpais

    Ứng dụng chuyển đổi giọng nói thành văn bản miễn phí, mã nguồn mở và có thể mở rộng, hoạt động hoàn toàn ngoại tuyến.

    30.636+554Thay đổi số sao trong 7 ngày qua
  • meetily@Zackriya-Solutions

    Trợ lý họp AI ưu tiên quyền riêng tư với bản ghi âm trực tiếp Parakeet/Whisper nhanh hơn 4 lần, phân đoạn người nói và tóm tắt bằng Ollama được xây dựng bằng Rust. Xử lý cục bộ 100%, không cần đám mây.

    30.057+325Thay đổi số sao trong 7 ngày qua
  • llamafile@mozilla-ai

    Phân phối và chạy các LLM chỉ với một file duy nhất.

    25.746+78Thay đổi số sao trong 7 ngày qua
  • faster-whisper@SYSTRAN

    Chuyển đổi giọng nói thành văn bản Whisper nhanh hơn với CTranslate2

    25.135+108Thay đổi số sao trong 7 ngày qua
  • whisperX@m-bain

    WhisperX: Nhận diện giọng nói tự động với mốc thời gian cấp độ từ (và phân đoạn người nói)

    23.803+117Thay đổi số sao trong 7 ngày qua
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | Ghi lại màn hình của bạn liên tục trên máy cục bộ và cung cấp ngữ cảnh cho các agent của bạn (Claude, Codex, Openclaw, Hermes, Runner...)

    21.296+133Thay đổi số sao trong 7 ngày qua
  • FunASR@modelscope

    Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.

    20.072+108Thay đổi số sao trong 7 ngày qua
  • pyvideotrans@jianchang512

    Dịch video từ ngôn ngữ này sang ngôn ngữ khác và chèn lồng tiếng & phụ đề.

    18.833+65Thay đổi số sao trong 7 ngày qua
  • leon@leon-ai

    🧠 Leon là trợ lý cá nhân mã nguồn mở của bạn.

    17.475+22Thay đổi số sao trong 7 ngày qua
  • kaldi@kaldi-asr

    kaldi-asr/kaldi là địa chỉ chính thức của dự án Kaldi.

    15.471+7Thay đổi số sao trong 7 ngày qua
  • vosk-api@alphacep

    API nhận diện giọng nói ngoại tuyến cho Android, iOS, Raspberry Pi và máy chủ với Python, Java, C# và Node

    15.084+17Thay đổi số sao trong 7 ngày qua
  • sherpa-onnx@k2-fsa

    Chuyển đổi giọng nói thành văn bản, văn bản thành giọng nói, phân đoạn người nói, cải thiện giọng nói, tách nguồn âm thanh và VAD sử dụng Kaldi thế hệ mới với onnxruntime không cần kết nối Internet. Hỗ trợ hệ thống nhúng, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, máy chủ x86_64, websocket server/client, hỗ trợ 12 ngôn ngữ lập trình

    14.480+169Thay đổi số sao trong 7 ngày qua
  • speech-to-speech@huggingface

    Xây dựng các tác nhân giọng nói với các mô hình mã nguồn mở

    12.933+180Thay đổi số sao trong 7 ngày qua
  • voice-pro@abus-aikorea

    Gradio WebUI dành cho người sáng tạo và nhà phát triển, tích hợp các tính năng TTS chính (Edge-TTS, kokoro) và nhân bản giọng nói zero-shot (E2 & F5-TTS, CosyVoice), xử lý âm thanh Whisper, tải xuống YouTube, tách giọng hát Demucs và dịch đa ngôn ngữ.

    12.676+100Thay đổi số sao trong 7 ngày qua
  • VoiceStudio@debpalash

    VoiceStudio là giải pháp thay thế ElevenLabs mã nguồn mở, chạy hoàn toàn cục bộ — nhân bản giọng nói, thiết kế giọng nói, lồng tiếng video, đọc chính tả, chuyển đổi văn bản thành giọng nói và tạo sách nói bằng 646 ngôn ngữ.

    11.955+853Thay đổi số sao trong 7 ngày qua
  • speechbrain@speechbrain

    Bộ công cụ nhận diện giọng nói dựa trên PyTorch

    11.792+22Thay đổi số sao trong 7 ngày qua
  • WhisperLiveKit@QuentinFuxa

    Chuyển đổi giọng nói thành văn bản cục bộ, thời gian thực với ASR phát trực tuyến, phân đoạn người nói, dịch thuật và các API tương thích với OpenAI/Deepgram.

    10.974+75Thay đổi số sao trong 7 ngày qua
  • RealtimeSTT@KoljaB

    Thư viện chuyển đổi giọng nói thành văn bản mạnh mẽ, hiệu quả, độ trễ thấp với khả năng phát hiện hoạt động giọng nói nâng cao, kích hoạt bằng từ khóa và phiên dịch tức thì.

    10.090+20Thay đổi số sao trong 7 ngày qua
  • SenseVoice@QwenAudio

    Mô hình SenseVoiceSmall mã nguồn mở cho ASR tiếng Quan Thoại, Quảng Đông, Anh, Nhật và Hàn, nhận diện ngôn ngữ, cảm xúc và sự kiện âm thanh.

    9.172+51Thay đổi số sao trong 7 ngày qua
  • Mô-đun nhận dạng giọng nói cho Python, hỗ trợ nhiều engine và API, trực tuyến và ngoại tuyến.

    8.987+2Thay đổi số sao trong 7 ngày qua
  • Hệ thống nhận dạng giọng nói tiếng Trung dựa trên Deep Learning

    8.386+5Thay đổi số sao trong 7 ngày qua
  • mlx-audio@Blaizzy

    Một thư viện chuyển đổi văn bản thành giọng nói (TTS), giọng nói thành văn bản (STT) và giọng nói thành giọng nói (STS) được xây dựng trên framework MLX của Apple, cung cấp khả năng phân tích giọng nói hiệu quả trên Apple Silicon.

    7.803+31Thay đổi số sao trong 7 ngày qua
  • annyang@TalAter

    💬 Nhận dạng giọng nói cho trang web của bạn

    6.816+1Thay đổi số sao trong 7 ngày qua
  • argmax-oss-swift@argmaxinc

    AI giọng nói trên thiết bị dành cho Apple Silicon

    6.345+11Thay đổi số sao trong 7 ngày qua
  • FunClip@modelscope

    Công cụ chuyển biên video, tạo phụ đề và cắt ghép video hỗ trợ bởi LLM, hoạt động dựa trên FunASR với giao diện Gradio cục bộ.

    6.197+25Thay đổi số sao trong 7 ngày qua
  • silero-models@snakers4

    Silero Models: các mô hình chuyển văn bản thành giọng nói được huấn luyện trước trở nên vô cùng đơn giản

    6.085+11Thay đổi số sao trong 7 ngày qua
  • openwhispr@OpenWhispr

    Ứng dụng đọc chính tả giọng nói thành văn bản hỗ trợ mô hình cục bộ (Nvidia Parakeet/Whisper) và đám mây (BYOK). Ưu tiên quyền riêng tư và hỗ trợ đa nền tảng.

    5.828+193Thay đổi số sao trong 7 ngày qua
  • whisper-diarization@MahmoudAshraf97

    Nhận dạng giọng nói tự động kết hợp phân đoạn người nói dựa trên OpenAI Whisper

    5.633+7Thay đổi số sao trong 7 ngày qua
  • dograh@dograh-hq

    Nền tảng voice AI mã nguồn mở. Giải pháp thay thế tự lưu trữ cho Vapi và Retell. On Prem, BYOK qua Speech to Speech hoặc LLM/STT/TTS, tích hợp trình xây dựng quy trình trực quan, hỗ trợ MCP native và điện thoại.

    5.523+64Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề