Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · speech-recognition

speech-recognition

Các kho mã nguồn mở đang theo dõi được gắn thẻ speech-recognition, sắp xếp theo số sao.

155 kho mã
  • adapt@MycroftAI

    Trình phân tích ý định Adapt.

    719+0Thay đổi số sao trong 7 ngày qua
  • curses@mmpneo

    Chuyển đổi giọng nói thành văn bản và phụ đề nhập liệu KB cho OBS, VRChat, Twitch chat và Discord

    718+0Thay đổi số sao trong 7 ngày qua
  • openspeech@openspeech-team

    Bộ công cụ mã nguồn mở cho nhận dạng giọng nói đầu-cuối, tận dụng PyTorch-Lightning và Hydra.

    714-1Thay đổi số sao trong 7 ngày qua
  • rhino@Picovoice

    Công cụ chuyển đổi giọng nói thành ý định (Speech-to-Intent) trên thiết bị được hỗ trợ bởi học sâu

    711+1Thay đổi số sao trong 7 ngày qua
  • speech-demo@Baidu-AIP

    Ví dụ về API giọng nói.

    708+0Thay đổi số sao trong 7 ngày qua
  • Khung đánh giá hiệu năng chuyển đổi giọng nói thành văn bản

    697+0Thay đổi số sao trong 7 ngày qua
  • Nhận dạng giọng nói ngoại tuyến với OpenAI Whisper và TensorFlow Lite cho Android

    688-1Thay đổi số sao trong 7 ngày qua
  • Các bài báo INTERSPEECH 2023-2024: Bộ sưu tập đầy đủ các bài nghiên cứu có ảnh hưởng và thú vị từ hội nghị INTERSPEECH 2023-24. Khám phá những tiến bộ mới nhất trong xử lý ngôn ngữ và giọng nói. Bao gồm mã nguồn. Hãy gắn sao cho kho lưu trữ để ủng hộ sự phát triển của công nghệ giọng nói!

    684-1Thay đổi số sao trong 7 ngày qua
  • Một bộ dữ liệu âm thanh miễn phí về các chữ số được đọc. Phiên bản âm thanh của MNIST.

    678+0Thay đổi số sao trong 7 ngày qua
  • Nhận dạng giọng nói cho các dự án React Native Expo

    676+6Thay đổi số sao trong 7 ngày qua
  • cheetah@Picovoice

    Công cụ chuyển đổi giọng nói thành văn bản trực tuyến trên thiết bị dựa trên học sâu

    671+0Thay đổi số sao trong 7 ngày qua
  • hear@sveinbjornt

    Giao diện dòng lệnh cho các tính năng nhận dạng và chuyển đổi giọng nói tích hợp sẵn trên macOS.

    669-1Thay đổi số sao trong 7 ngày qua
  • FireRedASR2S@FireRedTeam

    Hệ thống ASR tất cả trong một cấp công nghiệp SOTA với các mô-đun ASR, VAD, LID và Punc. FireRedASR2 hỗ trợ tiếng Trung (Quan thoại, 20+ phương ngữ/giọng), tiếng Anh, chuyển đổi mã, và ASR cho cả giọng nói lẫn hát. FireRedVAD hỗ trợ giọng nói/hát/nhạc bằng 100+ ngôn ngữ. FireRedLID hỗ trợ 100+ ngôn ngữ và 20+ phương ngữ tiếng Trung. FireRedPunc hỗ trợ tiếng Trung và tiếng Anh.

    669+10Thay đổi số sao trong 7 ngày qua
  • gpt-home@judahpaul16

    ChatGPT tại nhà! Một giải pháp thay thế tốt hơn cho các trợ lý nhà thông minh thương mại, được xây dựng trên Raspberry Pi sử dụng LiteLLM và LangGraph.

    648+0Thay đổi số sao trong 7 ngày qua
  • sonus@evancohen

    :speech_balloon: /so.nus/ STT (speech to text) cho Node với tính năng phát hiện từ khóa ngoại tuyến

    638+0Thay đổi số sao trong 7 ngày qua
  • whisperIME@woheller69

    Trình soạn thảo phương thức nhập (IME) cho Android dựa trên Whisper

    630+5Thay đổi số sao trong 7 ngày qua
  • LiveTranslate@TheDeathDragon

    Dịch âm thanh thời gian thực, thu âm thanh hệ thống và micro, chạy ASR (Whisper/SenseVoice), dịch qua API LLM với hiển thị luồng. Phù hợp cho VTuber, người livestream và xem nội dung nước ngoài.

    621+18Thay đổi số sao trong 7 ngày qua
  • speech-to-text@reriiasu

    Chuyển đổi giọng nói thành văn bản thời gian thực sử dụng faster-whisper.

    614+0Thay đổi số sao trong 7 ngày qua
  • CrispASR@CrispStrobe

    C++ ggml runtime hub cho các mô hình ASR và TTS đa ngôn ngữ: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, cùng với tính năng căn chỉnh bắt buộc phổ quát và nhiều hơn nữa

    610+14Thay đổi số sao trong 7 ngày qua
  • CTCWordBeamSearch@githubharald

    Bộ giải mã Connectionist Temporal Classification (CTC) với từ điển và mô hình ngôn ngữ.

    580+1Thay đổi số sao trong 7 ngày qua
  • WhisperS2T@shashikg

    Pipeline chuyển đổi giọng nói thành văn bản được tối ưu hóa cho mô hình Whisper, hỗ trợ nhiều công cụ suy luận.

    578+1Thay đổi số sao trong 7 ngày qua
  • Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho React Native.

    575+0Thay đổi số sao trong 7 ngày qua
  • VRCOSC@VolcanicArts

    Một ngôn ngữ lập trình node mô-đun, trình tạo chương trình, hệ thống hoạt ảnh, bộ công cụ, bộ định tuyến và trình gỡ lỗi được tạo cho VRChat

    563-1Thay đổi số sao trong 7 ngày qua
  • Một lớp phủ (overlay) lấy quyền truy cập giọng nói của người dùng và chuyển đổi đầu vào thành văn bản trong giao diện tùy chỉnh

    557+0Thay đổi số sao trong 7 ngày qua
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: nền tảng đánh giá hiệu năng toàn diện, mạnh mẽ và quy mô lớn cho Nhận dạng giọng nói tự động (ASR).

    553+3Thay đổi số sao trong 7 ngày qua
  • Danh sách API nhận dạng giọng nói tiếng Hàn (STT). Đi kèm đánh giá hiệu năng.

    547+1Thay đổi số sao trong 7 ngày qua
  • CleanS2S@opendilab

    Tác nhân tương tác giọng nói hai chiều (Speech-to-Speech) chất lượng cao và hỗ trợ streaming trong một tệp duy nhất.

    541+0Thay đổi số sao trong 7 ngày qua
  • Talkify@tornikegomareli

    Công cụ đọc chính tả bằng giọng nói cục bộ, miễn phí, tốc độ cao cho macOS với khả năng chuyển đổi văn bản trên thiết bị

    533+16Thay đổi số sao trong 7 ngày qua
  • vosk-browser@ccoreilly

    Thư viện nhận dạng giọng nói chạy trên trình duyệt nhờ bản dựng WebAssembly của Vosk

    529+0Thay đổi số sao trong 7 ngày qua
  • parrots@shibing624

    Công cụ nhận dạng giọng nói (ASR) và chuyển văn bản thành giọng nói (TTS). Hỗ trợ nhận dạng giọng nói tiếng Trung và tiếng Anh, tổng hợp giọng nói đa nhân vật, hỗ trợ đa ngôn ngữ với độ chính xác cao.

    528+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề