Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · speech-recognition

speech-recognition

Các kho mã nguồn mở đang theo dõi được gắn thẻ speech-recognition, sắp xếp theo số sao.

155 kho mã
  • whisper-jax@sanchit-gandhi

    Bản cài đặt JAX của mô hình Whisper từ OpenAI giúp tăng tốc lên tới 70 lần trên TPU.

    4.679-3Thay đổi số sao trong 7 ngày qua
  • pocketsphinx@cmusphinx

    Một trình nhận dạng giọng nói nhỏ gọn

    4.337+2Thay đổi số sao trong 7 ngày qua
  • distil-whisper@huggingface

    Biến thể chưng cất của Whisper dành cho nhận dạng giọng nói. Nhanh hơn 6 lần, nhỏ hơn 50%, tỷ lệ lỗi từ trong khoảng 1%.

    4.114+2Thay đổi số sao trong 7 ngày qua
  • API dịch vụ web ASR OpenAI Whisper

    3.328+2Thay đổi số sao trong 7 ngày qua
  • Các tệp thực thi độc lập của Whisper và Faster-Whisper dành cho những ai không muốn bận tâm về Python.

    3.171+8Thay đổi số sao trong 7 ngày qua
  • willow@HeyWillow

    Giải pháp thay thế trợ lý giọng nói cạnh tranh với Amazon Echo/Google Home, mã nguồn mở, chạy cục bộ và tự lưu trữ

    3.101+4Thay đổi số sao trong 7 ngày qua
  • whishper@pluja

    Chuyển đổi mọi âm thanh thành văn bản, dịch và chỉnh sửa phụ đề hoàn toàn ngoại tuyến với giao diện web UI. Được hỗ trợ bởi các mô hình whisper!

    3.068+2Thay đổi số sao trong 7 ngày qua
  • lingvo@tensorflow

    Lingvo

    2.864+0Thay đổi số sao trong 7 ngày qua
  • whisper-timestamped@linto-ai

    Nhận dạng Tự động Tiếng nói Đa ngôn ngữ với mốc thời gian cấp độ từ và độ tin cậy

    2.842+1Thay đổi số sao trong 7 ngày qua
  • STT@coqui-ai

    🐸STT - Bộ công cụ học sâu cho Speech-to-Text. Việc huấn luyện và triển khai các mô hình STT chưa bao giờ dễ dàng đến thế.

    2.606+0Thay đổi số sao trong 7 ngày qua
  • qwen-audio-agent@QwenAudio

    Một môi trường chạy giọng nói thời gian thực giúp các Agent trò chuyện, làm việc và hiện diện. Môi trường chạy giọng nói thời gian thực cho AI Agent

    2.358+54Thay đổi số sao trong 7 ngày qua
  • 🎙 Nhận dạng giọng nói sử dụng framework học sâu tensorflow, mạng thần kinh chuỗi-sang-chuỗi (sequence-to-sequence)

    2.173+0Thay đổi số sao trong 7 ngày qua
  • parlor@fikrikarim

    AI đa thức thời gian thực trên thiết bị với các tính năng tương tự GPT-Live

    2.048+9Thay đổi số sao trong 7 ngày qua
  • FireRedASR@FireRedTeam

    Các mô hình ASR cấp công nghiệp mã nguồn mở hỗ trợ tiếng Quan Thoại, các phương ngữ tiếng Trung và tiếng Anh, đạt SOTA mới trên các benchmark ASR tiếng Quan Thoại công khai, đồng thời cung cấp khả năng nhận dạng lời bài hát xuất sắc.

    1.975+3Thay đổi số sao trong 7 ngày qua
  • masr@nobody132

    Nhận dạng giọng nói tiếng Trung; Nhận dạng giọng nói tự động tiếng Quan Thoại;

    1.968+0Thay đổi số sao trong 7 ngày qua
  • julius@julius-speech

    Công cụ nhận dạng giọng nói liên tục từ vựng lớn mã nguồn mở

    1.935+2Thay đổi số sao trong 7 ngày qua
  • Danh sách tổng hợp các bài báo, thư viện, tập dữ liệu và các tài nguyên tuyệt vời khác về Phân đoạn Người nói.

    1.894+1Thay đổi số sao trong 7 ngày qua
  • alan-sdk-ios@alan-ai

    Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho iOS

    1.878-3Thay đổi số sao trong 7 ngày qua
  • Hệ thống tự động lập trình cho ứng dụng của bạn — Alan AI SDK cho Android

    1.807-1Thay đổi số sao trong 7 ngày qua
  • whisper-turbo@FL33TW00D

    Whisper đa nền tảng, tăng tốc bằng GPU 🏎️

    1.794+0Thay đổi số sao trong 7 ngày qua
  • sherpa-ncnn@k2-fsa

    Nhận dạng giọng nói thời gian thực và phát hiện hoạt động giọng nói (VAD) sử dụng Kaldi thế hệ mới với ncnn mà không cần kết nối Internet. Hỗ trợ iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, v.v.

    1.777-2Thay đổi số sao trong 7 ngày qua
  • Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho Flutter

    1.756-1Thay đổi số sao trong 7 ngày qua
  • alan-sdk-ionic@alan-ai

    Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho Ionic

    1.649-1Thay đổi số sao trong 7 ngày qua
  • dsnote@mkiol

    Ứng dụng Speech Note trên Linux. Ghi chú, đọc và dịch với tính năng Chuyển giọng nói thành văn bản, Chuyển văn bản thành giọng nói và Dịch máy ngoại tuyến.

    1.622+13Thay đổi số sao trong 7 ngày qua
  • Plugin OBS dành cho nhận diện giọng nói và tạo phụ đề cục bộ sử dụng AI.

    1.597+11Thay đổi số sao trong 7 ngày qua
  • amica@semperai

    Amica là một giao diện mã nguồn mở dùng để giao tiếp tương tác với các nhân vật 3D tích hợp tổng hợp giọng nói và nhận dạng giọng nói.

    1.591-3Thay đổi số sao trong 7 ngày qua
  • Các node tùy chỉnh mở rộng tính năng của ComfyUI

    1.525+1Thay đổi số sao trong 7 ngày qua
  • SALMONN@bytedance

    Dòng SALMONN: Bộ LLM đa phương thức tiên tiến

    1.521+7Thay đổi số sao trong 7 ngày qua
  • Fun-ASR@QwenAudio

    Dòng mô hình ASR dựa trên LLM mã nguồn mở cho tiếng Trung, phương ngữ, tiếng địa phương và giọng nói đa ngôn ngữ, với các thời gian chạy FunASR, vLLM, streaming và llama.cpp.

    1.512+14Thay đổi số sao trong 7 ngày qua
  • SpeechT5@microsoft

    Tiền huấn luyện giọng nói-văn bản đơn modal thống nhất cho xử lý ngôn ngữ nói

    1.449+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề