Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · asr

asr

Các kho mã nguồn mở đang theo dõi được gắn thẻ asr, sắp xếp theo số sao.

Kho mã
86
Tổng số sao
261.812
Số sao trung bình
3.044
Tỷ trọng
0,01%

Những chủ đề thường xuất hiện cùng asr trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ asr.

  • audio.cpp@0xShug0

    Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.

    2.214
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • hayamimi@oboroge0

    早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.

    327
  • whisperX@m-bain

    WhisperX: Nhận diện giọng nói tự động với mốc thời gian cấp độ từ (và phân đoạn người nói)

    23.864+61Thay đổi số sao trong 7 ngày qua
  • FunASR@modelscope

    Bộ công cụ nhận dạng giọng nói nguồn mở dành cho huấn luyện, suy luận, streaming ASR, VAD, dấu câu, pipeline phân đoạn người nói (speaker diarization) và phục vụ tương thích với OpenAI/MCP.

    20.136+64Thay đổi số sao trong 7 ngày qua
  • Speech@NVIDIA-NeMo

    Một framework AI tạo sinh có khả năng mở rộng được xây dựng cho các nhà nghiên cứu và lập trình viên làm việc về Mô hình Ngôn ngữ Lớn, Đa phương thức và AI Giọng nói (Nhận dạng Giọng nói Tự động và Chuyển văn bản thành giọng nói)

    18.379+21Thay đổi số sao trong 7 ngày qua
  • vosk-api@alphacep

    API nhận diện giọng nói ngoại tuyến cho Android, iOS, Raspberry Pi và máy chủ với Python, Java, C# và Node

    15.101+17Thay đổi số sao trong 7 ngày qua
  • sherpa-onnx@k2-fsa

    Chuyển đổi giọng nói thành văn bản, văn bản thành giọng nói, phân đoạn người nói, cải thiện giọng nói, tách nguồn âm thanh và VAD sử dụng Kaldi thế hệ mới với onnxruntime không cần kết nối Internet. Hỗ trợ hệ thống nhúng, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, máy chủ x86_64, websocket server/client, hỗ trợ 12 ngôn ngữ lập trình

    14.575+95Thay đổi số sao trong 7 ngày qua
  • PaddleSpeech@PaddlePaddle

    Bộ công cụ xử lý giọng nói dễ sử dụng, bao gồm mô hình tự giám sát (Self-Supervised Learning), SOTA/Streaming ASR có dấu câu, Streaming TTS tích hợp frontend văn bản, Hệ thống xác thực người nói, Dịch giọng nói đầu cuối và Nhận diện từ khóa. Đạt giải Demo xuất sắc nhất tại NAACL 2022.

    12.676+5Thay đổi số sao trong 7 ngày qua
  • speechbrain@speechbrain

    Bộ công cụ nhận diện giọng nói dựa trên PyTorch

    11.802+10Thay đổi số sao trong 7 ngày qua
  • SenseVoice@QwenAudio

    Mô hình SenseVoiceSmall mã nguồn mở cho ASR tiếng Quan Thoại, Quảng Đông, Anh, Nhật và Hàn, nhận diện ngôn ngữ, cảm xúc và sự kiện âm thanh.

    9.209+37Thay đổi số sao trong 7 ngày qua
  • Đây là Python API cho phép bạn lấy bản ghi / phụ đề cho một video YouTube bất kỳ. Nó cũng hoạt động với phụ đề được tạo tự động và không yêu cầu khóa API hay trình duyệt headless như các giải pháp dựa trên Selenium khác!

    8.143+14Thay đổi số sao trong 7 ngày qua
  • wukong-robot@wzpan

    🤖 wukong-robot là một dự án chatbot/loa thông minh bằng giọng nói tiếng Trung đơn giản, linh hoạt và thanh lịch, hỗ trợ khả năng trò chuyện nhiều lượt với ChatGPT, và có thể là dự án loa thông minh mã nguồn mở đầu tiên hỗ trợ tương tác não-máy tính.

    7.126+2Thay đổi số sao trong 7 ngày qua
  • FunClip@modelscope

    Công cụ chuyển biên video, tạo phụ đề và cắt ghép video hỗ trợ bởi LLM, hoạt động dựa trên FunASR với giao diện Gradio cục bộ.

    6.210+13Thay đổi số sao trong 7 ngày qua
  • whisper-diarization@MahmoudAshraf97

    Nhận dạng giọng nói tự động kết hợp phân đoạn người nói dựa trên OpenAI Whisper

    5.634+1Thay đổi số sao trong 7 ngày qua
  • Recorder@xiangyuecn

    Thư viện ghi âm HTML5 JS hỗ trợ các định dạng mp3, wav, ogg, webm, amr, g711a, g711u; hỗ trợ PC, một số trình duyệt web trên Android và iOS, Hybrid App (cung cấp mã nguồn App Android và iOS), WeChat; cung cấp tính năng chuyển đổi giọng nói thành văn bản ASR, mẫu trò chuyện gọi thoại H5 và mã hóa/giải mã DTMF

    5.631+3Thay đổi số sao trong 7 ngày qua
  • wenet@wenet-e2e

    Bộ công cụ nhận dạng giọng nói đầu-cuối (End-to-End) ưu tiên môi trường production và sẵn sàng cho production

    5.229+1Thay đổi số sao trong 7 ngày qua
  • LLPlayer@umlx5h

    Trình phát đa phương tiện hỗ trợ học ngoại ngữ với phụ đề kép, phụ đề tạo bởi AI, dịch thời gian thực và nhiều tính năng khác!

    4.070+12Thay đổi số sao trong 7 ngày qua
  • Streamer-Sales@PeterH0323

    Streamer-Sales: Mô hình ngôn ngữ lớn (LLM) dành cho streamer bán hàng 🛒🎁, có khả năng giải thích sản phẩm dựa trên các đặc điểm đã cho nhằm kích thích ý định mua hàng của người dùng. 🚀⭐ Bao gồm quy trình tạo dữ liệu chi tiết ❗ 📦 Tích hợp tăng tốc suy luận LMDeploy 🚀, RAG (Tạo tăng cường truy xuất) 📚, TTS (Chuyển văn bản thành giọng nói) 🔊, tạo người ảo 🦸, Agent sử dụng web để tra cứu thông tin thời gian thực 🌐, ASR (Nhận diện giọng nói thành văn bản) 🎙️, frontend xây dựng bằng hệ sinh thái Vue 🍍, backend xây dựng bằng FastAPI 🗝️, đóng gói và triển khai bằng Docker-compose 🐋

    3.764+1Thay đổi số sao trong 7 ngày qua
  • openless@Open-Less

    Giữ phím, nói, thả ra — văn bản được AI trau chuốt sẽ xuất hiện tại con trỏ của bạn trong bất kỳ ứng dụng nào. Công cụ nhập giọng nói mã nguồn mở cho macOS & Windows.

    3.403+44Thay đổi số sao trong 7 ngày qua
  • API dịch vụ web ASR OpenAI Whisper

    3.328+2Thay đổi số sao trong 7 ngày qua
  • Các tệp thực thi độc lập của Whisper và Faster-Whisper dành cho những ai không muốn bận tâm về Python.

    3.171+2Thay đổi số sao trong 7 ngày qua
  • GPA@AutoArk

    [AutoArk] GPA (General Purpose Audio) có thể thực hiện ASR, TTS và chuyển đổi giọng nói chỉ với một mô hình nhỏ gọn!

    3.061+164Thay đổi số sao trong 7 ngày qua
  • faster-whisper-GUI@CheshireCC

    Giao diện đồ họa cho faster_whisper sử dụng PySide6

    2.995+4Thay đổi số sao trong 7 ngày qua
  • lingvo@tensorflow

    Lingvo

    2.864+0Thay đổi số sao trong 7 ngày qua
  • whisper-timestamped@linto-ai

    Nhận dạng Tự động Tiếng nói Đa ngôn ngữ với mốc thời gian cấp độ từ và độ tin cậy

    2.842+1Thay đổi số sao trong 7 ngày qua
  • FluidAudio@FluidInference

    Các mô hình âm thanh CoreML tiên tiến trong ứng dụng của bạn — chuyển văn bản thành giọng nói, chuyển giọng nói thành văn bản, phát hiện hoạt động giọng nói và phân đoạn người nói. Viết bằng Swift, cung cấp bởi các mã nguồn mở SOTA.

    2.723+13Thay đổi số sao trong 7 ngày qua
  • STT@coqui-ai

    🐸STT - Bộ công cụ học sâu cho Speech-to-Text. Việc huấn luyện và triển khai các mô hình STT chưa bao giờ dễ dàng đến thế.

    2.606+1Thay đổi số sao trong 7 ngày qua
  • AudioNotes@harry0703

    Trích xuất nhanh nội dung âm thanh và video, tổng hợp thành ghi chú markdown có cấu trúc

    2.483+7Thay đổi số sao trong 7 ngày qua
  • audio.cpp@0xShug0

    Một công cụ suy luận C++ thuần túy, tất cả trong một dành cho các mô hình âm thanh, được hỗ trợ bởi ggml. Hỗ trợ TTS, STT, VAD, chuyển đổi giọng nói, tạo nhạc và nhiều tính năng khác với hiệu năng được tối ưu hóa cao. Không phụ thuộc Python.

    2.214+115Thay đổi số sao trong 7 ngày qua
  • FireRedASR@FireRedTeam

    Các mô hình ASR cấp công nghiệp mã nguồn mở hỗ trợ tiếng Quan Thoại, các phương ngữ tiếng Trung và tiếng Anh, đạt SOTA mới trên các benchmark ASR tiếng Quan Thoại công khai, đồng thời cung cấp khả năng nhận dạng lời bài hát xuất sắc.

    1.975+2Thay đổi số sao trong 7 ngày qua
  • transcribe.cpp@handy-computer

    Suy luận chuyển giọng nói thành văn bản bằng ggml cho hơn 16 họ mô hình

    1.872+19Thay đổi số sao trong 7 ngày qua
  • Khung AI+IoT thế hệ mới cho T2/T3/T5AI/ESP32 và nhiều hơn nữa – Tích hợp phần cứng IoT và AI Agent nhanh chóng

    1.816+5Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề