speech-recognition
Repositori open source terpantau bertanda speech-recognition, diurutkan berdasarkan bintang.
- #121★ 719+0Perubahan bintang dalam 7 hari terakhir
- #122★ 718+0Perubahan bintang dalam 7 hari terakhir
- #123
Toolkit Open-Source untuk Pengenalan Ucapan End-to-End yang memanfaatkan PyTorch-Lightning dan Hydra.
★ 714+0Perubahan bintang dalam 7 hari terakhir - #124★ 712+2Perubahan bintang dalam 7 hari terakhir
- #125
Contoh API suara
★ 708+0Perubahan bintang dalam 7 hari terakhir - #126
framework tolok ukur speech to text
★ 697+0Perubahan bintang dalam 7 hari terakhir - #127
Pengenalan suara luring (offline) menggunakan OpenAI Whisper dan TensorFlow Lite untuk Android.
★ 688+0Perubahan bintang dalam 7 hari terakhir - #128
Makalah INTERSPEECH 2023-2024: Kumpulan lengkap makalah penelitian yang berpengaruh dan menarik dari konferensi INTERSPEECH 2023-24. Jelajahi kemajuan terbaru dalam pemrosesan ucapan dan bahasa. Disertai kode. Beri bintang pada repositori untuk mendukung kemajuan teknologi ucapan!
★ 684+0Perubahan bintang dalam 7 hari terakhir - #129
Dataset audio gratis dari digit yang diucapkan. Versi audio dari MNIST.
★ 678+0Perubahan bintang dalam 7 hari terakhir - #130
Pengenalan Ucapan untuk proyek React Native Expo
★ 677+5Perubahan bintang dalam 7 hari terakhir - #131★ 671+0Perubahan bintang dalam 7 hari terakhir
- #132
Sistem ASR All-in-One Kelas Industri SOTA dengan modul ASR, VAD, LID, dan Punc. FireRedASR2 mendukung bahasa Mandarin (Mandarin, 20+ dialek/aksen), Inggris, pencampuran kode, serta ASR ucapan dan nyanyian. FireRedVAD mendukung ucapan/nyanyian/musik dalam 100+ bahasa. FireRedLID mendukung 100+ bahasa dan 20+ dialek Mandarin. FireRedPunc mendukung Mandarin dan Inggris.
★ 670+12Perubahan bintang dalam 7 hari terakhir - #133
Antarmuka baris perintah untuk kapabilitas pengenalan dan transkripsi suara bawaan di macOS.
★ 669+0Perubahan bintang dalam 7 hari terakhir - #134
ChatGPT di rumah! Alternatif yang lebih baik untuk asisten rumah pintar komersial, dibangun di atas Raspberry Pi menggunakan LiteLLM dan LangGraph.
★ 648+1Perubahan bintang dalam 7 hari terakhir - #135
:speech_balloon: /so.nus/ STT (speech to text) untuk Node dengan deteksi kata kunci offline.
★ 638+0Perubahan bintang dalam 7 hari terakhir - #136
Android Input Method Editor (IME) berbasis Whisper
★ 632+4Perubahan bintang dalam 7 hari terakhir - #137
Terjemahan audio waktu nyata, menangkap audio sistem + mik, menjalankan ASR (Whisper/SenseVoice), menerjemahkan melalui LLM API dengan tampilan streaming. Sempurna untuk VTuber, streamer langsung, dan menonton konten asing.
★ 625+34Perubahan bintang dalam 7 hari terakhir - #138
Transkripsi waktu nyata menggunakan faster-whisper
★ 614+0Perubahan bintang dalam 7 hari terakhir - #139
Pusat runtime C++ ggml untuk model ASR dan TTS multibahasa: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, dll., ditambah penyelarasan paksa universal, dan lainnya
★ 609+21Perubahan bintang dalam 7 hari terakhir - #140
Dekoder Connectionist Temporal Classification (CTC) dengan kamus dan model bahasa.
★ 580+1Perubahan bintang dalam 7 hari terakhir - #141
Pipeline Speech-to-Text yang dioptimalkan untuk Model Whisper yang mendukung berbagai Inference Engine
★ 578+1Perubahan bintang dalam 7 hari terakhir - #142
Sistem pengodean mandiri untuk aplikasi Anda — Alan AI SDK untuk React Native
★ 575+0Perubahan bintang dalam 7 hari terakhir - #143
Bahasa pemrograman node modular, pembuat program, sistem animasi, toolkit, router, dan debugger yang dibuat untuk VRChat
★ 563-1Perubahan bintang dalam 7 hari terakhir - #144
🗣 Overlay yang mendapatkan izin suara pengguna dan masukan sebagai teks dalam UI yang dapat disesuaikan
★ 557+1Perubahan bintang dalam 7 hari terakhir - #145
SpeechIO Leaderboard: platform benchmarking yang besar, kuat, komprehensif untuk Automatic Speech Recognition.
★ 553+3Perubahan bintang dalam 7 hari terakhir - #146
Daftar API STT pengenalan suara bahasa Korea dan tolok ukur kinerjanya masing-masing.
★ 547+1Perubahan bintang dalam 7 hari terakhir - #147
Agen interaktif Speech-to-Speech berkualitas tinggi dan siap <i>streaming</i> dalam satu file tunggal.
★ 541+0Perubahan bintang dalam 7 hari terakhir - #148
Dikte suara lokal yang sangat cepat, gratis, dan mengutamakan privasi untuk macOS dengan transkripsi pada perangkat
★ 540+7Perubahan bintang dalam 7 hari terakhir - #149
Mesin Automatic Speech Recognition (ASR) dan Text-To-Speech (TTS). Pengenalan suara bahasa Mandarin-Inggris, sintesis suara multi-peran, mendukung banyak bahasa dengan tingkat akurasi tinggi.
★ 529+0Perubahan bintang dalam 7 hari terakhir - #150
Pustaka pengenalan suara yang berjalan di browser berkat build WebAssembly dari Vosk
★ 529+1Perubahan bintang dalam 7 hari terakhir