speech-recognition
Repositori open source terpantau bertanda speech-recognition, diurutkan berdasarkan bintang.
- #91
Pusat penelitian AI audio: makalah, model terbuka, tolok ukur, & dataset di seluruh LLM audio, pengenalan ucapan, TTS, musik & pembuatan audio.
★ 953+1Perubahan bintang dalam 7 hari terakhir - #92
Layanan transkripsi dan diarisasi luring mandiri yang siap pakai dengan ringkasan LLM
★ 948+1Perubahan bintang dalam 7 hari terakhir - #93
Whisper.net. Konversi ucapan ke teks menjadi mudah menggunakan Whisper Models
★ 941+2Perubahan bintang dalam 7 hari terakhir - #94★ 939+0Perubahan bintang dalam 7 hari terakhir
- #95
Asisten suara desktop berbasis Python yang mampu mengeksekusi perintah tingkat sistem, mengintegrasikan pengenalan suara dan teks-ke-suara, serta menangani interaksi pengguna secara asinkron.
★ 919+12Perubahan bintang dalam 7 hari terakhir - #96
Model Whisper yang dioptimalkan untuk streaming dan penggunaan di perangkat
★ 897+1Perubahan bintang dalam 7 hari terakhir - #97
LLM berbasis suara yang berjalan di komputer Anda tanpa memerlukan internet.
★ 891+3Perubahan bintang dalam 7 hari terakhir - #98
SpeechPy - Pustaka untuk Pemrosesan dan Pengenalan Ucapan: http://speechpy.readthedocs.io/en/latest/
★ 883+0Perubahan bintang dalam 7 hari terakhir - #99
Implementasi pengenalan suara Mandarin end-to-end berbasis PaddlePaddle, dari tingkat dasar hingga praktis, contoh pemula yang super mudah dan proyek perusahaan yang sangat berguna. Mendukung model DeepSpeech2, Conformer, dan Squeezeformer yang paling populer saat ini
★ 870+0Perubahan bintang dalam 7 hari terakhir - #100
💬 Pengenalan suara untuk aplikasi React Anda
★ 842+2Perubahan bintang dalam 7 hari terakhir - #101
Algoritma decoding Connectionist Temporal Classification (CTC): best path, beam search, lexicon search, prefix search, dan token passing. Diimplementasikan dalam Python.
★ 836+0Perubahan bintang dalam 7 hari terakhir - #102
Membangun aplikasi web speech2text real-time menggunakan Whisper dari OpenAI https://openai.com/blog/whisper/
★ 835+1Perubahan bintang dalam 7 hari terakhir - #103★ 823+0Perubahan bintang dalam 7 hari terakhir
- #104
🎤 Lobe TTS - Pustaka TTS/STT yang berkualitas tinggi & andal untuk Server dan Browser
★ 805+3Perubahan bintang dalam 7 hari terakhir - #105
Speech to Text to Speech. Lagu sedang diputar. Mengirim teks sebagai pesan OSC ke VRChat untuk ditampilkan di avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 802+0Perubahan bintang dalam 7 hari terakhir - #106
Dikte suara gratis, sumber terbuka, dan 100% luring untuk Linux. Berbicara dan mengetik di mana saja melalui mesin whisper.cpp, Whisper & VOSK, dengan akselerasi GPU, berfungsi di X11 + Wayland!
★ 802+10Perubahan bintang dalam 7 hari terakhir - #107
Binding React Native dari whisper.cpp.
★ 800-1Perubahan bintang dalam 7 hari terakhir - #108
Chatbot suara lokal untuk percakapan interaktif, didukung oleh Ollama, Hugging Face Transformers, dan Coqui TTS Toolkit
★ 787+0Perubahan bintang dalam 7 hari terakhir - #109
Proyek yang memungkinkan penggunaan mikrofon dengan OpenAI whisper.
★ 787+0Perubahan bintang dalam 7 hari terakhir - #110
Cara termudah untuk mentranskripsi audio di Swift
★ 785+0Perubahan bintang dalam 7 hari terakhir - #111★ 783+12Perubahan bintang dalam 7 hari terakhir
- #112
Aplikasi transkripsi suara AI yang 100% privat, mengubah ucapan menjadi teks dalam 100+ bahasa. Dibuat dengan Compose Multiplatform untuk Android & iOS menggunakan Whisper AI - tanpa unggahan cloud, semua pemrosesan dilakukan di perangkat untuk privasi penuh.
★ 777-1Perubahan bintang dalam 7 hari terakhir - #113
📦 Konversi cepat antara angka Tiongkok dan angka Arab (fitur terbaru: konversi pecahan, tanggal, suhu, dll.)
★ 766+0Perubahan bintang dalam 7 hari terakhir - #114★ 763+1Perubahan bintang dalam 7 hari terakhir
- #115
Pengenalan suara berbasis PaddlePaddle, pengenalan suara bahasa Mandarin. Proyek yang lengkap dengan hasil pengenalan yang baik. Mendukung pelatihan dan prediksi di bawah Windows dan Linux, serta mendukung prediksi papan pengembang Nvidia Jetson.
★ 762+0Perubahan bintang dalam 7 hari terakhir - #116★ 754+1Perubahan bintang dalam 7 hari terakhir
- #117
Menjalankan model speech-to-text (whisper.cpp) di Unity3d pada mesin lokal Anda.
★ 751+0Perubahan bintang dalam 7 hari terakhir - #118
Allosaurus adalah pengenal phone universal pra-latih untuk lebih dari 2000 bahasa
★ 745+0Perubahan bintang dalam 7 hari terakhir - #119
Papan ketik dan layanan pengenalan suara privat dan berbasis perangkat untuk Android.
★ 744+5Perubahan bintang dalam 7 hari terakhir - #120
Kerangka kerja Automatic Speech Recognition (ASR) streaming dan non-streaming yang diimplementasikan dengan PyTorch, kompatibel dengan pengenalan online dan offline, saat ini mendukung model Conformer, Squeezeformer, dan DeepSpeech2, serta berbagai metode augmentasi data.
★ 727+0Perubahan bintang dalam 7 hari terakhir