asr
Repositori open source terpantau bertanda asr, diurutkan berdasarkan bintang.
- #31
Pengenalan suara waktu nyata dan deteksi aktivitas suara (VAD) menggunakan Kaldi generasi berikutnya dengan ncnn tanpa koneksi Internet. Mendukung iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, dll.
★ 1.777-2Perubahan bintang dalam 7 hari terakhir - #32
Bailing adalah bot dialog suara yang mirip dengan GPT-4o, diimplementasikan melalui ASR+LLM+TTS, mengintegrasikan model besar yang luar biasa seperti DeepSeek R1, terhubung ke openClaw, asisten suara pribadi sejati, latensi serendah 800ms, dapat berjalan di spesifikasi rendah seperti Mac, dan mendukung interupsi.
★ 1.759+2Perubahan bintang dalam 7 hari terakhir - #33
Aplikasi Linux Speech Note. Mencatat, membaca, dan menerjemahkan dengan Speech to Text, Text to Speech, dan terjemahan mesin secara luring.
★ 1.622+13Perubahan bintang dalam 7 hari terakhir - #34
Menganalisis video menggunakan LLM, Computer Vision, dan Automatic Speech Recognition
★ 1.570+11Perubahan bintang dalam 7 hari terakhir - #35
🎙️ Aplikasi Dikte AI - Sumber Terbuka dan Utamakan Lokal ⚡ Ketik 3x lebih cepat, tanpa perlu keyboard. 🆓 Didukung oleh model sumber terbuka, bekerja secara offline, cepat dan akurat.
★ 1.520+14Perubahan bintang dalam 7 hari terakhir - #36
Keluarga model ASR berbasis LLM open-source untuk bahasa Mandarin, dialek, aksen, dan ucapan multilingual, lengkap dengan runtime FunASR, vLLM, streaming, dan llama.cpp.
★ 1.512+14Perubahan bintang dalam 7 hari terakhir - #37
🍦 Speech-AI-Forge adalah proyek yang dikembangkan di sekitar model generasi TTS, mengimplementasikan API Server dan WebUI berbasis Gradio.
★ 1.418+2Perubahan bintang dalam 7 hari terakhir - #38
Terjemahan Tersinkronisasi untuk Video. Sulih suara video
★ 1.413+3Perubahan bintang dalam 7 hari terakhir - #39
Transkripsi yang Dapat Dikontrol. Verbatim (setiap kata, pengisi, jeda, gagap, suara vokal), atau yang dimaksudkan (apa yang ingin dikatakan pembicara, dioptimalkan untuk keterbacaan) dengan stempel waktu tingkat kata.
★ 1.371+21Perubahan bintang dalam 7 hari terakhir - #40★ 1.347+6Perubahan bintang dalam 7 hari terakhir
- #41
Digital human interaktif suara secara real-time, dengan tampilan dan suara yang dapat disesuaikan, mendukung kloning suara, serta latensi dialog serendah 3 detik.
★ 1.303+0Perubahan bintang dalam 7 hari terakhir - #42
StreamSpeech adalah model "All in One" yang mulus untuk pengenalan suara offline dan simultan, terjemahan suara, serta sintesis suara.
★ 1.288+1Perubahan bintang dalam 7 hari terakhir - #43
Server pengenalan suara WebSocket, gRPC, dan WebRTC berdasarkan pustaka Vosk dan Kaldi
★ 1.262+2Perubahan bintang dalam 7 hari terakhir - #44
Lakukan fine-tune pada model pengenalan suara Whisper untuk mendukung pelatihan tanpa data penanda waktu, pelatihan dengan data penanda waktu, dan pelatihan tanpa data suara. Mempercepat inferensi dan mendukung deployment di Web, desktop Windows, serta Android
★ 1.222-1Perubahan bintang dalam 7 hari terakhir - #45
Toolkit bicara AI untuk Apple Silicon — ASR, TTS, speech-to-speech, VAD, dan diarisasi yang didukung oleh MLX dan CoreML
★ 1.161+11Perubahan bintang dalam 7 hari terakhir - #46
Fondasi ASR pertama yang dibangun untuk dunia nyata - 7 kondisi akustik atom, 54 skenario gabungan, 2,6 juta sampel, dan peningkatan hingga ~30% dibandingkan SOTA di saat model lain gagal. **Anda akan kembali ke MEGA-ASR setelah yang lain gagal di lapangan. ⭐**
★ 1.136+3Perubahan bintang dalam 7 hari terakhir - #47
Implementasi PyTorch [Tidak Resmi] untuk "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)
★ 1.132+1Perubahan bintang dalam 7 hari terakhir - #48
SGLang-Omni mendukung penyajian berkinerja tinggi untuk model TTS, ASR, ucapan, dan omni.
★ 1.100+107Perubahan bintang dalam 7 hari terakhir - #49
Pengenalan suara offline untuk Android menggunakan pustaka Vosk.
★ 1.056+0Perubahan bintang dalam 7 hari terakhir - #50★ 1.055+4Perubahan bintang dalam 7 hari terakhir
- #51
Speech-to-Text lintas platform yang sepenuhnya lokal, privat, dengan pemrosesan pasca LLM
★ 1.051+13Perubahan bintang dalam 7 hari terakhir - #52★ 1.040+0Perubahan bintang dalam 7 hari terakhir
- #53★ 982+2Perubahan bintang dalam 7 hari terakhir
- #54★ 939+0Perubahan bintang dalam 7 hari terakhir
- #55
VocoType adalah alat input suara lokal yang menjaga privasi, memungkinkan konversi suara ke teks secara real-time dan input otomatis ke aplikasi saat ini melalui pintasan keyboard. Mendukung MCP suara-ke-teks, optimasi teks AI, kamus penggantian kustom, transkripsi rekaman video, dan lainnya untuk input suara yang lebih efisien dan aman.
★ 924+2Perubahan bintang dalam 7 hari terakhir - #56
Proyek ini menyediakan API dengan dukungan akses level pengguna untuk mentranskripsikan suara ke teks menggunakan model Whisper ASR yang telah disempurnakan dan diproses.
★ 914+0Perubahan bintang dalam 7 hari terakhir - #57
Toolbox algoritma AI offline gratis untuk Java, mendukung pengenalan wajah, deteksi liveness, pengenalan ekspresi, deteksi objek, segmentasi instans, deteksi pejalan kaki, pengenalan teks OCR, pengenalan pelat nomor, pengenalan tabel, ASR+TTS, terjemahan mesin, dan lainnya. Dapat digunakan melalui Maven. Mendukung PyTorch, Tensorflow, serta telah mengintegrasikan model utama seperti Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5), dan Whisper.
★ 907+1Perubahan bintang dalam 7 hari terakhir - #58
Toolkit yang ramah pengguna untuk pengenalan/transkripsi/konversi suara, dll.
★ 873+0Perubahan bintang dalam 7 hari terakhir - #59
Implementasi pengenalan suara Mandarin end-to-end berbasis PaddlePaddle, dari tingkat dasar hingga praktis, contoh pemula yang super mudah dan proyek perusahaan yang sangat berguna. Mendukung model DeepSpeech2, Conformer, dan Squeezeformer yang paling populer saat ini
★ 870+0Perubahan bintang dalam 7 hari terakhir - #60
GLM-ASR-Nano: Model pengenalan ucapan sumber terbuka yang tangguh dengan 1,5 miliar parameter
★ 854+4Perubahan bintang dalam 7 hari terakhir