asr
Repositori open source terpantau bertanda asr, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan asr di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda asr.
- #1
Mesin inferensi C++ murni yang lengkap untuk model audio, didukung oleh ggml. Mendukung TTS, STT, VAD, konversi suara, pembuatan musik, dan lainnya, dengan performa yang sangat dioptimalkan. Tanpa dependensi Python.
★ 2.214 - #2
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501 - #3
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 327
- #1
WhisperX: Pengenalan Ucapan Otomatis dengan stempel waktu tingkat kata (& Diarisasi)
★ 23.864+61Perubahan bintang dalam 7 hari terakhir - #2
Toolkit pengenalan suara open source untuk pelatihan, inferensi, streaming ASR, VAD, tanda baca, pipeline diarization pembicara, dan penyajian yang kompatibel dengan OpenAI/MCP.
★ 20.136+64Perubahan bintang dalam 7 hari terakhir - #3
Kerangka kerja AI generatif yang skalabel yang dibangun untuk peneliti dan pengembang yang bekerja pada Large Language Models, Multimodal, dan Speech AI (Automatic Speech Recognition dan Text-to-Speech)
★ 18.379+21Perubahan bintang dalam 7 hari terakhir - #4
API pengenalan suara offline untuk Android, iOS, Raspberry Pi, dan server dengan Python, Java, C#, dan Node.
★ 15.101+17Perubahan bintang dalam 7 hari terakhir - #5
Speech-to-text, text-to-speech, speaker diarization, peningkatan kualitas suara, pemisahan sumber, dan VAD menggunakan next-gen Kaldi dengan onnxruntime tanpa koneksi internet. Mendukung sistem embedded, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, server x86_64, websocket server/client, serta mendukung 12 bahasa pemrograman.
★ 14.575+95Perubahan bintang dalam 7 hari terakhir - #6
Toolkit Speech yang mudah digunakan mencakup model Self-Supervised Learning, SOTA/Streaming ASR dengan tanda baca, Streaming TTS dengan frontend teks, Sistem Verifikasi Pembicara, End-to-End Speech Translation, dan Keyword Spotting. Pemenang Penghargaan Demo Terbaik NAACL2022.
★ 12.676+5Perubahan bintang dalam 7 hari terakhir - #7
Toolkit ucapan berbasis PyTorch
★ 11.802+10Perubahan bintang dalam 7 hari terakhir - #8
Model SenseVoiceSmall sumber terbuka untuk ASR bahasa Mandarin, Kanton, Inggris, Jepang, dan Korea, identifikasi bahasa, pengenalan emosi, dan deteksi peristiwa audio.
★ 9.209+37Perubahan bintang dalam 7 hari terakhir - #9
API Python untuk mendapatkan transkrip atau subtitle video YouTube. Mendukung subtitle yang dibuat otomatis dan tidak memerlukan API key atau browser headless seperti solusi berbasis selenium.
★ 8.143+14Perubahan bintang dalam 7 hari terakhir - #10
🤖 wukong-robot adalah proyek robot percakapan suara/speaker pintar bahasa Mandarin yang sederhana, fleksibel, dan elegan, mendukung kemampuan percakapan multi-putaran ChatGPT, dan mungkin merupakan proyek speaker pintar sumber terbuka pertama yang mendukung interaksi otak-komputer.
★ 7.126+2Perubahan bintang dalam 7 hari terakhir - #11
Alat transkripsi video, pembuatan subtitle, dan pemotongan berbasis LLM yang didukung oleh FunASR dengan antarmuka Gradio lokal.
★ 6.210+13Perubahan bintang dalam 7 hari terakhir - #12
Pengenalan Ucapan Otomatis (ASR) dengan Speaker Diarization berbasis OpenAI Whisper
★ 5.634+1Perubahan bintang dalam 7 hari terakhir - #13
Perekaman audio html5 js dalam format mp3, wav, ogg, webm, amr, g711a, g711u, mendukung PC dan Android, beberapa browser web iOS, Hybrid App (menyediakan kode sumber Android iOS App), WeChat, menyediakan contoh obrolan suara H5 dengan konversi ASR ke teks, serta pengkodean/dekode DTMF
★ 5.631+3Perubahan bintang dalam 7 hari terakhir - #14★ 5.229+1Perubahan bintang dalam 7 hari terakhir
- #15
Pemutar media untuk pembelajaran bahasa, dengan subtitel ganda, subtitel buatan AI, terjemahan waktu nyata, dan banyak lagi!
★ 4.070+12Perubahan bintang dalam 7 hari terakhir - #16
Streamer-Sales 销冠 — LLM untuk streamer penjualan barang 🛒🎁, model yang mampu menjelaskan produk untuk memicu minat beli pengguna berdasarkan fitur produk. 🚀⭐ Termasuk alur pembuatan data yang mendetail ❗ 📦 Terintegrasi dengan LMDeploy untuk akselerasi inferensi 🚀, RAG untuk augmentasi pengambilan 📚, TTS untuk teks-ke-suara 🔊, pembuatan avatar digital 🦸, Agent untuk pencarian informasi real-time 🌐, ASR untuk suara-ke-teks 🎙️, frontend berbasis ekosistem Vue 🍍, backend FastAPI 🗝️, dan deployment Docker-compose 🐋
★ 3.764+1Perubahan bintang dalam 7 hari terakhir - #17
Tahan tombol, bicara, lepaskan — teks yang telah dipoles AI akan muncul di kursor Anda di aplikasi apa pun. Input suara sumber terbuka untuk macOS & Windows.
★ 3.403+44Perubahan bintang dalam 7 hari terakhir - #18
Layanan API ASR OpenAI Whisper
★ 3.328+2Perubahan bintang dalam 7 hari terakhir - #19
Executable mandiri Whisper & Faster-Whisper bagi mereka yang tidak ingin repot dengan Python.
★ 3.171+2Perubahan bintang dalam 7 hari terakhir - #20
[AutoArk] GPA (General Purpose Audio) dapat melakukan ASR, TTS, dan konversi suara dengan satu model kecil!
★ 3.061+164Perubahan bintang dalam 7 hari terakhir - #21
Antarmuka grafis faster_whisper dengan PySide6
★ 2.995+4Perubahan bintang dalam 7 hari terakhir - #22★ 2.864+0Perubahan bintang dalam 7 hari terakhir
- #23
Pengenalan Ucapan Otomatis Multibahasa dengan stempel waktu tingkat kata dan tingkat kepercayaan.
★ 2.842+1Perubahan bintang dalam 7 hari terakhir - #24
Model audio CoreML mutakhir di aplikasi Anda — teks-ke-suara, suara-ke-teks, deteksi aktivitas suara, dan diarisasi pembicara. Dalam Swift, didukung oleh open source SOTA.
★ 2.723+13Perubahan bintang dalam 7 hari terakhir - #25
🐸STT - Toolkit deep learning untuk Speech-to-Text. Melatih dan menerapkan model STT tidak pernah semudah ini.
★ 2.606+1Perubahan bintang dalam 7 hari terakhir - #26
Ekstraksi cepat konten audio dan video, disusun menjadi catatan markdown terstruktur
★ 2.483+7Perubahan bintang dalam 7 hari terakhir - #27
Mesin inferensi C++ murni yang lengkap untuk model audio, didukung oleh ggml. Mendukung TTS, STT, VAD, konversi suara, pembuatan musik, dan lainnya, dengan performa yang sangat dioptimalkan. Tanpa dependensi Python.
★ 2.214+115Perubahan bintang dalam 7 hari terakhir - #28
Model ASR kelas industri sumber terbuka yang mendukung bahasa Mandarin, dialek Tiongkok, dan bahasa Inggris, mencapai SOTA baru pada tolok ukur ASR Mandarin publik, sekaligus menawarkan kemampuan pengenalan lirik lagu yang luar biasa.
★ 1.975+2Perubahan bintang dalam 7 hari terakhir - #29
Inferensi speech-to-text ggml untuk 16+ keluarga model
★ 1.872+19Perubahan bintang dalam 7 hari terakhir - #30
Framework AI+IoT generasi berikutnya untuk T2/T3/T5AI/ESP32/dan lainnya – Integrasi perangkat keras IoT dan AI Agent yang cepat
★ 1.816+5Perubahan bintang dalam 7 hari terakhir