Lompat ke konten utama
buildradar
Sign in
Topik · asr

asr

Repositori open source terpantau bertanda asr, diurutkan berdasarkan bintang.

85 repositori
  • sherpa-ncnn@k2-fsa

    Pengenalan suara waktu nyata dan deteksi aktivitas suara (VAD) menggunakan Kaldi generasi berikutnya dengan ncnn tanpa koneksi Internet. Mendukung iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, dll.

    1.777-2Perubahan bintang dalam 7 hari terakhir
  • bailing@wwbin2017

    Bailing adalah bot dialog suara yang mirip dengan GPT-4o, diimplementasikan melalui ASR+LLM+TTS, mengintegrasikan model besar yang luar biasa seperti DeepSeek R1, terhubung ke openClaw, asisten suara pribadi sejati, latensi serendah 800ms, dapat berjalan di spesifikasi rendah seperti Mac, dan mendukung interupsi.

    1.759+2Perubahan bintang dalam 7 hari terakhir
  • dsnote@mkiol

    Aplikasi Linux Speech Note. Mencatat, membaca, dan menerjemahkan dengan Speech to Text, Text to Speech, dan terjemahan mesin secara luring.

    1.622+13Perubahan bintang dalam 7 hari terakhir
  • video-analyzer@byjlw

    Menganalisis video menggunakan LLM, Computer Vision, dan Automatic Speech Recognition

    1.570+11Perubahan bintang dalam 7 hari terakhir
  • amical@amicalhq

    🎙️ Aplikasi Dikte AI - Sumber Terbuka dan Utamakan Lokal ⚡ Ketik 3x lebih cepat, tanpa perlu keyboard. 🆓 Didukung oleh model sumber terbuka, bekerja secara offline, cepat dan akurat.

    1.520+14Perubahan bintang dalam 7 hari terakhir
  • Fun-ASR@QwenAudio

    Keluarga model ASR berbasis LLM open-source untuk bahasa Mandarin, dialek, aksen, dan ucapan multilingual, lengkap dengan runtime FunASR, vLLM, streaming, dan llama.cpp.

    1.512+14Perubahan bintang dalam 7 hari terakhir
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge adalah proyek yang dikembangkan di sekitar model generasi TTS, mengimplementasikan API Server dan WebUI berbasis Gradio.

    1.418+2Perubahan bintang dalam 7 hari terakhir
  • SoniTranslate@R3gm

    Terjemahan Tersinkronisasi untuk Video. Sulih suara video

    1.413+3Perubahan bintang dalam 7 hari terakhir
  • CrisperWhisper@nyrahealth

    Transkripsi yang Dapat Dikontrol. Verbatim (setiap kata, pengisi, jeda, gagap, suara vokal), atau yang dimaksudkan (apa yang ingin dikatakan pembicara, dioptimalkan untuk keterbacaan) dengan stempel waktu tingkat kata.

    1.371+21Perubahan bintang dalam 7 hari terakhir
  • voicemode@mbailey

    Percakapan suara alami dengan Claude Code

    1.347+6Perubahan bintang dalam 7 hari terakhir
  • VideoChat@Henry-23

    Digital human interaktif suara secara real-time, dengan tampilan dan suara yang dapat disesuaikan, mendukung kloning suara, serta latensi dialog serendah 3 detik.

    1.303+0Perubahan bintang dalam 7 hari terakhir
  • StreamSpeech@ictnlp

    StreamSpeech adalah model "All in One" yang mulus untuk pengenalan suara offline dan simultan, terjemahan suara, serta sintesis suara.

    1.288+1Perubahan bintang dalam 7 hari terakhir
  • vosk-server@alphacep

    Server pengenalan suara WebSocket, gRPC, dan WebRTC berdasarkan pustaka Vosk dan Kaldi

    1.262+2Perubahan bintang dalam 7 hari terakhir
  • Whisper-Finetune@yeyupiaoling

    Lakukan fine-tune pada model pengenalan suara Whisper untuk mendukung pelatihan tanpa data penanda waktu, pelatihan dengan data penanda waktu, dan pelatihan tanpa data suara. Mempercepat inferensi dan mendukung deployment di Web, desktop Windows, serta Android

    1.222-1Perubahan bintang dalam 7 hari terakhir
  • speech-swift@soniqo

    Toolkit bicara AI untuk Apple Silicon — ASR, TTS, speech-to-speech, VAD, dan diarisasi yang didukung oleh MLX dan CoreML

    1.161+11Perubahan bintang dalam 7 hari terakhir
  • Mega-ASR@xzf-thu

    Fondasi ASR pertama yang dibangun untuk dunia nyata - 7 kondisi akustik atom, 54 skenario gabungan, 2,6 juta sampel, dan peningkatan hingga ~30% dibandingkan SOTA di saat model lain gagal. **Anda akan kembali ke MEGA-ASR setelah yang lain gagal di lapangan. ⭐**

    1.136+3Perubahan bintang dalam 7 hari terakhir
  • conformer@sooftware

    Implementasi PyTorch [Tidak Resmi] untuk "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)

    1.132+1Perubahan bintang dalam 7 hari terakhir
  • sglang-omni@sgl-project

    SGLang-Omni mendukung penyajian berkinerja tinggi untuk model TTS, ASR, ucapan, dan omni.

    1.100+107Perubahan bintang dalam 7 hari terakhir
  • Pengenalan suara offline untuk Android menggunakan pustaka Vosk.

    1.056+0Perubahan bintang dalam 7 hari terakhir
  • violin@shang-zhu

    Keterampilan Terjemahan Video Sumber Terbuka

    1.055+4Perubahan bintang dalam 7 hari terakhir
  • murmure@Kieirra

    Speech-to-Text lintas platform yang sepenuhnya lokal, privat, dengan pemrosesan pasca LLM

    1.051+13Perubahan bintang dalam 7 hari terakhir
  • pykaldi@pykaldi

    Pembungkus Python untuk Kaldi

    1.040+0Perubahan bintang dalam 7 hari terakhir
  • sherpa@k2-fsa

    Kerangka kerja server Speech-to-text dengan Kaldi generasi berikutnya

    982+2Perubahan bintang dalam 7 hari terakhir
  • espresso@freewym

    Espresso: Toolkit Pengenalan Ucapan Neural End-to-End yang Cepat.

    939+0Perubahan bintang dalam 7 hari terakhir
  • vocotype-cli@233stone

    VocoType adalah alat input suara lokal yang menjaga privasi, memungkinkan konversi suara ke teks secara real-time dan input otomatis ke aplikasi saat ini melalui pintasan keyboard. Mendukung MCP suara-ke-teks, optimasi teks AI, kamus penggantian kustom, transkripsi rekaman video, dan lainnya untuk input suara yang lebih efisien dan aman.

    924+2Perubahan bintang dalam 7 hari terakhir
  • whisper.api@innovatorved

    Proyek ini menyediakan API dengan dukungan akses level pengguna untuk mentranskripsikan suara ke teks menggunakan model Whisper ASR yang telah disempurnakan dan diproses.

    914+0Perubahan bintang dalam 7 hari terakhir
  • SmartJavaAI@geekwenjie

    Toolbox algoritma AI offline gratis untuk Java, mendukung pengenalan wajah, deteksi liveness, pengenalan ekspresi, deteksi objek, segmentasi instans, deteksi pejalan kaki, pengenalan teks OCR, pengenalan pelat nomor, pengenalan tabel, ASR+TTS, terjemahan mesin, dan lainnya. Dapat digunakan melalui Maven. Mendukung PyTorch, Tensorflow, serta telah mengintegrasikan model utama seperti Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5), dan Whisper.

    907+1Perubahan bintang dalam 7 hari terakhir
  • Easy-Voice-Toolkit@Spr-Aachen

    Toolkit yang ramah pengguna untuk pengenalan/transkripsi/konversi suara, dll.

    873+0Perubahan bintang dalam 7 hari terakhir
  • PPASR@yeyupiaoling

    Implementasi pengenalan suara Mandarin end-to-end berbasis PaddlePaddle, dari tingkat dasar hingga praktis, contoh pemula yang super mudah dan proyek perusahaan yang sangat berguna. Mendukung model DeepSpeech2, Conformer, dan Squeezeformer yang paling populer saat ini

    870+0Perubahan bintang dalam 7 hari terakhir
  • GLM-ASR@zai-org

    GLM-ASR-Nano: Model pengenalan ucapan sumber terbuka yang tangguh dengan 1,5 miliar parameter

    854+4Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik