speech-to-text
Repositori open source terpantau bertanda speech-to-text, diurutkan berdasarkan bintang.
- #121
Kumpulan sumber daya tentang penerapan Large Language Models (LLMs) dalam Audio AI.
★ 738+0Perubahan bintang dalam 7 hari terakhir - #122
Kerangka kerja Automatic Speech Recognition (ASR) streaming dan non-streaming yang diimplementasikan dengan PyTorch, kompatibel dengan pengenalan online dan offline, saat ini mendukung model Conformer, Squeezeformer, dan DeepSpeech2, serta berbagai metode augmentasi data.
★ 727+0Perubahan bintang dalam 7 hari terakhir - #123
Rapida adalah platform orkestrasi AI suara end-to-end sumber terbuka untuk membangun agen suara percakapan real-time dengan streaming audio, STT, TTS, VAD, integrasi multi-saluran, manajemen status agen, dan observabilitas.
★ 723+4Perubahan bintang dalam 7 hari terakhir - #124★ 719+0Perubahan bintang dalam 7 hari terakhir
- #125★ 718-1Perubahan bintang dalam 7 hari terakhir
- #126
Contoh API suara
★ 707-1Perubahan bintang dalam 7 hari terakhir - #127
framework tolok ukur speech to text
★ 698+1Perubahan bintang dalam 7 hari terakhir - #128
Aplikasi desktop lokal gratis untuk mengekstrak subtitle (SRT) dari video dan menerjemahkannya ke bahasa apa pun — penggunaan tak terbatas, tanpa pendaftaran, tanpa cloud.
★ 688+15Perubahan bintang dalam 7 hari terakhir - #129
Pengenalan Ucapan untuk proyek React Native Expo
★ 678+4Perubahan bintang dalam 7 hari terakhir - #130
Mentranskripsikan dan menerjemahkan suara ke file LRC menggunakan Whisper dan LLM (GPT, Claude, dll).
★ 678+0Perubahan bintang dalam 7 hari terakhir - #131★ 671+0Perubahan bintang dalam 7 hari terakhir
- #132
:speech_balloon: /so.nus/ STT (speech to text) untuk Node dengan deteksi kata kunci offline.
★ 638+0Perubahan bintang dalam 7 hari terakhir - #133
Membuat perangkat lunak untuk pemantauan otomatis dalam pengawasan ujian online
★ 634-1Perubahan bintang dalam 7 hari terakhir - #134
Aplikasi suara yang cepat, privat, dan berbasis lokal untuk Mac Apple Silicon — dikte, transkripsi file/media, perekaman rapat, Transformasi, dan CLI otomatisasi publik. Gratis dan sumber terbuka.
★ 630+14Perubahan bintang dalam 7 hari terakhir - #135
Aplikasi dikte bilah menu macOS asli yang menggunakan ucapan-ke-teks lokal dengan WhisperKit
★ 620+1Perubahan bintang dalam 7 hari terakhir - #136
Pusat runtime C++ ggml untuk model ASR dan TTS multibahasa: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, dll., ditambah penyelarasan paksa universal, dan lainnya
★ 614+11Perubahan bintang dalam 7 hari terakhir - #137
Transkripsi waktu nyata menggunakan faster-whisper
★ 614+0Perubahan bintang dalam 7 hari terakhir - #138
IME (papan tombol) suara on-device sumber terbuka untuk Android yang menggunakan pustaka Vosk.
★ 582+3Perubahan bintang dalam 7 hari terakhir - #139
Pustaka Python untuk menyelesaikan reCAPTCHA v2 dan v3 dengan Playwright
★ 579+3Perubahan bintang dalam 7 hari terakhir - #140
Pipeline Speech-to-Text yang dioptimalkan untuk Model Whisper yang mendukung berbagai Inference Engine
★ 578+0Perubahan bintang dalam 7 hari terakhir - #141
Bahasa pemrograman node modular, pembuat program, sistem animasi, toolkit, router, dan debugger yang dibuat untuk VRChat
★ 563+0Perubahan bintang dalam 7 hari terakhir - #142
🗣 Overlay yang mendapatkan izin suara pengguna dan masukan sebagai teks dalam UI yang dapat disesuaikan
★ 557+1Perubahan bintang dalam 7 hari terakhir - #143
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 547+22Perubahan bintang dalam 7 hari terakhir - #144
Daftar API STT pengenalan suara bahasa Korea dan tolok ukur kinerjanya masing-masing.
★ 547+0Perubahan bintang dalam 7 hari terakhir - #145
Dikte suara lokal yang sangat cepat, gratis, dan mengutamakan privasi untuk macOS dengan transkripsi pada perangkat
★ 544+11Perubahan bintang dalam 7 hari terakhir - #146
Pustaka pengenalan suara yang berjalan di browser berkat build WebAssembly dari Vosk
★ 529+1Perubahan bintang dalam 7 hari terakhir - #147
Phonetisaurus G2P
★ 521-1Perubahan bintang dalam 7 hari terakhir - #148
Alat ini menggunakan AI untuk mengevaluasi pelafalan Anda.
★ 518+1Perubahan bintang dalam 7 hari terakhir - #149
Perangkat lunak transkripsi audio dan video open source
★ 515+0Perubahan bintang dalam 7 hari terakhir - #150
Server inferensi bahasa yang sangat dioptimalkan, sumber terbuka, lokal, dan mandiri yang mendukung ASR/STT, TTS, dan LLM melalui WebRTC, REST, dan WS
★ 512+0Perubahan bintang dalam 7 hari terakhir