speech-to-text
Repositori open source terpantau bertanda speech-to-text, diurutkan berdasarkan bintang.
- #31
Platform AI suara open-source. Alternatif self-hosted untuk Vapi dan Retell. On-premise, BYOK untuk Speech to Speech atau LLM/STT/TTS, dengan pembuat alur kerja visual, dukungan native MCP, dan teleponi.
★ 5.568+0Perubahan bintang dalam 7 hari terakhir - #32
Alat lokalisasi video AI sumber terbuka: otomatis mengunduh video YouTube/Bilibili, mengenali dan menerjemahkan subtitle, kloning suara, mencampur trek audio, dan menyematkan subtitle.
★ 5.404+0Perubahan bintang dalam 7 hari terakhir - #33
Alat pengenalan suara ke teks, alat konversi audio/video ke subtitle yang berjalan secara lokal (offline), mendukung format output json, srt, dan teks biasa.
★ 4.780+0Perubahan bintang dalam 7 hari terakhir - #34
Implementasi JAX dari model Whisper OpenAI untuk peningkatan kecepatan hingga 70x pada TPU.
★ 4.679+0Perubahan bintang dalam 7 hari terakhir - #35★ 4.624+0Perubahan bintang dalam 7 hari terakhir
- #36
Pembuatan subtitle pada perangkat yang terhubung langsung ke DaVinci Resolve, Premiere, dan After Effects.
★ 4.122+0Perubahan bintang dalam 7 hari terakhir - #37
Alat terjemahan audio/suara secara real-time yang ringan dan kuat berbasis Windows LiveCaptions.
★ 3.637+0Perubahan bintang dalam 7 hari terakhir - #38
Tahan tombol, bicara, lepaskan — teks yang telah dipoles AI akan muncul di kursor Anda di aplikasi apa pun. Input suara sumber terbuka untuk macOS & Windows.
★ 3.403+0Perubahan bintang dalam 7 hari terakhir - #39
Layanan API ASR OpenAI Whisper
★ 3.328+0Perubahan bintang dalam 7 hari terakhir - #40
Executable mandiri Whisper & Faster-Whisper bagi mereka yang tidak ingin repot dengan Python.
★ 3.171+0Perubahan bintang dalam 7 hari terakhir - #41
LLaMA-Omni adalah model interaksi ucapan ujung-ke-ujung berlatensi rendah dan berkualitas tinggi yang dibangun di atas Llama-3.1-8B-Instruct, yang bertujuan untuk mencapai kemampuan ucapan setara GPT-4o.
★ 3.147+0Perubahan bintang dalam 7 hari terakhir - #42
Alternatif asisten suara sumber terbuka, lokal, dan self-hosted untuk menyaingi Amazon Echo/Google Home
★ 3.101+0Perubahan bintang dalam 7 hari terakhir - #43
Transkripsikan audio apa pun menjadi teks, terjemahkan, dan edit subtitle 100% secara lokal dengan antarmuka web. Didukung oleh model whisper!
★ 3.068+0Perubahan bintang dalam 7 hari terakhir - #44★ 2.864+0Perubahan bintang dalam 7 hari terakhir
- #45
Pengenalan Ucapan Otomatis Multibahasa dengan stempel waktu tingkat kata dan tingkat kepercayaan.
★ 2.842+0Perubahan bintang dalam 7 hari terakhir - #46
API transkripsi rapat sumber terbuka untuk Google Meet, Microsoft Teams, dan Zoom. Mendukung bot gabung otomatis, transkrip WebSocket waktu nyata, dan server MCP untuk agen AI. Dapat di-host sendiri atau menggunakan SaaS.
★ 2.741+0Perubahan bintang dalam 7 hari terakhir - #47
Model audio CoreML mutakhir di aplikasi Anda — teks-ke-suara, suara-ke-teks, deteksi aktivitas suara, dan diarisasi pembicara. Dalam Swift, didukung oleh open source SOTA.
★ 2.723+0Perubahan bintang dalam 7 hari terakhir - #48
Alternatif Open Source untuk Cluely - Asisten AI yang sangat cepat dan mengutamakan privasi, bekerja lancar saat rapat, wawancara, dan percakapan tanpa diketahui siapa pun. Dibangun dengan Tauri untuk performa natif, hanya 10MB. Sepenuhnya tidak terdeteksi dalam panggilan video, berbagi layar, dan rekaman.
★ 2.619+0Perubahan bintang dalam 7 hari terakhir - #49
🐸STT - Toolkit deep learning untuk Speech-to-Text. Melatih dan menerapkan model STT tidak pernah semudah ini.
★ 2.606+0Perubahan bintang dalam 7 hari terakhir - #50★ 2.537+0Perubahan bintang dalam 7 hari terakhir
- #51
Daftar kurasi untuk Whisper — sistem pengenalan suara berbasis AI sumber terbuka yang dikembangkan oleh OpenAI.
★ 2.375+0Perubahan bintang dalam 7 hari terakhir - #52
Rekam layar Anda, bagikan demo. Gratis dan sumber terbuka, dipercepat GPU, tanpa tanda air, tanpa langganan. Windows, macOS, Linux. Aktif dipelihara.
★ 2.287+0Perubahan bintang dalam 7 hari terakhir - #53
Alternatif Wispr Flow sumber terbuka dan gratis | Alur kerja suara desktop Tiongkok generasi berikutnya yang mengintegrasikan model lokal FunASR dan LLM yang dapat dikonfigurasi
★ 2.278+0Perubahan bintang dalam 7 hari terakhir - #54
Mesin inferensi C++ murni yang lengkap untuk model audio, didukung oleh ggml. Mendukung TTS, STT, VAD, konversi suara, pembuatan musik, dan lainnya, dengan performa yang sangat dioptimalkan. Tanpa dependensi Python.
★ 2.214+0Perubahan bintang dalam 7 hari terakhir - #55
Generator subtitel ASR/STT. Menggunakan Qwen3-ASR, LLM lokal, Whisper, dan TEN-VAD. Tahan bising untuk JAV
★ 2.196+0Perubahan bintang dalam 7 hari terakhir - #56
🎙 Pengenalan ucapan menggunakan kerangka kerja deep learning tensorflow, jaringan saraf sequence-to-sequence
★ 2.173+0Perubahan bintang dalam 7 hari terakhir - #57★ 2.170+0Perubahan bintang dalam 7 hari terakhir
- #58★ 2.046+0Perubahan bintang dalam 7 hari terakhir
- #59★ 1.892+0Perubahan bintang dalam 7 hari terakhir
- #60
Inferensi speech-to-text ggml untuk 16+ keluarga model
★ 1.872+0Perubahan bintang dalam 7 hari terakhir