speech
Repositori open source terpantau bertanda speech, diurutkan berdasarkan bintang.
- #31★ 2.818+1Perubahan bintang dalam 7 hari terakhir
- #32
💬 SpeechGPT adalah aplikasi web yang memungkinkan Anda bercakap-cakap dengan ChatGPT.
★ 2.750-1Perubahan bintang dalam 7 hari terakhir - #33
Pustaka Python dan alat CLI untuk berinteraksi dengan API text-to-speech Google Translate
★ 2.628+0Perubahan bintang dalam 7 hari terakhir - #34★ 2.256+7Perubahan bintang dalam 7 hari terakhir
- #35
Text-to-Speech yang cepat dan dapat dikontrol untuk lebih dari 7000 bahasa!
★ 2.207-1Perubahan bintang dalam 7 hari terakhir - #36★ 2.170+3Perubahan bintang dalam 7 hari terakhir
- #37
Endpoint API text-to-speech gratis dan berkualitas tinggi sebagai pengganti OpenAI, Azure, atau ElevenLabs
★ 2.075+5Perubahan bintang dalam 7 hari terakhir - #38
Praat: Melakukan Fonetik Dengan Komputer
★ 1.970+1Perubahan bintang dalam 7 hari terakhir - #39★ 1.935+1Perubahan bintang dalam 7 hari terakhir
- #40
Daftar komunitas startup yang bekerja dengan AI dalam teknologi audio dan musik
★ 1.769+1Perubahan bintang dalam 7 hari terakhir - #41★ 1.521+3Perubahan bintang dalam 7 hari terakhir
- #42
Pemulihan Ucapan Umum
★ 1.375+0Perubahan bintang dalam 7 hari terakhir - #43
Transkripsi yang Dapat Dikontrol. Verbatim (setiap kata, pengisi, jeda, gagap, suara vokal), atau yang dimaksudkan (apa yang ingin dikatakan pembicara, dioptimalkan untuk keterbacaan) dengan stempel waktu tingkat kata.
★ 1.371+13Perubahan bintang dalam 7 hari terakhir - #44
Makalah terkait di bidang pemrosesan bahasa alami (dengan catatan bacaan), replikasi model, dan pemrosesan data (kode berisi versi TensorFlow dan PyTorch)
★ 1.333+1Perubahan bintang dalam 7 hari terakhir - #45
MTools adalah aplikasi desktop multifungsi yang kuat, mengintegrasikan pemrosesan audio/video, pengeditan gambar, operasi teks, dan alat encoding, dengan fitur AI yang ditingkatkan. Dirancang untuk menyederhanakan alur kerja Anda dan meningkatkan produktivitas.
★ 1.305+5Perubahan bintang dalam 7 hari terakhir - #46
StreamSpeech adalah model "All in One" yang mulus untuk pengenalan suara offline dan simultan, terjemahan suara, serta sintesis suara.
★ 1.288+0Perubahan bintang dalam 7 hari terakhir - #47
Video, catatan, dan eksperimen untuk memahami deep learning.
★ 1.198+0Perubahan bintang dalam 7 hari terakhir - #48★ 1.149-1Perubahan bintang dalam 7 hari terakhir
- #49
Implementasi PyTorch [Tidak Resmi] untuk "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)
★ 1.132+1Perubahan bintang dalam 7 hari terakhir - #50★ 1.040+1Perubahan bintang dalam 7 hari terakhir
- #51
Sistem TTS Foundation open-source yang didukung oleh LLM
★ 920+1Perubahan bintang dalam 7 hari terakhir - #52
Toolkit segmentasi audio berbasis CNN. Memungkinkan pendeteksian ucapan, musik, kebisingan, dan jenis kelamin pembicara. Dirancang untuk studi kesetaraan gender skala besar berdasarkan waktu bicara per gender.
★ 910+1Perubahan bintang dalam 7 hari terakhir - #53
DiffWave adalah vocoder neural dan synthesizer gelombang yang cepat serta berkualitas tinggi.
★ 885+0Perubahan bintang dalam 7 hari terakhir - #54★ 881-1Perubahan bintang dalam 7 hari terakhir
- #55
Implementasi pengenalan suara Mandarin end-to-end berbasis PaddlePaddle, dari tingkat dasar hingga praktis, contoh pemula yang super mudah dan proyek perusahaan yang sangat berguna. Mendukung model DeepSpeech2, Conformer, dan Squeezeformer yang paling populer saat ini
★ 870-1Perubahan bintang dalam 7 hari terakhir - #56
Voxtral ASR & TTS berjalan secara native dan di dalam browser. Implementasi Rust dari ASR / TTS real-time mini Voxtral milik Mistral menggunakan framework Burn ML
★ 819+2Perubahan bintang dalam 7 hari terakhir - #57
Omni Avatar interaktif waktu nyata yang dibangun di atas LiveKit, memungkinkan Anda mengintegrasikan komponen Avatar sumber terbuka secara mulus (model waktu nyata, visual, suara, memori, pencarian, dll.).
★ 813+4Perubahan bintang dalam 7 hari terakhir - #58★ 771+0Perubahan bintang dalam 7 hari terakhir
- #59
Sistem Komunikasi Augmentatif dan Alternatif (AAC) dengan text-to-speech untuk browser
★ 755+9Perubahan bintang dalam 7 hari terakhir - #60
Allosaurus adalah pengenal phone universal pra-latih untuk lebih dari 2000 bahasa
★ 746+4Perubahan bintang dalam 7 hari terakhir