Lompat ke konten utama
buildradar
Sign in
Topik · speech

speech

Repositori open source terpantau bertanda speech, diurutkan berdasarkan bintang.

74 repositori
  • MARS5-TTS@Camb-ai

    Model ucapan (TTS) MARS5 dari CAMB.AI

    2.818+1Perubahan bintang dalam 7 hari terakhir
  • speechgpt@hahahumble

    💬 SpeechGPT adalah aplikasi web yang memungkinkan Anda bercakap-cakap dengan ChatGPT.

    2.750-1Perubahan bintang dalam 7 hari terakhir
  • gTTS@pndurette

    Pustaka Python dan alat CLI untuk berinteraksi dengan API text-to-speech Google Translate

    2.628+0Perubahan bintang dalam 7 hari terakhir
  • ten-vad@TEN-framework

    Voice Activity Detector (VAD): latensi rendah, performa tinggi, dan ringan

    2.256+7Perubahan bintang dalam 7 hari terakhir
  • IMS-Toucan@DigitalPhonetics

    Text-to-Speech yang cepat dan dapat dikontrol untuk lebih dari 7000 bahasa!

    2.207-1Perubahan bintang dalam 7 hari terakhir
  • soloud@jarikomppa

    Mesin audio yang gratis, mudah, dan portabel untuk game

    2.170+3Perubahan bintang dalam 7 hari terakhir
  • openai-edge-tts@travisvn

    Endpoint API text-to-speech gratis dan berkualitas tinggi sebagai pengganti OpenAI, Azure, atau ElevenLabs

    2.075+5Perubahan bintang dalam 7 hari terakhir
  • Praat: Melakukan Fonetik Dengan Komputer

    1.970+1Perubahan bintang dalam 7 hari terakhir
  • julius@julius-speech

    Mesin Pengenalan Ucapan Kontinu Kosakata Besar Sumber Terbuka

    1.935+1Perubahan bintang dalam 7 hari terakhir
  • Daftar komunitas startup yang bekerja dengan AI dalam teknologi audio dan musik

    1.769+1Perubahan bintang dalam 7 hari terakhir
  • SALMONN@bytedance

    Keluarga SALMONN: Sekumpulan multi-modal LLM tingkat lanjut

    1.521+3Perubahan bintang dalam 7 hari terakhir
  • voicefixer@haoheliu

    Pemulihan Ucapan Umum

    1.375+0Perubahan bintang dalam 7 hari terakhir
  • CrisperWhisper@nyrahealth

    Transkripsi yang Dapat Dikontrol. Verbatim (setiap kata, pengisi, jeda, gagap, suara vokal), atau yang dimaksudkan (apa yang ingin dikatakan pembicara, dioptimalkan untuk keterbacaan) dengan stempel waktu tingkat kata.

    1.371+13Perubahan bintang dalam 7 hari terakhir
  • nlp-paper@DengBoCong

    Makalah terkait di bidang pemrosesan bahasa alami (dengan catatan bacaan), replikasi model, dan pemrosesan data (kode berisi versi TensorFlow dan PyTorch)

    1.333+1Perubahan bintang dalam 7 hari terakhir
  • MTools@HG-ha

    MTools adalah aplikasi desktop multifungsi yang kuat, mengintegrasikan pemrosesan audio/video, pengeditan gambar, operasi teks, dan alat encoding, dengan fitur AI yang ditingkatkan. Dirancang untuk menyederhanakan alur kerja Anda dan meningkatkan produktivitas.

    1.305+5Perubahan bintang dalam 7 hari terakhir
  • StreamSpeech@ictnlp

    StreamSpeech adalah model "All in One" yang mulus untuk pengenalan suara offline dan simultan, terjemahan suara, serta sintesis suara.

    1.288+0Perubahan bintang dalam 7 hari terakhir
  • Deep-Learning-Experiments@roatienza

    Video, catatan, dan eksperimen untuk memahami deep learning.

    1.198+0Perubahan bintang dalam 7 hari terakhir
  • lhotse@lhotse-speech

    Alat untuk menangani data multimodal dalam proyek machine learning.

    1.149-1Perubahan bintang dalam 7 hari terakhir
  • conformer@sooftware

    Implementasi PyTorch [Tidak Resmi] untuk "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)

    1.132+1Perubahan bintang dalam 7 hari terakhir
  • pykaldi@pykaldi

    Pembungkus Python untuk Kaldi

    1.040+1Perubahan bintang dalam 7 hari terakhir
  • FireRedTTS@FireRedTeam

    Sistem TTS Foundation open-source yang didukung oleh LLM

    920+1Perubahan bintang dalam 7 hari terakhir
  • inaSpeechSegmenter@ina-foss

    Toolkit segmentasi audio berbasis CNN. Memungkinkan pendeteksian ucapan, musik, kebisingan, dan jenis kelamin pembicara. Dirancang untuk studi kesetaraan gender skala besar berdasarkan waktu bicara per gender.

    910+1Perubahan bintang dalam 7 hari terakhir
  • diffwave@lmnt-com

    DiffWave adalah vocoder neural dan synthesizer gelombang yang cepat serta berkualitas tinggi.

    885+0Perubahan bintang dalam 7 hari terakhir
  • AnyGPT@OpenMOSS

    Kode untuk "AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling"

    881-1Perubahan bintang dalam 7 hari terakhir
  • PPASR@yeyupiaoling

    Implementasi pengenalan suara Mandarin end-to-end berbasis PaddlePaddle, dari tingkat dasar hingga praktis, contoh pemula yang super mudah dan proyek perusahaan yang sangat berguna. Mendukung model DeepSpeech2, Conformer, dan Squeezeformer yang paling populer saat ini

    870-1Perubahan bintang dalam 7 hari terakhir
  • Voxtral ASR & TTS berjalan secara native dan di dalam browser. Implementasi Rust dari ASR / TTS real-time mini Voxtral milik Mistral menggunakan framework Burn ML

    819+2Perubahan bintang dalam 7 hari terakhir
  • AlphaAvatar@AlphaAvatar

    Omni Avatar interaktif waktu nyata yang dibangun di atas LiveKit, memungkinkan Anda mengintegrasikan komponen Avatar sumber terbuka secara mulus (model waktu nyata, visual, suara, memori, pencarian, dll.).

    813+4Perubahan bintang dalam 7 hari terakhir
  • XR3Player@goxr3plus

    🎧 🎼 Pemutar Media JavaFX PALING CANGGIH

    771+0Perubahan bintang dalam 7 hari terakhir
  • cboard@cboard-org

    Sistem Komunikasi Augmentatif dan Alternatif (AAC) dengan text-to-speech untuk browser

    755+9Perubahan bintang dalam 7 hari terakhir
  • allosaurus@xinjli

    Allosaurus adalah pengenal phone universal pra-latih untuk lebih dari 2000 bahasa

    746+4Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik