メインコンテンツへスキップ
buildradar
ログイン

jishengpeng/WavTokenizer

@jishengpeng

[ICLR 2025] 音声言語モデリング向け、毎秒40/75トークンを実現するSOTA(最先端)の離散音響コーデックモデル

スター
1,317
フォーク
117
言語
Python
ライセンス
MIT
最終プッシュ
2 年前
Pythontext-to-speechgpt4osemanticcodecdacacousticspeech-representationaudio-representationencodecmusic-representation-learningsoundstreamspeech-language-model

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。