オーナー · kyutai-labs
kyutai-labs
kyutai-labs の追跡中のオープンソースリポジトリを、スター数順に表示します。
5 件のリポジトリ
- #1
Moshiは、音声-テキストの基盤モデルおよび全二重音声対話フレームワークです。最先端のストリーミングニューラルオーディオコーデックであるMimiを使用しています。
★ 11,002+0直近 7 日のスター増減 - #2
CPU(そしてポケット)に収まる TTS。
★ 9,335+0直近 7 日のスター増減 - #3
Delayed Streams Modelingフレームワークに基づく、Kyutaiの音声認識(Speech-To-Text)および音声合成(Text-To-Speech)モデル。
★ 3,021+0直近 7 日のスター増減 - #4
Hibikiは、音声のストリーミング翻訳(同時通訳とも呼ばれる)のためのモデルです。発話の終了を待ってから翻訳を開始するオフライン翻訳とは異なり、Hibikiはフローを調整して、リアルタイムでチャンクごとに正しい翻訳を生成するのに十分なコンテキストを蓄積します。
★ 1,512+0直近 7 日のスター増減 - #5★ 1,508+0直近 7 日のスター増減