Eigentümer · kyutai-labs
kyutai-labs
Erfasste Open-Source-Repos von kyutai-labs, sortiert nach Sternen.
5 Repos
- #1
Moshi ist ein Sprach-Text-Grundlagenmodell und ein Vollduplex-Sprachdialog-Framework. Es verwendet Mimi, einen hochmodernen, streamenden neuronalen Audiocodec.
★ 11.002+0Sterne-Änderung der letzten 7 Tage - #2
Ein TTS, das in Ihre CPU (und Tasche) passt
★ 9.335+0Sterne-Änderung der letzten 7 Tage - #3
Speech-To-Text- und Text-To-Speech-Modelle von Kyutai basierend auf dem Delayed-Streams-Modeling-Framework.
★ 3.021+0Sterne-Änderung der letzten 7 Tage - #4
Hibiki ist ein Modell für die Streaming-Sprachübersetzung (auch bekannt als Simultandübersetzung). Im Gegensatz zur Offline-Übersetzung, bei der man auf das Ende der Quelläußerung wartet, passt Hibiki seinen Fluss an, um gerade genug Kontext zu sammeln, um eine korrekte Übersetzung in Echtzeit, Block für Block, zu erzeugen.
★ 1.512+0Sterne-Änderung der letzten 7 Tage - #5★ 1.508+0Sterne-Änderung der letzten 7 Tage