OpenMOSS
Erfasste Open-Source-Repos von OpenMOSS, sortiert nach Sternen.
- #1
Ein von der Fudan-Universität entwickeltes, Open-Source-gestütztes Konversationssprachmodell mit Werkzeugunterstützung
★ 12.234+11Sterne-Änderung der letzten 7 Tage - #2
MOSS-TTS-Nano ist ein Open-Source-Modell zur mehrsprachigen Miniatur-Sprachgenerierung von MOSI.AI und dem OpenMOSS-Team. Mit nur 0,1 Milliarden Parametern ist es für die Echtzeit-Sprachgenerierung konzipiert, läuft direkt auf der CPU ohne GPU und hält den Bereitstellungsstack einfach genug für lokale Demos, Web-Serving und die Integration in leichtgewichtige Produkte.
★ 4.279+51Sterne-Änderung der letzten 7 Tage - #3
Die MOSS‑TTS-Familie ist eine Open-Source-Modellfamilie zur Sprach- und Klangerzeugung von MOSI.AI und dem OpenMOSS-Team. Sie wurde für Szenarien in der realen Welt mit hoher Wiedergabetreue, starkem Ausdruck und hoher Komplexität entwickelt und deckt stabile Langform-Sprache, Dialoge mit mehreren Sprechern, Sprach-/Charakterdesign, Umgebungs-Soundeffekte und Echtzeit-Streaming-TTS ab.
★ 4.056+24Sterne-Änderung der letzten 7 Tage - #4
MOSS-Transcribe-Diarize 0.9B ist ein Open-Source-SOTA-End-to-End-Audioverständnismodell für die Transkription von Langzeit-Multi-Sprecher-Inhalten, Sprechertrennung (Diarization), Zeitstempel und akustische Ereigniserkennung.
★ 1.778+158Sterne-Änderung der letzten 7 Tage - #5
MOSS-TTSD is ein Modell zur Generierung gesprochener Dialoge, das für die ausdrucksstarke Synthese mehrerer Sprecher entwickelt wurde. Es bietet Long-Context-Modellierung, flexible Sprechersteuerung und mehrsprachige Unterstützung und ermöglicht gleichzeitig Zero-Shot-Stimmenklonen aus kurzen Audio-Referenzen.
★ 1.394+0Sterne-Änderung der letzten 7 Tage - #6
Eine kuratierte, kontinuierlich aktualisierte Leseliste, Paper-Blogs und Ressourcen für World Action Models (WAMs) in der embodied AI.
★ 1.358+47Sterne-Änderung der letzten 7 Tage - #7★ 1.108+5Sterne-Änderung der letzten 7 Tage
- #8★ 882+0Sterne-Änderung der letzten 7 Tage
- #9
MOSS-Audio ist ein Open-Source-Grundlagenmodell für einheitliches Audioverständnis, das Sprache, Klänge, Musik, Beschriftung, Q&A und Reasoning in realen Szenarien ermöglicht.
★ 654+8Sterne-Änderung der letzten 7 Tage