multimodal-llm
multimodal-llm がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
multimodal-llm と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、multimodal-llm がタグ付けされたリポジトリ。
- #1
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,330 - #2
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
中国語、方言、英語をサポートするオープンソースの産業グレード ASR モデル。パブリックな中国語 ASR ベンチマークで新たな SOTA を達成し、優れた歌声の歌詞認識能力も提供します。
★ 1,975+2直近 7 日のスター増減 - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,330+426直近 7 日のスター増減 - #3
155種類以上のビジョン・言語モデル(VLM/MLLM)アーキテクチャのキュレーションされたビジュアルカタログ:論文、図解、学習レシピ、データセット、マルチモーダルAIエージェントのリリース年表。
★ 1,310+2直近 7 日のスター増減 - #4
論文「MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens」の公式実装。
★ 869+0直近 7 日のスター増減 - #5
ASR、VAD、LID、Punc モジュールを備えた SOTA の産業グレードオールインワン ASR システム。FireRedASR2 は中国語(標準語、20以上の方言/アクセント)、英語、コードスイッチング、音声および歌唱の ASR をサポートします。FireRedVAD は 100 以上の言語で音声/歌唱/音楽をサポートします。FireRedLID は 100 以上の言語と 20 以上の中国語方言をサポートします。FireRedPunc は中国語と英語をサポートします。
★ 670+12直近 7 日のスター増減