mllm
mllm がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
mllm と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、mllm がタグ付けされたリポジトリ。
- #1
統一されたマルチモーダル生成としてのビジョン
★ 682
- #1★ 22,203+7直近 7 日のスター増減
- #2★ 12,219+17直近 7 日のスター増減
- #3
Mobile-Agent: 強力なGUIエージェントファミリー
★ 9,157+9直近 7 日のスター増減 - #4★ 4,726+3直近 7 日のスター増減
- #5
[CVPR'25] 論文の公式実装 - MagicQuill: インテリジェントな対話型画像編集システム
★ 3,691+2直近 7 日のスター増減 - #6
Chain-of-ThoughtプロンプティングからOpenAI o1、DeepSeek-R1まで 🍓
★ 3,681+3直近 7 日のスター増減 - #7★ 3,634-2直近 7 日のスター増減
- #8★ 3,511+32直近 7 日のスター増減
- #9
InternLM-XComposer2.5-OmniLive:長期的なストリーミング映像と音声のインタラクションを実現する包括的なマルチモーダルシステム。
★ 2,925-1直近 7 日のスター増減 - #10
mPLUG-DocOwl: 文書理解のためのモジュール式マルチモーダル大規模言語モデル
★ 2,411+0直近 7 日のスター増減 - #11★ 2,014+1直近 7 日のスター増減
- #12
🚀🚀🚀 優れた公開YOLO物体検出シリーズプロジェクトと関連する物体検出データセットのコレクション
★ 1,783-2直近 7 日のスター増減 - #13
Pixel-LLMコードベースの公式リポジトリ:Sa2VA (T-PAMI-26)、SAMTok (CVPR-26)、VRT (Arxiv-25)、SaSaSa2VA (LSVOS第1位ソリューション)
★ 1,666+0直近 7 日のスター増減 - #14★ 1,570+8直近 7 日のスター増減
- #15
155種類以上のビジョン・言語モデル(VLM/MLLM)アーキテクチャのキュレーションされたビジュアルカタログ:論文、図解、学習レシピ、データセット、マルチモーダルAIエージェントのリリース年表。
★ 1,310+2直近 7 日のスター増減 - #16
民主化されたマルチモーダル学習のための完全オープンなフレームワーク。
★ 1,195+1直近 7 日のスター増減 - #17★ 1,053+0直近 7 日のスター増減
- #18★ 951+0直近 7 日のスター増減
- #19★ 888+0直近 7 日のスター増減
- #20★ 862+1直近 7 日のスター増減
- #21★ 843+0直近 7 日のスター増減
- #22
「FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving」の公式実装 (NeurIPS 2025 スポットライト採択)
★ 831+9直近 7 日のスター増減 - #23
[NeurIPS 2025] 4KAgent: Agentic Any Image to 4K Super-Resolution. あらゆる画像を完璧な4Kに復元できるインテリジェントなコンピュータービジョンエージェント
★ 822+2直近 7 日のスター増減 - #24
🚀🚀🚀 大規模言語モデル(LLM)、視覚言語モデル(VLM)、視覚言語行動モデル(VLA)、AI生成コンテンツ(AIGC)、および関連するデータセットやアプリケーションに関する素晴らしい公開プロジェクトのコレクション。
★ 815+1直近 7 日のスター増減 - #25
シーングラフの生成と応用に関する論文をまとめたリポジトリです。
★ 724+5直近 7 日のスター増減 - #26
個人プロジェクト: MPP-Qwen14B & MPP-Qwen-Next(Qwen-LMに基づくマルチモーダルパイプライン並列化)。[動画/画像/複数画像]の{sft/会話}をサポート。貧困に想像力を制限されないようにしよう!RTX3090/4090 24GBで独自の8B/14B LLaVA形式のMLLMをトレーニング。
★ 686+0直近 7 日のスター増減 - #27
統一されたマルチモーダル生成としてのビジョン
★ 682+25直近 7 日のスター増減 - #28
✨✨Woodpecker: マルチモーダル大規模言語モデルのためのハルシネーション修正
★ 650+1直近 7 日のスター増減 - #29
[ICLR 2025] FakeShield: マルチモーダル大規模言語モデルを用いた説明可能な画像改ざん検出とローカライゼーション
★ 623+2直近 7 日のスター増減 - #30
Emotion-LLaMA: 指示チューニングを用いたマルチモーダル感情認識と推論
★ 617+0直近 7 日のスター増減