メインコンテンツへスキップ
buildradar
Sign in
トピック · mllm

mllm

mllm がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
36
総スター数
92,155
平均スター数
2,560
シェア
0.00%

mllm と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、mllm がタグ付けされたリポジトリ。

  • SenseNova-Vision@OpenSenseNova

    統一されたマルチモーダル生成としてのビジョン

    682
  • unilm@microsoft

    タスク、言語、モダリティを横断する大規模な自己教師あり事前学習

    22,203+7直近 7 日のスター増減
  • Agent-S@simular-ai

    Agent S: 人間のようにコンピューターを使用するオープンなエージェンティックフレームワーク

    12,219+17直近 7 日のスター増減
  • MobileAgent@X-PLUG

    Mobile-Agent: 強力なGUIエージェントファミリー

    9,157+9直近 7 日のスター増減
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM: 構造化屋内モデリングのための大規模言語モデルのトレーニング。

    4,726+3直近 7 日のスター増減
  • MagicQuill@robbyant-research

    [CVPR'25] 論文の公式実装 - MagicQuill: インテリジェントな対話型画像編集システム

    3,691+2直近 7 日のスター増減
  • Chain-of-ThoughtプロンプティングからOpenAI o1、DeepSeek-R1まで 🍓

    3,681+3直近 7 日のスター増減
  • NExT-GPT@NExT-GPT

    ICML 2024論文「NExT-GPT: Any-to-Any Multimodal Large Language Model」のコードとモデル。

    3,634-2直近 7 日のスター増減
  • Eagle@NVlabs

    Eagle: データ中心戦略を採用した最先端のVision-Language Models

    3,511+32直近 7 日のスター増減
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive:長期的なストリーミング映像と音声のインタラクションを実現する包括的なマルチモーダルシステム。

    2,925-1直近 7 日のスター増減
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: 文書理解のためのモジュール式マルチモーダル大規模言語モデル

    2,411+0直近 7 日のスター増減
  • cambrian@cambrian-mllm

    Cambrian-1 は、ビジョン中心の設計を採用したマルチモーダル LLM のファミリーです。

    2,014+1直近 7 日のスター増減
  • 🚀🚀🚀 優れた公開YOLO物体検出シリーズプロジェクトと関連する物体検出データセットのコレクション

    1,783-2直近 7 日のスター増減
  • Sa2VA@bytedance

    Pixel-LLMコードベースの公式リポジトリ:Sa2VA (T-PAMI-26)、SAMTok (CVPR-26)、VRT (Arxiv-25)、SaSaSa2VA (LSVOS第1位ソリューション)

    1,666+0直近 7 日のスター増減
  • Rex-Omni@IDEA-Research

    [CVPR2026] Next Point PredictionによるDetect Anything

    1,570+8直近 7 日のスター増減
  • 155種類以上のビジョン・言語モデル(VLM/MLLM)アーキテクチャのキュレーションされたビジュアルカタログ:論文、図解、学習レシピ、データセット、マルチモーダルAIエージェントのリリース年表。

    1,310+2直近 7 日のスター増減
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    民主化されたマルチモーダル学習のための完全オープンなフレームワーク。

    1,195+1直近 7 日のスター増減
  • Bunny@BAAI-DCAI

    軽量なマルチモーダルモデルのファミリー。

    1,053+0直近 7 日のスター増減
  • OpenEMMA@taco-group

    OpenEMMAは、WaymoのEMMAモデルの寛大なライセンスに基づくオープンソースの「再現」です。

    951+0直近 7 日のスター増減
  • NEO@EvolvingLMMs-Lab

    NEOシリーズ:ファースト・プリンシプルに基づくネイティブ視覚言語モデル

    888+0直近 7 日のスター増減
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: インテリジェントな写真レタッチエージェントによる人間の芸術的創造性の解放

    862+1直近 7 日のスター増減
  • Osprey@CircleRadon

    [CVPR2024] 「Osprey: Pixel Understanding with Visual Instruction Tuning」のコード

    843+0直近 7 日のスター増減
  • FSDrive@MIV-XJTU

    「FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving」の公式実装 (NeurIPS 2025 スポットライト採択)

    831+9直近 7 日のスター増減
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent: Agentic Any Image to 4K Super-Resolution. あらゆる画像を完璧な4Kに復元できるインテリジェントなコンピュータービジョンエージェント

    822+2直近 7 日のスター増減
  • 🚀🚀🚀 大規模言語モデル(LLM)、視覚言語モデル(VLM)、視覚言語行動モデル(VLA)、AI生成コンテンツ(AIGC)、および関連するデータセットやアプリケーションに関する素晴らしい公開プロジェクトのコレクション。

    815+1直近 7 日のスター増減
  • シーングラフの生成と応用に関する論文をまとめたリポジトリです。

    724+5直近 7 日のスター増減
  • MPP-LLaVA@Coobiw

    個人プロジェクト: MPP-Qwen14B & MPP-Qwen-Next(Qwen-LMに基づくマルチモーダルパイプライン並列化)。[動画/画像/複数画像]の{sft/会話}をサポート。貧困に想像力を制限されないようにしよう!RTX3090/4090 24GBで独自の8B/14B LLaVA形式のMLLMをトレーニング。

    686+0直近 7 日のスター増減
  • SenseNova-Vision@OpenSenseNova

    統一されたマルチモーダル生成としてのビジョン

    682+25直近 7 日のスター増減
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: マルチモーダル大規模言語モデルのためのハルシネーション修正

    650+1直近 7 日のスター増減
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield: マルチモーダル大規模言語モデルを用いた説明可能な画像改ざん検出とローカライゼーション

    623+2直近 7 日のスター増減
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA: 指示チューニングを用いたマルチモーダル感情認識と推論

    617+0直近 7 日のスター増減
← トピック一覧に戻る