メインコンテンツへスキップ
buildradar
Sign in
トピック · multimodal-large-language-models

multimodal-large-language-models

multimodal-large-language-models がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
32
総スター数
66,902
平均スター数
2,091
シェア
0.00%

multimodal-large-language-models と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、multimodal-large-language-models がタグ付けされたリポジトリ。

直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。

  • :sparkles::sparkles:マルチモーダル大規模言語モデルの最新の進歩

    17,996+2直近 7 日のスター増減
  • MobileAgent@X-PLUG

    Mobile-Agent: 強力なGUIエージェントファミリー

    9,157+9直近 7 日のスター増減
  • star-vector@joanrod

    StarVectorは、ベクター化をコード生成タスクに変換するSVG生成のための基盤モデルです。ビジョン・言語モデリングアーキテクチャを使用し、StarVectorは視覚的およびテキストの入力を処理することで、驚異的な精度で高品質なSVGコードを生成します。

    4,567+6直近 7 日のスター増減
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni は、Llama-3.1-8B-Instruct を基に構築された低レイテンシかつ高品質なエンドツーエンドの音声インタラクションモデルで、GPT-4o レベルの音声機能の実現を目指しています。

    3,147+1直近 7 日のスター増減
  • VideoPipe@sherlockchou86

    CV モデルと mLLM をベースにしたクロスプラットフォームの動画構造化(動画分析)フレームワーク

    2,933+0直近 7 日のスター増減
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5:GPT-4oレベルのリアルタイム視覚・音声インタラクションに向けて

    2,532-1直近 7 日のスター増減
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: 文書理解のためのモジュール式マルチモーダル大規模言語モデル

    2,411+0直近 7 日のスター増減
  • cambrian@cambrian-mllm

    Cambrian-1 は、ビジョン中心の設計を採用したマルチモーダル LLM のファミリーです。

    2,014+1直近 7 日のスター増減
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] テキストから画像への拡散モデルの習得:マルチモーダルLLMによる再キャプション、プランニング、生成 (RPG)

    1,844+0直近 7 日のスター増減
  • Seed1.5-VL@ByteDance-Seed

    汎用マルチモーダル理解と推論の発展を目的として設計されたビジョン言語基盤モデル Seed1.5-VL。60の公開ベンチマークのうち38で最先端のパフォーマンスを達成。

    1,586+0直近 7 日のスター増減
  • Ovis@ATH-MaaS

    視覚的埋め込みとテキスト的埋め込みを構造的に整合させるように設計された、新規のマルチモーダル大規模言語モデル (MLLM) アーキテクチャ

    1,514+2直近 7 日のスター増減
  • 素晴らしい統合マルチモーダルモデルの一覧

    1,314+1直近 7 日のスター増減
  • VideoChat@Henry-23

    リアルタイム音声対話型デジタルヒューマン。外見や音声のカスタマイズ、音声クローンに対応し、初期応答遅延は 3 秒未満。

    1,303-1直近 7 日のスター増減
  • Audio Flamingo の PyTorch 実装:高度な音声理解言語モデルのシリーズ

    1,184+2直近 7 日のスター増減
  • SLAM-LLM@X-LANCE

    大規模言語モデルを用いた音声、言語、オーディオ、音楽処理のためのフレームワーク

    1,058+2直近 7 日のスター増減
  • Bunny@BAAI-DCAI

    軽量なマルチモーダルモデルのファミリー。

    1,053+0直近 7 日のスター増減
  • Awesome-MCoT@yaotingwangofficial

    マルチモーダル思考連鎖推論:包括的なサーベイ

    1,025+2直近 7 日のスター増減
  • 医用画像におけるマルチモーダル学習の応用に関するリソース集。

    975+1直近 7 日のスター増減
  • NEO@EvolvingLMMs-Lab

    NEOシリーズ:ファースト・プリンシプルに基づくネイティブ視覚言語モデル

    888+0直近 7 日のスター増減
  • Video-MME@MME-Benchmarks

    ✨✨[CVPR 2025] Video-MME:動画分析におけるマルチモーダルLLMの初の包括的評価ベンチマーク

    791+2直近 7 日のスター増減
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: スキルの利用方法をプラグインして学習する大規模言語およびビジョンアシスタント

    770+0直近 7 日のスター増減
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat: 長い動画理解のための高密度トークンからスパースメモリへの変換

    706+0直近 7 日のスター増減
  • unicom@deepglint

    大規模視覚表現モデル

    702+0直近 7 日のスター増減
  • MPP-LLaVA@Coobiw

    個人プロジェクト: MPP-Qwen14B & MPP-Qwen-Next(Qwen-LMに基づくマルチモーダルパイプライン並列化)。[動画/画像/複数画像]の{sft/会話}をサポート。貧困に想像力を制限されないようにしよう!RTX3090/4090 24GBで独自の8B/14B LLaVA形式のMLLMをトレーニング。

    687+0直近 7 日のスター増減
  • OmniVinci@NVlabs

    OmniVinci は、視覚、音声、言語を統合理解するためのオムニモーダル LLM です。

    678+0直近 7 日のスター増減
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: マルチモーダル大規模言語モデルのためのハルシネーション修正

    650+1直近 7 日のスター増減
  • Liquid@FoundationVision

    (IJCV 採択)Liquid:スケーラブルで統合されたマルチモーダルジェネレータとしての言語モデル

    640+0直近 7 日のスター増減
  • LLaVA-Mini@ictnlp

    LLaVA-Miniは、画像、高解像度画像、動画の理解を効率的にサポートする統合型の大規模マルチモーダルモデル(LMM)です。

    577+0直近 7 日のスター増減
  • Vitron@SkyworkAI

    NeurIPS 2024 論文: 理解、生成、セグメンテーション、編集のための統合ピクセルレベル Vision LLM

    577+1直近 7 日のスター増減
  • cambrian-s@cambrian-mllm

    Cambrian-S: 動画における空間的超感覚に向けて

    567-1直近 7 日のスター増減
← トピック一覧に戻る