multimodal-large-language-models
multimodal-large-language-models がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
multimodal-large-language-models と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、multimodal-large-language-models がタグ付けされたリポジトリ。
直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。
- #1
:sparkles::sparkles:マルチモーダル大規模言語モデルの最新の進歩
★ 17,996+2直近 7 日のスター増減 - #2
Mobile-Agent: 強力なGUIエージェントファミリー
★ 9,157+9直近 7 日のスター増減 - #3
StarVectorは、ベクター化をコード生成タスクに変換するSVG生成のための基盤モデルです。ビジョン・言語モデリングアーキテクチャを使用し、StarVectorは視覚的およびテキストの入力を処理することで、驚異的な精度で高品質なSVGコードを生成します。
★ 4,567+6直近 7 日のスター増減 - #4
LLaMA-Omni は、Llama-3.1-8B-Instruct を基に構築された低レイテンシかつ高品質なエンドツーエンドの音声インタラクションモデルで、GPT-4o レベルの音声機能の実現を目指しています。
★ 3,147+1直近 7 日のスター増減 - #5★ 2,933+0直近 7 日のスター増減
- #6★ 2,532-1直近 7 日のスター増減
- #7
mPLUG-DocOwl: 文書理解のためのモジュール式マルチモーダル大規模言語モデル
★ 2,411+0直近 7 日のスター増減 - #8★ 2,014+1直近 7 日のスター増減
- #9
[ICML 2024] テキストから画像への拡散モデルの習得:マルチモーダルLLMによる再キャプション、プランニング、生成 (RPG)
★ 1,844+0直近 7 日のスター増減 - #10
汎用マルチモーダル理解と推論の発展を目的として設計されたビジョン言語基盤モデル Seed1.5-VL。60の公開ベンチマークのうち38で最先端のパフォーマンスを達成。
★ 1,586+0直近 7 日のスター増減 - #11★ 1,514+2直近 7 日のスター増減
- #12
素晴らしい統合マルチモーダルモデルの一覧
★ 1,314+1直近 7 日のスター増減 - #13★ 1,303-1直近 7 日のスター増減
- #14
Audio Flamingo の PyTorch 実装:高度な音声理解言語モデルのシリーズ
★ 1,184+2直近 7 日のスター増減 - #15★ 1,058+2直近 7 日のスター増減
- #16★ 1,053+0直近 7 日のスター増減
- #17
マルチモーダル思考連鎖推論:包括的なサーベイ
★ 1,025+2直近 7 日のスター増減 - #18
医用画像におけるマルチモーダル学習の応用に関するリソース集。
★ 975+1直近 7 日のスター増減 - #19★ 888+0直近 7 日のスター増減
- #20★ 791+2直近 7 日のスター増減
- #21
LLaVA-Plus: スキルの利用方法をプラグインして学習する大規模言語およびビジョンアシスタント
★ 770+0直近 7 日のスター増減 - #22★ 706+0直近 7 日のスター増減
- #23★ 702+0直近 7 日のスター増減
- #24
個人プロジェクト: MPP-Qwen14B & MPP-Qwen-Next(Qwen-LMに基づくマルチモーダルパイプライン並列化)。[動画/画像/複数画像]の{sft/会話}をサポート。貧困に想像力を制限されないようにしよう!RTX3090/4090 24GBで独自の8B/14B LLaVA形式のMLLMをトレーニング。
★ 687+0直近 7 日のスター増減 - #25★ 678+0直近 7 日のスター増減
- #26
✨✨Woodpecker: マルチモーダル大規模言語モデルのためのハルシネーション修正
★ 650+1直近 7 日のスター増減 - #27★ 640+0直近 7 日のスター増減
- #28
LLaVA-Miniは、画像、高解像度画像、動画の理解を効率的にサポートする統合型の大規模マルチモーダルモデル(LMM)です。
★ 577+0直近 7 日のスター増減 - #29★ 577+1直近 7 日のスター増減
- #30
Cambrian-S: 動画における空間的超感覚に向けて
★ 567-1直近 7 日のスター増減