multimodal
multimodal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #91
テキストのみのLLM向けに設計された優れたビジュアルツールボックスとスキル。マルチ画像理解、画像Q&A、フロントエンドUI復元、GUI自動化などをサポートし、複数の主要なagentへシームレスに統合可能で、クリップボードからの画像貼り付けを直接認識します| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 1,136+18直近 7 日のスター増減 - #92
アプリのためのセルフコーディングシステム — Cordova 用 Alan AI SDK
★ 1,132+0直近 7 日のスター増減 - #93★ 1,108+3直近 7 日のスター増減
- #94
SGLang-Omni は、TTS、ASR、音声、およびオムニモデルの高性能なサービングを実現します。
★ 1,105+130直近 7 日のスター増減 - #95★ 1,088+1直近 7 日のスター増減
- #96★ 1,084+2直近 7 日のスター増減
- #97
テキストのみの DeepSeek Harness エージェント向けのビジョン機能:内蔵の無料ビジョンチェーン(キー不要)とピクセル単位のビジョンツール(Q&A、グラウンディング、クロップ、ピクセル差分、カラー、OCR、SVG トレース、切り抜き、スクリーンショット)。1 コマンドでインストール可能で Python は不要、画像処理を通常のツール呼び出しと同様に実行できます。
★ 1,075+54直近 7 日のスター増減 - #98
[ICLR'24 spotlight] 中国語と英語のマルチモーダル大規模モデルシリーズ(チャットおよびペイント)| CPM基盤モデルに基づく中英バイリンガルマルチモーダル大モデルシリーズ
★ 1,061-1直近 7 日のスター増減 - #99
ビジョン、オーディオ、言語モダリティを横断する汎用表現モデル。論文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0直近 7 日のスター増減 - #100
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: 点群を理解できるように大規模言語モデルを拡張
★ 1,053+2直近 7 日のスター増減 - #101★ 1,031+0直近 7 日のスター増減
- #102
マルチモーダル思考連鎖推論:包括的なサーベイ
★ 1,025+2直近 7 日のスター増減 - #103★ 1,016+37直近 7 日のスター増減
- #104
ベクトル検索と LLM を使用したマルチモーダル AI、RAG、エージェントのリソース、サンプル、チュートリアル
★ 973-1直近 7 日のスター増減 - #105★ 955+60直近 7 日のスター増減
- #106★ 903+4直近 7 日のスター増減
- #107
CVPR 2025 の最も注目すべき影響力のある論文のキュレーションコレクション 🔥 [論文 + コード + デモ]
★ 895+1直近 7 日のスター増減 - #108★ 888+0直近 7 日のスター増減
- #109★ 882+0直近 7 日のスター増減
- #110
⚡ FastAPI、Playwright、およびOpenAI互換のマルチモーダルモデルで構築された、セルフホスト可能なYesCaptcha互換のCAPTCHAソルバー。
★ 869+4直近 7 日のスター増減 - #111
シンプルで統一されたマルチモーダルモデル学習エンジン。軽量で柔軟性があり、大規模なハッキングに対応するように構築されています。
★ 824+0直近 7 日のスター増減 - #112
視覚分野における自己回帰モデルのサーベイ論文。
★ 808+1直近 7 日のスター増減 - #113★ 803+0直近 7 日のスター増減
- #114
Pytorch での対比学習によるモデルのトレーニング
★ 802+0直近 7 日のスター増減 - #115
ローカル監視 + AI ビジョン — データ収集と分析のための構造化イベント出力を備えた、LAN ベースのスマートフォン駆動型 AI 監視フレームワーク
★ 762+4直近 7 日のスター増減 - #116
マルチモーダルおよび大規模言語モデルに関する論文リスト。個人的な必要性から日々のarXivで読んだ論文を記録するためのものです。
★ 761+1直近 7 日のスター増減 - #117
[ECCV 2024] InstructIR: 人間の指示に従う高品質な画像復元 https://huggingface.co/spaces/marcosv/InstructIR
★ 741+0直近 7 日のスター増減 - #118
Paddle のマルチモーダル統合および探索ツールボックス。エンドツーエンドの大規模マルチモーダル事前学習モデルや拡散モデルを含む主流のマルチモーダルタスクをサポート。高性能と柔軟性を備えています。
★ 723-1直近 7 日のスター増減 - #119★ 689+1直近 7 日のスター増減
- #120
このリポジトリには、「VLM2Vec / MMEB」[ICLR 2025]、「VLM2Vec-V2 / MMEB-V2」[TMLR 2026]、および「MMEB-V3」[COLM 2026] のコードが含まれています
★ 682+2直近 7 日のスター増減