vision-language-model
vision-language-model がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #31★ 1,309+0直近 7 日のスター増減
- #32
民主化されたマルチモーダル学習のための完全オープンなフレームワーク。
★ 1,195+1直近 7 日のスター増減 - #33
このシリーズでは、NLPとComputer Visionの基礎から最先端のVision-Language Modelsまでを詳しく解説します。
★ 1,179+0直近 7 日のスター増減 - #34★ 1,153-25直近 7 日のスター増減
- #35
テキストのみのLLM向けに設計された優れたビジュアルツールボックスとスキル。マルチ画像理解、画像Q&A、フロントエンドUI復元、GUI自動化などをサポートし、複数の主要なagentへシームレスに統合可能で、クリップボードからの画像貼り付けを直接認識します| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 1,136+18直近 7 日のスター増減 - #36★ 979-1直近 7 日のスター増減
- #37
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM): オブジェクトセグメンテーションマスクとシームレスに統合された自然言語応答を生成できる、類を見ない最初のモデル
★ 967+0直近 7 日のスター増減 - #38
[CVPR 2024 Highlight🔥] Chat-UniVi: 画像および動画の理解能力を大規模言語モデルに付与する統合型視覚表現
★ 941+0直近 7 日のスター増減 - #39
CVPR 2025 の最も注目すべき影響力のある論文のキュレーションコレクション 🔥 [論文 + コード + デモ]
★ 895+1直近 7 日のスター増減 - #40★ 874+0直近 7 日のスター増減
- #41
テキストモデル向けの高機能ビジュアルツールキット。インストールして無料で利用可能、画像の直接認識、複数画像のQ&A、スクリーンショットからフロントエンドUIへの復元などをサポート。
★ 856+17直近 7 日のスター増減 - #42★ 834+1直近 7 日のスター増減
- #43★ 833+4直近 7 日のスター増減
- #44★ 832+0直近 7 日のスター増減
- #45
大規模モデル(LLM/VLM)時代におけるロボット工学分野に関連する3Dビジョン論文の厳選リスト。awesome-computer-visionにインスパイアされ、論文、コード、関連ウェブサイトを含む。
★ 821+2直近 7 日のスター増減 - #46
CLIPなどのビジョン言語モデルに向けた優れたプロンプト/アダプター学習手法のキュレーションリスト
★ 797+1直近 7 日のスター増減 - #47
[ICLR 2026] 「Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model」の公式実装
★ 725+5直近 7 日のスター増減 - #48★ 677+0直近 7 日のスター増減
- #49★ 642+0直近 7 日のスター増減
- #50
🎉 PILOT: 事前学習モデルベースの継続学習ツールボックス
★ 601+3直近 7 日のスター増減 - #51
VQAScore を用いた text-to-image/video/3D モデルの評価
★ 600+0直近 7 日のスター増減 - #52
[CVPR 2026] SpatialVID: 空間アノテーション付きの大規模ビデオデータセット
★ 600+1直近 7 日のスター増減 - #53★ 596—直近 7 日のスター増減
- #54★ 586+0直近 7 日のスター増減
- #55
LLaVA-Miniは、画像、高解像度画像、動画の理解を効率的にサポートする統合型の大規模マルチモーダルモデル(LMM)です。
★ 577+0直近 7 日のスター増減 - #56
Cambrian-S: 動画における空間的超感覚に向けて
★ 567-1直近 7 日のスター増減 - #57
Chatbot Arena がマルチモーダルと融合!Multi-Modality Arena では、画像を入力として提供しながら、視覚言語モデルを並行してベンチマークできます。MiniGPT-4、LLaMA-Adapter V2、LLaVA、BLIP-2 などをサポート!
★ 566+0直近 7 日のスター増減 - #58
Flameは、UIデザインのモックアップを高品質なReactコードに変換するために設計されたオープンソースのマルチモーダルAIシステムです。ビジョン言語モデリング、自動データ合成、構造化されたトレーニングワークフローを活用して、デザインとフロントエンド開発のギャップを埋めます。
★ 562+0直近 7 日のスター増減 - #59
論文「✨Counting Anything」のコードと実装ガイドライン。プロジェクトページ: https://mengqi-lei.github.io/count-anything-projectpage/
★ 539+2直近 7 日のスター増減