vision-language
vision-language がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
vision-language と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、vision-language がタグ付けされたリポジトリ。
直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。
- #1
[ECCV 2024] 論文「Grounding DINO: DINOとGrounded Pre-Trainingを組み合わせたオープンセット物体検出」の公式実装
★ 10,536+14直近 7 日のスター増減 - #2
中国語のCLIP版。中国語のクロスモーダル検索と表現生成を実現。
★ 6,001+1直近 7 日のスター増減 - #3
OFA (ICML 2022) の公式リポジトリ。論文: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2,557+0直近 7 日のスター増減 - #4
Alibaba Cloud の Qwen-VL シリーズを微調整(ファインチューニング)するためのオープンソース実装
★ 1,961+1直近 7 日のスター増減 - #5
Advanced Literate Machinery に向けた独創的で革新的なアイデアとアルゴリズムのコレクション。このプロジェクトは Alibaba Group 達摩院言語技術ラボ OCR チームによって維持されています。
★ 1,835+1直近 7 日のスター増減 - #6
[ACL 2024 🔥] Video-ChatGPT は、動画について意味のある対話を生成できる動画対話モデルです。LLM の機能と、時空間動画表現に適応させた事前学習済みビジュアルエンコーダーを組み合わせています。また、動画ベースの対話モデル向けの厳格な「定量評価ベンチマーク」も導入しています。
★ 1,507+1直近 7 日のスター増減 - #7
日本語LLMまとめ - 日本語LLMの概要
★ 1,428+1直近 7 日のスター増減 - #8★ 1,340+1直近 7 日のスター増減
- #9
ビジョン、オーディオ、言語モダリティを横断する汎用表現モデル。論文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0直近 7 日のスター増減 - #10
小規模の大規模マルチモーダルモデルのためのフレームワーク
★ 1,003+1直近 7 日のスター増減 - #11★ 985+8直近 7 日のスター増減
- #12★ 874+0直近 7 日のスター増減
- #13
「Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection」のサードパーティ実装です。
★ 846+2直近 7 日のスター増減 - #14★ 842+0直近 7 日のスター増減
- #15
[ICLR 2024] 汎用画像復元の為の Vision-Language Model の制御。NTIRE 2024 Restore Any Image Model in the Wild Challenge にて 5 位入賞。
★ 817+1直近 7 日のスター増減 - #16★ 641-1直近 7 日のスター増減
- #17★ 596—直近 7 日のスター増減
- #18
🛰️ 論文「RemoteCLIP: A Vision Language Foundation Model for Remote Sensing」の公式リポジトリ (IEEE TGRS)
★ 591+4直近 7 日のスター増減