メインコンテンツへスキップ
buildradar
Sign in
トピック · vision-language

vision-language

vision-language がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
18
総スター数
35,353
平均スター数
1,964
シェア
0.00%

vision-language と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、vision-language がタグ付けされたリポジトリ。

直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。

  • GroundingDINO@IDEA-Research

    [ECCV 2024] 論文「Grounding DINO: DINOとGrounded Pre-Trainingを組み合わせたオープンセット物体検出」の公式実装

    10,536+14直近 7 日のスター増減
  • Chinese-CLIP@OFA-Sys

    中国語のCLIP版。中国語のクロスモーダル検索と表現生成を実現。

    6,001+1直近 7 日のスター増減
  • OFA@OFA-Sys

    OFA (ICML 2022) の公式リポジトリ。論文: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2,557+0直近 7 日のスター増減
  • Alibaba Cloud の Qwen-VL シリーズを微調整(ファインチューニング)するためのオープンソース実装

    1,961+1直近 7 日のスター増減
  • AdvancedLiterateMachinery@AlibabaResearch

    Advanced Literate Machinery に向けた独創的で革新的なアイデアとアルゴリズムのコレクション。このプロジェクトは Alibaba Group 達摩院言語技術ラボ OCR チームによって維持されています。

    1,835+1直近 7 日のスター増減
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT は、動画について意味のある対話を生成できる動画対話モデルです。LLM の機能と、時空間動画表現に適応させた事前学習済みビジュアルエンコーダーを組み合わせています。また、動画ベースの対話モデル向けの厳格な「定量評価ベンチマーク」も導入しています。

    1,507+1直近 7 日のスター増減
  • awesome-japanese-llm@llm-jp

    日本語LLMまとめ - 日本語LLMの概要

    1,428+1直近 7 日のスター増減
  • DriveLM@OpenDriveLab

    [ECCV 2024 Oral] DriveLM: グラフ視覚的質問応答による自動運転

    1,340+1直近 7 日のスター増減
  • ONE-PEACE@OFA-Sys

    ビジョン、オーディオ、言語モダリティを横断する汎用表現モデル。論文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0直近 7 日のスター増減
  • TinyLLaVA_Factory@TinyLLaVA

    小規模の大規模マルチモーダルモデルのためのフレームワーク

    1,003+1直近 7 日のスター増減
  • calvin@mees

    長期的なロボット操作タスクのための言語条件付きポリシー学習用ベンチマーク「CALVIN」

    985+8直近 7 日のスター増減
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: 任意の領域に注目できる CLIP モデル

    874+0直近 7 日のスター増減
  • Open-GroundingDino@longzw1997

    「Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection」のサードパーティ実装です。

    846+2直近 7 日のスター増減
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++: LLaVA を Phi-3 および LLaMA-3 で拡張 (LLaVA LLaMA-3, LLaVA Phi-3)

    842+0直近 7 日のスター増減
  • daclip-uir@Algolzw

    [ICLR 2024] 汎用画像復元の為の Vision-Language Model の制御。NTIRE 2024 Restore Any Image Model in the Wild Challenge にて 5 位入賞。

    817+1直近 7 日のスター増減
  • SEED@AILab-CVC

    SEED-LLaMAの公式実装(ICLR 2024)。

    641-1直近 7 日のスター増減
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596直近 7 日のスター増減
  • RemoteCLIP@ChenDelong1999

    🛰️ 論文「RemoteCLIP: A Vision Language Foundation Model for Remote Sensing」の公式リポジトリ (IEEE TGRS)

    591+4直近 7 日のスター増減
← トピック一覧に戻る