メインコンテンツへスキップ
buildradar
Sign in
トピック · vision-language-model

vision-language-model

vision-language-model がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

59 件のリポジトリ
  • prismer@NVlabs

    「Prismer: A Vision-Language Model with Multi-Task Experts」の実装

    1,309+0直近 7 日のスター増減
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    民主化されたマルチモーダル学習のための完全オープンなフレームワーク。

    1,195+1直近 7 日のスター増減
  • vlms-zero-to-hero@SkalskiP

    このシリーズでは、NLPとComputer Visionの基礎から最先端のVision-Language Modelsまでを詳しく解説します。

    1,179+0直近 7 日のスター増減
  • doc7@magicrew

    視覚的理解により、ドキュメントを AI 対応の Markdown に変換する

    1,153-25直近 7 日のスター増減
  • テキストのみのLLM向けに設計された優れたビジュアルツールボックスとスキル。マルチ画像理解、画像Q&A、フロントエンドUI復元、GUI自動化などをサポートし、複数の主要なagentへシームレスに統合可能で、クリップボードからの画像貼り付けを直接認識します| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

    1,136+18直近 7 日のスター増減
  • VisRAG@OpenBMB

    VLMによってサポートされる、パース処理不要のRAG

    979-1直近 7 日のスター増減
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM): オブジェクトセグメンテーションマスクとシームレスに統合された自然言語応答を生成できる、類を見ない最初のモデル

    967+0直近 7 日のスター増減
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: 画像および動画の理解能力を大規模言語モデルに付与する統合型視覚表現

    941+0直近 7 日のスター増減
  • CVPR 2025 の最も注目すべき影響力のある論文のキュレーションコレクション 🔥 [論文 + コード + デモ]

    895+1直近 7 日のスター増減
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: 任意の領域に注目できる CLIP モデル

    874+0直近 7 日のスター増減
  • dsh-vision-toolkit@Anionex

    テキストモデル向けの高機能ビジュアルツールキット。インストールして無料で利用可能、画像の直接認識、複数画像のQ&A、スクリーンショットからフロントエンドUIへの復元などをサポート。

    856+17直近 7 日のスター増減
  • VoxPoser@huangwl18

    VoxPoser:言語モデルによるロボット操作のための合成可能な3Dバリューマップ

    834+1直近 7 日のスター増減
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA: コンピュータ利用エージェントのためのオープンな基盤

    833+4直近 7 日のスター増減
  • MINT-1T@mlfoundations

    🍃 MINT-1T: 1兆トークンのマルチモーダルインターリーブデータセット。

    832+0直近 7 日のスター増減
  • 大規模モデル(LLM/VLM)時代におけるロボット工学分野に関連する3Dビジョン論文の厳選リスト。awesome-computer-visionにインスパイアされ、論文、コード、関連ウェブサイトを含む。

    821+2直近 7 日のスター増減
  • CLIPなどのビジョン言語モデルに向けた優れたプロンプト/アダプター学習手法のキュレーションリスト

    797+1直近 7 日のスター増減
  • X-VLA@2toinf

    [ICLR 2026] 「Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model」の公式実装

    725+5直近 7 日のスター増減
  • OmniVinci@NVlabs

    OmniVinci は、視覚、音声、言語を統合理解するためのオムニモーダル LLM です。

    677+0直近 7 日のスター増減
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    642+0直近 7 日のスター増減
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT: 事前学習モデルベースの継続学習ツールボックス

    601+3直近 7 日のスター増減
  • t2v_metrics@linzhiqiu

    VQAScore を用いた text-to-image/video/3D モデルの評価

    600+0直近 7 日のスター増減
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID: 空間アノテーション付きの大規模ビデオデータセット

    600+1直近 7 日のスター増減
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596直近 7 日のスター増減
  • Groma@FoundationVision

    [ECCV2024] 局所化されたビジュアルトークン化を備えたグラウンデッドマルチモーダル大規模言語モデル

    586+0直近 7 日のスター増減
  • LLaVA-Mini@ictnlp

    LLaVA-Miniは、画像、高解像度画像、動画の理解を効率的にサポートする統合型の大規模マルチモーダルモデル(LMM)です。

    577+0直近 7 日のスター増減
  • cambrian-s@cambrian-mllm

    Cambrian-S: 動画における空間的超感覚に向けて

    567-1直近 7 日のスター増減
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena がマルチモーダルと融合!Multi-Modality Arena では、画像を入力として提供しながら、視覚言語モデルを並行してベンチマークできます。MiniGPT-4、LLaMA-Adapter V2、LLaVA、BLIP-2 などをサポート!

    566+0直近 7 日のスター増減
  • Flame-Code-VLM@Flame-Code-VLM

    Flameは、UIデザインのモックアップを高品質なReactコードに変換するために設計されたオープンソースのマルチモーダルAIシステムです。ビジョン言語モデリング、自動データ合成、構造化されたトレーニングワークフローを活用して、デザインとフロントエンド開発のギャップを埋めます。

    562+0直近 7 日のスター増減
  • count-anything@Mengqi-Lei

    論文「✨Counting Anything」のコードと実装ガイドライン。プロジェクトページ: https://mengqi-lei.github.io/count-anything-projectpage/

    539+2直近 7 日のスター増減
← トピック一覧に戻る