メインコンテンツへスキップ
buildradar
Sign in
トピック · vision-language-model

vision-language-model

vision-language-model がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
59
総スター数
150,825
平均スター数
2,556
シェア
0.01%

vision-language-model と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、vision-language-model がタグ付けされたリポジトリ。

  • doc7@magicrew

    視覚的理解により、ドキュメントを AI 対応の Markdown に変換する

    1,153
  • テキストのみのLLM向けに設計された優れたビジュアルツールボックスとスキル。マルチ画像理解、画像Q&A、フロントエンドUI復元、GUI自動化などをサポートし、複数の主要なagentへシームレスに統合可能で、クリップボードからの画像貼り付けを直接認識します| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

    1,136
  • dsh-vision-toolkit@Anionex

    テキストモデル向けの高機能ビジュアルツールキット。インストールして無料で利用可能、画像の直接認識、複数画像のQ&A、スクリーンショットからフロントエンドUIへの復元などをサポート。

    854
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] GPT-4Vレベルの能力、さらにはそれを超えることを目指したVisual Instruction Tuning (LLaVA)。

    25,014+9直近 7 日のスター増減
  • X-AnyLabeling@CVHub520

    X-AnyLabeling: テキスト、画像、動画、マルチモーダルデータをアノテーションするための軽量で効率的かつ統一されたクロスプラットフォームデスクトップアプリケーション。多機能な内蔵ツールと最先端のAIモデルを組み合わせ、柔軟なマルチフォーマットエクスポートに対応。

    10,313+59直近 7 日のスター増減
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] InternVL Family: GPT-4oに匹敵する画期的なオープンソース代替モデル。GPT-4oの性能に迫るオープンソースのマルチモーダル対話モデル。

    10,150+3直近 7 日のスター増減
  • minimind-v@jingyaogong

    65MパラメータのVLMをゼロからわずか2時間でトレーニング!

    8,535+40直近 7 日のスター増減
  • Qwen-VL@QwenLM

    Alibaba Cloudが提案するQwen-VL(通义千问-VL)のチャットおよび事前学習済み大規模ビジョン言語モデルの公式リポジトリ。

    6,727+1直近 7 日のスター増減
  • MineContext@volcengine

    MineContextは、プロアクティブなコンテキスト認識AIパートナーです(Context-Engineering + ChatGPT Pulse)。

    5,497+1直近 7 日のスター増減
  • mlx-vlm@Blaizzy

    MLX-VLMは、MLXを使用してMac上でVision Language Models (VLMs) の推論とファインチューニングを行うためのパッケージです。

    5,462+25直近 7 日のスター増減
  • align-anything@PKU-Alignment

    Align Anything: フィードバックを用いた全モダリティモデルのトレーニング。

    4,671+3直近 7 日のスター増減
  • lmms-eval@EvolvingLMMs-Lab

    テキスト、画像、ビデオ、オーディオタスクを網羅するオールインワンのマルチモーダル評価ツールキット

    4,390+7直近 7 日のスター増減
  • DeepSeek-VL@deepseek-ai

    DeepSeek-VL: 実世界におけるビジョン・言語理解へ

    4,177+2直近 7 日のスター増減
  • MiniMax-01@MiniMax-AI

    Linear Attentionに基づく大規模言語モデルおよび視覚言語モデル、MiniMax-Text-01とMiniMax-VL-01の公式リポジトリ

    3,467+0直近 7 日のスター増減
  • MGM@JIA-Lab-research

    「Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models」の公式リポジトリ

    3,327+0直近 7 日のスター増減
  • VLM_survey@jingyi0000

    視覚タスク向けの優れた Vision-Language モデルのコレクション

    3,126+0直近 7 日のスター増減
  • OGAM@off-grid-ai

    オフライン AI のスイスアーミーナイフ。スマホや Mac でチャット、視覚認識、音声対話、画像生成が可能 — GGUF LLM、ビジョン、Whisper 音声認識、Stable Diffusion、ツール呼び出し、ローカルネットワークサーバーに対応。CPU、GPU、NPU で動作。アカウント不要、API キー不要、データがデバイス外に出ることは一切ありません。

    3,038+17直近 7 日のスター増減
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive:長期的なストリーミング映像と音声のインタラクションを実現する包括的なマルチモーダルシステム。

    2,925-1直近 7 日のスター増減
  • colpali@illuin-tech

    ColPali、ColQwen2、ColSmol などの ColVision モデルのトレーニングおよび推論実行に使用されるコード

    2,809+7直近 7 日のスター増減
  • Cradle@BAAI-Agents

    Cradle フレームワークは、General Computer Control (GCC) への最初の試みです。Cradle は、最小限の要件で標準化された一般環境において、強力な推論能力、自己改善、スキルキュレーションを有効にすることで、エージェントがあらゆるコンピュータタスクをこなすことをサポートします。

    2,578+2直近 7 日のスター増減
  • Alibaba Cloud の Qwen-VL シリーズを微調整(ファインチューニング)するためのオープンソース実装

    1,961+1直近 7 日のスター増減
  • ShowUI@showlab

    [CVPR 2025] GUI エージェントおよび Computer Use 向けのオープンソースなエンドツーエンド Vision-Language-Action モデル。

    1,896+2直近 7 日のスター増減
  • Awesome-LLM4AD@Thinklab-SJTU

    自動運転向けLLM/VLM/VLA/ワールドモデル(LLM4AD)に関する厳選されたリソースリスト(随時更新)

    1,890-2直近 7 日のスター増減
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    動画検索および要約(VSS)向けのNVIDIA AI Blueprintは、リアルタイムの検証済みアラート、視覚的Q&A、自動レポート機能を備えた動画解析エージェントを構築するためのGPUアクセラレーテッド・リファレンスアーキテクチャです。VSS Blueprintは、NVIDIA Cosmosなどのビジョン言語モデル(VLM)、NVIDIA NemotronなどのLLM、RAG、およびNVIDIA NIMを使用します。

    1,840+10直近 7 日のスター増減
  • AdvancedLiterateMachinery@AlibabaResearch

    Advanced Literate Machinery に向けた独創的で革新的なアイデアとアルゴリズムのコレクション。このプロジェクトは Alibaba Group 達摩院言語技術ラボ OCR チームによって維持されています。

    1,835+1直近 7 日のスター増減
  • Seed1.5-VL@ByteDance-Seed

    汎用マルチモーダル理解と推論の発展を目的として設計されたビジョン言語基盤モデル Seed1.5-VL。60の公開ベンチマークのうち38で最先端のパフォーマンスを達成。

    1,586+0直近 7 日のスター増減
  • vllm-mlx@waybarrios

    Apple Silicon 向けの高性能な OpenAI および Anthropic 互換 LLM 推論サーバー。ネイティブ MLX、連続バッチ処理、マルチモーダルモデル、MCP ツール呼び出し、Claude Code をサポート。

    1,557+6直近 7 日のスター増減
  • thepipe@emcf

    ビジョン言語モデルを活用し、複雑なドキュメントからクリーンなデータを抽出する ⚡

    1,524+0直近 7 日のスター増減
  • [ICCV 2025] Describe Anything の実装: 詳細な局所化画像および動画キャプション生成

    1,517+3直近 7 日のスター増減
  • Ovis@ATH-MaaS

    視覚的埋め込みとテキスト的埋め込みを構造的に整合させるように設計された、新規のマルチモーダル大規模言語モデル (MLLM) アーキテクチャ

    1,514+2直近 7 日のスター増減
  • awesome-japanese-llm@llm-jp

    日本語LLMまとめ - 日本語LLMの概要

    1,428+1直近 7 日のスター増減
  • mlx-tune@ARahim3

    Apple Silicon 搭載 Mac で LLM をファインチューニング。MLX 上でネイティブ動作する SFT、DPO、GRPO、Vision、TTS、STT、Embedding、OCR のファインチューニング対応。Unsloth 互換 API。

    1,398+8直近 7 日のスター増減
  • 素晴らしい統合マルチモーダルモデルの一覧

    1,314+1直近 7 日のスター増減
← トピック一覧に戻る