vision-language-model
vision-language-model がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
vision-language-model と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、vision-language-model がタグ付けされたリポジトリ。
- #1★ 1,153
- #2
テキストのみのLLM向けに設計された優れたビジュアルツールボックスとスキル。マルチ画像理解、画像Q&A、フロントエンドUI復元、GUI自動化などをサポートし、複数の主要なagentへシームレスに統合可能で、クリップボードからの画像貼り付けを直接認識します| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 1,136 - #3
テキストモデル向けの高機能ビジュアルツールキット。インストールして無料で利用可能、画像の直接認識、複数画像のQ&A、スクリーンショットからフロントエンドUIへの復元などをサポート。
★ 854 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
[NeurIPS'23 Oral] GPT-4Vレベルの能力、さらにはそれを超えることを目指したVisual Instruction Tuning (LLaVA)。
★ 25,014+9直近 7 日のスター増減 - #2
X-AnyLabeling: テキスト、画像、動画、マルチモーダルデータをアノテーションするための軽量で効率的かつ統一されたクロスプラットフォームデスクトップアプリケーション。多機能な内蔵ツールと最先端のAIモデルを組み合わせ、柔軟なマルチフォーマットエクスポートに対応。
★ 10,313+59直近 7 日のスター増減 - #3
[CVPR 2024 Oral] InternVL Family: GPT-4oに匹敵する画期的なオープンソース代替モデル。GPT-4oの性能に迫るオープンソースのマルチモーダル対話モデル。
★ 10,150+3直近 7 日のスター増減 - #4
65MパラメータのVLMをゼロからわずか2時間でトレーニング!
★ 8,535+40直近 7 日のスター増減 - #5★ 6,727+1直近 7 日のスター増減
- #6
MineContextは、プロアクティブなコンテキスト認識AIパートナーです(Context-Engineering + ChatGPT Pulse)。
★ 5,497+1直近 7 日のスター増減 - #7★ 5,462+25直近 7 日のスター増減
- #8
Align Anything: フィードバックを用いた全モダリティモデルのトレーニング。
★ 4,671+3直近 7 日のスター増減 - #9★ 4,390+7直近 7 日のスター増減
- #10
DeepSeek-VL: 実世界におけるビジョン・言語理解へ
★ 4,177+2直近 7 日のスター増減 - #11
Linear Attentionに基づく大規模言語モデルおよび視覚言語モデル、MiniMax-Text-01とMiniMax-VL-01の公式リポジトリ
★ 3,467+0直近 7 日のスター増減 - #12
「Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models」の公式リポジトリ
★ 3,327+0直近 7 日のスター増減 - #13
視覚タスク向けの優れた Vision-Language モデルのコレクション
★ 3,126+0直近 7 日のスター増減 - #14
オフライン AI のスイスアーミーナイフ。スマホや Mac でチャット、視覚認識、音声対話、画像生成が可能 — GGUF LLM、ビジョン、Whisper 音声認識、Stable Diffusion、ツール呼び出し、ローカルネットワークサーバーに対応。CPU、GPU、NPU で動作。アカウント不要、API キー不要、データがデバイス外に出ることは一切ありません。
★ 3,038+17直近 7 日のスター増減 - #15
InternLM-XComposer2.5-OmniLive:長期的なストリーミング映像と音声のインタラクションを実現する包括的なマルチモーダルシステム。
★ 2,925-1直近 7 日のスター増減 - #16★ 2,809+7直近 7 日のスター増減
- #17
Cradle フレームワークは、General Computer Control (GCC) への最初の試みです。Cradle は、最小限の要件で標準化された一般環境において、強力な推論能力、自己改善、スキルキュレーションを有効にすることで、エージェントがあらゆるコンピュータタスクをこなすことをサポートします。
★ 2,578+2直近 7 日のスター増減 - #18
Alibaba Cloud の Qwen-VL シリーズを微調整(ファインチューニング)するためのオープンソース実装
★ 1,961+1直近 7 日のスター増減 - #19
[CVPR 2025] GUI エージェントおよび Computer Use 向けのオープンソースなエンドツーエンド Vision-Language-Action モデル。
★ 1,896+2直近 7 日のスター増減 - #20
自動運転向けLLM/VLM/VLA/ワールドモデル(LLM4AD)に関する厳選されたリソースリスト(随時更新)
★ 1,890-2直近 7 日のスター増減 - #21
動画検索および要約(VSS)向けのNVIDIA AI Blueprintは、リアルタイムの検証済みアラート、視覚的Q&A、自動レポート機能を備えた動画解析エージェントを構築するためのGPUアクセラレーテッド・リファレンスアーキテクチャです。VSS Blueprintは、NVIDIA Cosmosなどのビジョン言語モデル(VLM)、NVIDIA NemotronなどのLLM、RAG、およびNVIDIA NIMを使用します。
★ 1,840+10直近 7 日のスター増減 - #22
Advanced Literate Machinery に向けた独創的で革新的なアイデアとアルゴリズムのコレクション。このプロジェクトは Alibaba Group 達摩院言語技術ラボ OCR チームによって維持されています。
★ 1,835+1直近 7 日のスター増減 - #23
汎用マルチモーダル理解と推論の発展を目的として設計されたビジョン言語基盤モデル Seed1.5-VL。60の公開ベンチマークのうち38で最先端のパフォーマンスを達成。
★ 1,586+0直近 7 日のスター増減 - #24
Apple Silicon 向けの高性能な OpenAI および Anthropic 互換 LLM 推論サーバー。ネイティブ MLX、連続バッチ処理、マルチモーダルモデル、MCP ツール呼び出し、Claude Code をサポート。
★ 1,557+6直近 7 日のスター増減 - #25★ 1,524+0直近 7 日のスター増減
- #26
[ICCV 2025] Describe Anything の実装: 詳細な局所化画像および動画キャプション生成
★ 1,517+3直近 7 日のスター増減 - #27★ 1,514+2直近 7 日のスター増減
- #28
日本語LLMまとめ - 日本語LLMの概要
★ 1,428+1直近 7 日のスター増減 - #29
Apple Silicon 搭載 Mac で LLM をファインチューニング。MLX 上でネイティブ動作する SFT、DPO、GRPO、Vision、TTS、STT、Embedding、OCR のファインチューニング対応。Unsloth 互換 API。
★ 1,398+8直近 7 日のスター増減 - #30
素晴らしい統合マルチモーダルモデルの一覧
★ 1,314+1直近 7 日のスター増減