メインコンテンツへスキップ
buildradar
Sign in
トピック · multimodal

multimodal

multimodal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

147 件のリポジトリ
  • テキストのみのLLM向けに設計された優れたビジュアルツールボックスとスキル。マルチ画像理解、画像Q&A、フロントエンドUI復元、GUI自動化などをサポートし、複数の主要なagentへシームレスに統合可能で、クリップボードからの画像貼り付けを直接認識します| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

    1,136+18直近 7 日のスター増減
  • アプリのためのセルフコーディングシステム — Cordova 用 Alan AI SDK

    1,132+0直近 7 日のスター増減
  • MOVA@OpenMOSS

    MOVA: スケーラブルで同期されたビデオ・オーディオ生成に向けて

    1,108+3直近 7 日のスター増減
  • sglang-omni@sgl-project

    SGLang-Omni は、TTS、ASR、音声、およびオムニモデルの高性能なサービングを実現します。

    1,105+130直近 7 日のスター増減
  • Aria@rhymes-ai

    オープンマルチモーダルネイティブMoE「Aria」のコードベース

    1,088+1直近 7 日のスター増減
  • XrayGLM@WangRongsheng

    🩺 胸部 X 線画像を見ることができる初の中国語マルチモーダル医療大模型

    1,084+2直近 7 日のスター増減
  • dsh-vision-router@ysr666

    テキストのみの DeepSeek Harness エージェント向けのビジョン機能:内蔵の無料ビジョンチェーン(キー不要)とピクセル単位のビジョンツール(Q&A、グラウンディング、クロップ、ピクセル差分、カラー、OCR、SVG トレース、切り抜き、スクリーンショット)。1 コマンドでインストール可能で Python は不要、画像処理を通常のツール呼び出しと同様に実行できます。

    1,075+54直近 7 日のスター増減
  • VisCPM@OpenBMB

    [ICLR'24 spotlight] 中国語と英語のマルチモーダル大規模モデルシリーズ(チャットおよびペイント)| CPM基盤モデルに基づく中英バイリンガルマルチモーダル大モデルシリーズ

    1,061-1直近 7 日のスター増減
  • ONE-PEACE@OFA-Sys

    ビジョン、オーディオ、言語モダリティを横断する汎用表現モデル。論文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0直近 7 日のスター増減
  • PointLLM@InternRobotics

    [ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: 点群を理解できるように大規模言語モデルを拡張

    1,053+2直近 7 日のスター増減
  • CLIP4Clip@ArrowLuo

    「CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval」の公式実装

    1,031+0直近 7 日のスター増減
  • Awesome-MCoT@yaotingwangofficial

    マルチモーダル思考連鎖推論:包括的なサーベイ

    1,025+2直近 7 日のスター増減
  • tongflow@tong-io

    TongFlow — マルチモーダルGenAIスタジオ

    1,016+37直近 7 日のスター増減
  • vectordb-recipes@lancedb

    ベクトル検索と LLM を使用したマルチモーダル AI、RAG、エージェントのリソース、サンプル、チュートリアル

    973-1直近 7 日のスター増減
  • verl-omni@verl-project

    拡散モデルおよびオムニモデル向けのマルチモーダル RL トレーニングフレームワーク

    955+60直近 7 日のスター増減
  • rag-time@microsoft

    RAG Time: RAGをマスターするための5週間の学習の旅

    903+4直近 7 日のスター増減
  • CVPR 2025 の最も注目すべき影響力のある論文のキュレーションコレクション 🔥 [論文 + コード + デモ]

    895+1直近 7 日のスター増減
  • NEO@EvolvingLMMs-Lab

    NEOシリーズ:ファースト・プリンシプルに基づくネイティブ視覚言語モデル

    888+0直近 7 日のスター増減
  • AnyGPT@OpenMOSS

    「AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling」のコード

    882+0直近 7 日のスター増減
  • ohmycaptcha@shenhao-stu

    ⚡ FastAPI、Playwright、およびOpenAI互換のマルチモーダルモデルで構築された、セルフホスト可能なYesCaptcha互換のCAPTCHAソルバー。

    869+4直近 7 日のスター増減
  • lmms-engine@EvolvingLMMs-Lab

    シンプルで統一されたマルチモーダルモデル学習エンジン。軽量で柔軟性があり、大規模なハッキングに対応するように構築されています。

    824+0直近 7 日のスター増減
  • 視覚分野における自己回帰モデルのサーベイ論文。

    808+1直近 7 日のスター増減
  • papermage@allenai

    学術論文の NLP および CV 研究をサポートするライブラリ

    803+0直近 7 日のスター増減
  • contrastors@nomic-ai

    Pytorch での対比学習によるモデルのトレーニング

    802+0直近 7 日のスター増減
  • ローカル監視 + AI ビジョン — データ収集と分析のための構造化イベント出力を備えた、LAN ベースのスマートフォン駆動型 AI 監視フレームワーク

    762+4直近 7 日のスター増減
  • マルチモーダルおよび大規模言語モデルに関する論文リスト。個人的な必要性から日々のarXivで読んだ論文を記録するためのものです。

    761+1直近 7 日のスター増減
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR: 人間の指示に従う高品質な画像復元 https://huggingface.co/spaces/marcosv/InstructIR

    741+0直近 7 日のスター増減
  • PaddleMIX@PaddlePaddle

    Paddle のマルチモーダル統合および探索ツールボックス。エンドツーエンドの大規模マルチモーダル事前学習モデルや拡散モデルを含む主流のマルチモーダルタスクをサポート。高性能と柔軟性を備えています。

    723-1直近 7 日のスター増減
  • MMRec@enoche

    マルチモーダル推薦のためのツールボックス。10以上のモデルを統合...

    689+1直近 7 日のスター増減
  • VLM2Vec@TIGER-AI-Lab

    このリポジトリには、「VLM2Vec / MMEB」[ICLR 2025]、「VLM2Vec-V2 / MMEB-V2」[TMLR 2026]、および「MMEB-V3」[COLM 2026] のコードが含まれています

    682+2直近 7 日のスター増減
← トピック一覧に戻る