メインコンテンツへスキップ
buildradar
Sign in
トピック · multimodal

multimodal

multimodal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
148
総スター数
627,042
平均スター数
4,237
シェア
0.03%

multimodal と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、multimodal がタグ付けされたリポジトリ。

  • claude-real-video@HUANGCHIHHUNGLeo

    URL またはローカルファイルから、Claude(または任意の LLM)に実際に動画を視聴させる。シーン認識、重複排除されたフレーム + トランスクリプト。ローカルで実行、MIT ライセンス。

    2,109
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1,368
  • doc7@magicrew

    視覚的理解により、ドキュメントを AI 対応の Markdown に変換する

    1,153
  • テキストのみのLLM向けに設計された優れたビジュアルツールボックスとスキル。マルチ画像理解、画像Q&A、フロントエンドUI復元、GUI自動化などをサポートし、複数の主要なagentへシームレスに統合可能で、クリップボードからの画像貼り付けを直接認識します| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

    1,136
  • dsh-vision-router@ysr666

    テキストのみの DeepSeek Harness エージェント向けのビジョン機能:内蔵の無料ビジョンチェーン(キー不要)とピクセル単位のビジョンツール(Q&A、グラウンディング、クロップ、ピクセル差分、カラー、OCR、SVG トレース、切り抜き、スクリーンショット)。1 コマンドでインストール可能で Python は不要、画像処理を通常のツール呼び出しと同様に実行できます。

    1,086
  • anything-llm@Mintplex-Labs

    知性をレンタルするのをやめましょう。AnythingLLMで所有してください。強力なローカルファーストのエージェント体験に必要なすべて。

    65,534+163直近 7 日のスター増減
  • ai-agent-book@bojieli

    《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)オープンソースメインリポジトリ:全書本文、コンパイル版PDF、および章ごとの対応コード。

    44,381+1,022直近 7 日のスター増減
  • UI-TARS-desktop@bytedance

    オープンソースのマルチモーダルAIエージェントスタック:最先端のAIモデルとエージェントインフラの接続

    38,817+75直近 7 日のスター増減
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] GPT-4Vレベルの能力、さらにはそれを超えることを目指したVisual Instruction Tuning (LLaVA)。

    25,014+9直近 7 日のスター増減
  • unilm@microsoft

    タスク、言語、モダリティを横断する大規模な自己教師あり事前学習

    22,203+7直近 7 日のスター増減
  • serve@jina-ai

    ☁️ クラウドネイティブスタックでマルチモーダルAIアプリケーションを構築。

    21,859-2直近 7 日のスター増減
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | 画面をローカルで継続的に記録し、エージェント(Claude, Codex, Openclaw, Hermes, Runner...)にコンテキストを提供

    21,376+80直近 7 日のスター増減
  • Janus@deepseek-ai

    Janus-Series: 統合型マルチモーダル理解および生成モデル

    17,763+1直近 7 日のスター増減
  • ms-swift@modelscope

    PEFTまたはFull-parameterを使用して、600以上のLLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) および300以上のMLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) に適用する (AAAI 2025)。

    15,488+88直近 7 日のスター増減
  • rerun@rerun-io

    マルチモーダルロボティクスデータで学習するための可視化、クエリ、ストリーミング。

    11,387+15直近 7 日のスター増減
  • all-in-rag@datawhalechina

    🔍大規模言語モデル(LLM)アプリケーション開発実践編1:RAG技術フルスタックガイド(オンライン閲覧URL:https://datawhalechina.github.io/all-in-rag/)

    10,770+94直近 7 日のスター増減
  • runanywhere-sdks@RunanywhereAI

    ローカルでAIを実行するための本番環境対応ツールキット

    10,281+1直近 7 日のスター増減
  • pyod@yzhao062

    表形式、時系列、グラフ、テキスト、画像、音声データにわたる異常検知のためのPythonライブラリ。60以上の検出器、ベンチマーク裏付けのADEngineオーケストレーション、AIエージェント向けのエージェンティックワークフローを提供。

    9,978+1直近 7 日のスター増減
  • PixelRAG@StarTrail-org

    Webパースの終焉。スケーラブルなピクセルネイティブ検索の幕開け。リンク: https://pixelrag.ai/

    9,848+60直近 7 日のスター増減
  • seatunnel@apache

    SeaTunnelは、マルチモーダルで高性能、分散型の大規模データ統合ツールです.

    9,612+12直近 7 日のスター増減
  • deeplake@activeloopai

    Deeplakeはエージェント向けのAIデータランタイムです。マルチモーダルなデータレイクを備えたサーバーレスPostgresを提供し、スケーラブルな検索とトレーニングを可能にします。

    9,229-1直近 7 日のスター増減
  • MobileAgent@X-PLUG

    Mobile-Agent: 強力なGUIエージェントファミリー

    9,157+9直近 7 日のスター増減
  • BentoML@bentoml

    AIアプリやモデルを配信する最も簡単な方法 - モデル推論API、ジョブキュー、LLMアプリ、マルチモデルパイプラインなどを構築!

    8,817+4直近 7 日のスター増減
  • mlx-audio@Blaizzy

    AppleのMLXフレームワーク上に構築された、テキスト読み上げ (TTS)、音声認識 (STT)、音声合成 (STS) のライブラリ。Apple Silicon上での効率的な音声分析を提供。

    7,826+23直近 7 日のスター増減
  • vllm-omni@vllm-project

    マルチモーダルモデルを用いた効率的なモデル推論のためのフレームワーク。

    6,593+136直近 7 日のスター増減
  • courses@SkalskiP

    このリポジトリは、人工知能(AI)に関する様々なコースやリソースへのキュレーションされたリンク集です。

    6,482+3直近 7 日のスター増減
  • genkit@genkit-ai

    Googleによって構築され、本番環境で使用されている、JavaScript、Go、Dart、Pythonでエージェンティックアプリを構築するためのオープンソースフレームワーク。

    6,394+10直近 7 日のスター増減
  • ai-notes@swyxio

    新しいAI開発動向をキャッチアップするソフトウェアエンジニア向けのメモ。https://latent.spaceでの執筆や製品ブレインストーミングのデータストアとして機能しますが、/Resourcesフォルダ内の正規参照を整理しています。

    6,247+0直近 7 日のスター増減
  • VLM-R1@om-ai-lab

    強化学習されたVLMによる視覚理解を解決する

    6,018+4直近 7 日のスター増減
  • pyspur@PySpur-Dev

    エージェンティックワークフローのためのビジュアルプレイグラウンド:エージェントを10倍速く反復処理

    5,779-1直近 7 日のスター増減
  • Daft@Eventual-Inc

    AIおよびマルチモーダルワークロード向けの高性能データエンジン。あらゆる規模で画像、音声、動画、構造化データを処理します。

    5,736+4直近 7 日のスター増減
  • UltraRAG@OpenBMB

    複雑で革新的なRAGパイプラインを構築するためのローコードMCPフレームワーク

    5,678+4直近 7 日のスター増減
  • mmf@facebookresearch

    Facebook AI Research (FAIR) による、ビジョン&言語のマルチモーダル研究のためのモジュール式フレームワーク

    5,633-1直近 7 日のスター増減
  • xtuner@InternLM

    超大規模MoEモデル向けに構築された次世代トレーニングエンジン

    5,188+3直近 7 日のスター増減
  • align-anything@PKU-Alignment

    Align Anything: フィードバックを用いた全モダリティモデルのトレーニング。

    4,671+3直近 7 日のスター増減
← トピック一覧に戻る