メインコンテンツへスキップ
buildradar
Sign in
トピック · multimodal

multimodal

multimodal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

148 件のリポジトリ
  • stability-sdk@Stability-AI

    stability.ai API と連携するための SDK(Stable Diffusion の推論など)

    2,435-1直近 7 日のスター増減
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: 文書理解のためのモジュール式マルチモーダル大規模言語モデル

    2,411+0直近 7 日のスター増減
  • InternVideo@OpenGVLab

    [ECCV2024] マルチモーダル理解のためのビデオ基盤モデルとデータ

    2,374+5直近 7 日のスター増減
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer: スクラッチまたはシードデータから高品質な合成データを生成する。

    2,197+7直近 7 日のスター増減
  • genai-processors@google-gemini

    効率的かつ並列的なコンテンツ処理を可能にする、軽量な Python ライブラリの GenAI Processors。

    2,120+0直近 7 日のスター増減
  • claude-real-video@HUANGCHIHHUNGLeo

    URL またはローカルファイルから、Claude(または任意の LLM)に実際に動画を視聴させる。シーン認識、重複排除されたフレーム + トランスクリプト。ローカルで実行、MIT ライセンス。

    2,109+20直近 7 日のスター増減
  • parlor@fikrikarim

    GPT-Live と同様の機能を備えた、デバイス上のリアルタイムマルチモーダル AI

    2,048+7直近 7 日のスター増減
  • Show-o@showlab

    [ICLR & NeurIPS 2025] マルチモーダルな理解と生成を統合する単一のTransformer、Show-oシリーズのリポジトリ。

    1,975+1直近 7 日のスター増減
  • Alibaba Cloud の Qwen-VL シリーズを微調整(ファインチューニング)するためのオープンソース実装

    1,961+1直近 7 日のスター増減
  • BitNet@kyegomez

    PyTorchによる「BitNet: Scaling 1-bit Transformers for Large Language Models」の実装

    1,946+0直近 7 日のスター増減
  • AdvancedLiterateMachinery@AlibabaResearch

    Advanced Literate Machinery に向けた独創的で革新的なアイデアとアルゴリズムのコレクション。このプロジェクトは Alibaba Group 達摩院言語技術ラボ OCR チームによって維持されています。

    1,835+1直近 7 日のスター増減
  • DeTikZify@potamides

    TikZを使用した、科学的図解およびスケッチのためのグラフィックスプログラムの合成

    1,818+1直近 7 日のスター増減
  • アプリのためのセルフコーディングシステム — Android用 Alan AI SDK

    1,807-1直近 7 日のスター増減
  • アプリ向けセルフコーディングシステム — Flutter 用 Alan AI SDK

    1,756-1直近 7 日のスター増減
  • alan-sdk-ionic@alan-ai

    アプリのためのセルフコーディングシステム — Ionic 向け Alan AI SDK

    1,649-1直近 7 日のスター増減
  • pixeltable@pixeltable

    AI データアプリ向けの統合マルチモーダルバックエンド

    1,619+5直近 7 日のスター増減
  • mllm@UbiquitousLearning

    モバイル端末向けの高速なマルチモーダル LLM

    1,602+3直近 7 日のスター増減
  • thepipe@emcf

    ビジョン言語モデルを活用し、複雑なドキュメントからクリーンなデータを抽出する ⚡

    1,524+0直近 7 日のスター増減
  • Ovis@ATH-MaaS

    視覚的埋め込みとテキスト的埋め込みを構造的に整合させるように設計された、新規のマルチモーダル大規模言語モデル (MLLM) アーキテクチャ

    1,514+2直近 7 日のスター増減
  • ha-llmvision@valentinfrlch

    自宅のためのビジュアルインテリジェンス。

    1,454+10直近 7 日のスター増減
  • awesome-japanese-llm@llm-jp

    日本語LLMまとめ - 日本語LLMの概要

    1,428+1直近 7 日のスター増減
  • SDT@dailenson

    手書き文字生成のための「Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023)」の公式実装リポジトリです。

    1,406-1直近 7 日のスター増減
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1,368+462直近 7 日のスター増減
  • airunner@Capsize-Games

    画像、リアルタイム音声会話、LLM を活用したチャットボット、自動化ワークフローのためのオフライン推論エンジン。

    1,314+0直近 7 日のスター増減
  • 155種類以上のビジョン・言語モデル(VLM/MLLM)アーキテクチャのキュレーションされたビジュアルカタログ:論文、図解、学習レシピ、データセット、マルチモーダルAIエージェントのリリース年表。

    1,310+2直近 7 日のスター増減
  • claude-video-vision@jordanrendric

    Claudeに動画の視聴と理解能力を付与する — フレーム抽出とマルチモーダル音声分析を備えた Claude Code プラグイン

    1,281+6直近 7 日のスター増減
  • UForm@unum-cloud

    多言語のテキスト、画像、動画を対象としたコンテンツ理解と生成のためのポケットサイズマルチモーダルAI。OpenAI CLIPやLLaVAと比較して最大5倍高速

    1,247+1直近 7 日のスター増減
  • xtreme1@xtreme1-io

    Xtreme1は、マルチモーダルデータ学習向けのオールインワンのデータラベリング・アノテーションプラットフォームであり、3D LiDAR点群、画像、LLMをサポートしています。

    1,239+2直近 7 日のスター増減
  • LLaMA-Mesh@nv-tlabs

    言語モデルによる 3D メッシュ生成の統合

    1,167+0直近 7 日のスター増減
  • doc7@magicrew

    視覚的理解により、ドキュメントを AI 対応の Markdown に変換する

    1,153-25直近 7 日のスター増減
← トピック一覧に戻る