multimodal
multimodal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
multimodal と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、multimodal がタグ付けされたリポジトリ。
- #1
URL またはローカルファイルから、Claude(または任意の LLM)に実際に動画を視聴させる。シーン認識、重複排除されたフレーム + トランスクリプト。ローカルで実行、MIT ライセンス。
★ 2,109 - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,368 - #3★ 1,153
- #4
テキストのみのLLM向けに設計された優れたビジュアルツールボックスとスキル。マルチ画像理解、画像Q&A、フロントエンドUI復元、GUI自動化などをサポートし、複数の主要なagentへシームレスに統合可能で、クリップボードからの画像貼り付けを直接認識します| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 1,136 - #5
テキストのみの DeepSeek Harness エージェント向けのビジョン機能:内蔵の無料ビジョンチェーン(キー不要)とピクセル単位のビジョンツール(Q&A、グラウンディング、クロップ、ピクセル差分、カラー、OCR、SVG トレース、切り抜き、スクリーンショット)。1 コマンドでインストール可能で Python は不要、画像処理を通常のツール呼び出しと同様に実行できます。
★ 1,086
- #1
知性をレンタルするのをやめましょう。AnythingLLMで所有してください。強力なローカルファーストのエージェント体験に必要なすべて。
★ 65,534+163直近 7 日のスター増減 - #2
《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)オープンソースメインリポジトリ:全書本文、コンパイル版PDF、および章ごとの対応コード。
★ 44,381+1,022直近 7 日のスター増減 - #3
オープンソースのマルチモーダルAIエージェントスタック:最先端のAIモデルとエージェントインフラの接続
★ 38,817+75直近 7 日のスター増減 - #4
[NeurIPS'23 Oral] GPT-4Vレベルの能力、さらにはそれを超えることを目指したVisual Instruction Tuning (LLaVA)。
★ 25,014+9直近 7 日のスター増減 - #5★ 22,203+7直近 7 日のスター増減
- #6★ 21,859-2直近 7 日のスター増減
- #7
YC (S26) | Open Computer History | 画面をローカルで継続的に記録し、エージェント(Claude, Codex, Openclaw, Hermes, Runner...)にコンテキストを提供
★ 21,376+80直近 7 日のスター増減 - #8★ 17,763+1直近 7 日のスター増減
- #9
PEFTまたはFull-parameterを使用して、600以上のLLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) および300以上のMLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) に適用する (AAAI 2025)。
★ 15,488+88直近 7 日のスター増減 - #10★ 11,387+15直近 7 日のスター増減
- #11
🔍大規模言語モデル(LLM)アプリケーション開発実践編1:RAG技術フルスタックガイド(オンライン閲覧URL:https://datawhalechina.github.io/all-in-rag/)
★ 10,770+94直近 7 日のスター増減 - #12
ローカルでAIを実行するための本番環境対応ツールキット
★ 10,281+1直近 7 日のスター増減 - #13
表形式、時系列、グラフ、テキスト、画像、音声データにわたる異常検知のためのPythonライブラリ。60以上の検出器、ベンチマーク裏付けのADEngineオーケストレーション、AIエージェント向けのエージェンティックワークフローを提供。
★ 9,978+1直近 7 日のスター増減 - #14★ 9,848+60直近 7 日のスター増減
- #15★ 9,612+12直近 7 日のスター増減
- #16
Deeplakeはエージェント向けのAIデータランタイムです。マルチモーダルなデータレイクを備えたサーバーレスPostgresを提供し、スケーラブルな検索とトレーニングを可能にします。
★ 9,229-1直近 7 日のスター増減 - #17
Mobile-Agent: 強力なGUIエージェントファミリー
★ 9,157+9直近 7 日のスター増減 - #18★ 8,817+4直近 7 日のスター増減
- #19
AppleのMLXフレームワーク上に構築された、テキスト読み上げ (TTS)、音声認識 (STT)、音声合成 (STS) のライブラリ。Apple Silicon上での効率的な音声分析を提供。
★ 7,826+23直近 7 日のスター増減 - #20★ 6,593+136直近 7 日のスター増減
- #21★ 6,482+3直近 7 日のスター増減
- #22
Googleによって構築され、本番環境で使用されている、JavaScript、Go、Dart、Pythonでエージェンティックアプリを構築するためのオープンソースフレームワーク。
★ 6,394+10直近 7 日のスター増減 - #23
新しいAI開発動向をキャッチアップするソフトウェアエンジニア向けのメモ。https://latent.spaceでの執筆や製品ブレインストーミングのデータストアとして機能しますが、/Resourcesフォルダ内の正規参照を整理しています。
★ 6,247+0直近 7 日のスター増減 - #24★ 6,018+4直近 7 日のスター増減
- #25★ 5,779-1直近 7 日のスター増減
- #26★ 5,736+4直近 7 日のスター増減
- #27★ 5,678+4直近 7 日のスター増減
- #28★ 5,633-1直近 7 日のスター増減
- #29★ 5,188+3直近 7 日のスター増減
- #30
Align Anything: フィードバックを用いた全モダリティモデルのトレーニング。
★ 4,671+3直近 7 日のスター増減