multimodal
標記 multimodal 主題、收錄中的開源專案,依星數排序。
- #121
MOSS-Audio 是一個用於統一語音理解的開源基礎模型,在真實世界場景中支援語音、聲音、音樂、標題生成、問答與推理。
★ 658+4近 7 天星數變化 - #122
✨✨基礎模型推理最新論文與基準測試
★ 657+1近 7 天星數變化 - #123★ 641-1近 7 天星數變化
- #124
「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」專案頁面
★ 640+1近 7 天星數變化 - #125
👁️ + 💬 + 🎧 = 🤖 精選頂級基礎與多模態模型列表![論文 + 程式碼 + 範例 + 教學]
★ 637+0近 7 天星數變化 - #126
Second Brain 是一個代理型框架,作為作業系統運作,利用本地檔案智慧、工作流程自動化與 LLMs 來完成任務,並透過多種模態與訊息平台進行通訊。
★ 634+14近 7 天星數變化 - #127
「Blended Latent Diffusion」[SIGGRAPH 2023] 的官方實作
★ 632+0近 7 天星數變化 - #128
此儲存庫提供程式碼,利用 LlamaIndex、Deep Lake 和 Pinecone 建立 Generative AI 的檢索增強生成(RAG)程式碼,並運用 OpenAI 與 Hugging Face 模型進行生成與評估。
★ 624+2近 7 天星數變化 - #129
探索 2B 模型上的多模態「Aha 時刻」
★ 623+0近 7 天星數變化 - #130
Hunyuan3D-Omni:用於 3D 資產可控生成的統一框架
★ 621+7近 7 天星數變化 - #131★ 620+88近 7 天星數變化
- #132
[ECCV 2024] 透過提示詞實現任意標記化
★ 600+0近 7 天星數變化 - #133★ 598+13近 7 天星數變化
- #134
此儲存庫包含論文「MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI」的評估程式碼
★ 594+1近 7 天星數變化 - #135
「Blended Diffusion for Text-driven Editing of Natural Images」官方實作 [CVPR 2022]
★ 588-1近 7 天星數變化 - #136★ 587+11近 7 天星數變化
- #137
使用 GPT-4 Vision 像教導人類一樣建立瀏覽器自動化。
★ 586+1近 7 天星數變化 - #138★ 586+0近 7 天星數變化
- #139★ 579+3近 7 天星數變化
- #140
LLaVA-Mini 是一個統一的大型多模態模型 (LMM),能以高效方式支援圖像、高解析度圖像及影片的理解。
★ 577+0近 7 天星數變化 - #141
一個具備視覺與聽覺的 MCP 多模態 AI 代理!
★ 575-1近 7 天星數變化 - #142
您的應用程式自動編碼系統 — 用於 React Native 的 Alan AI SDK
★ 575+0近 7 天星數變化 - #143★ 572+0近 7 天星數變化
- #144★ 568+0近 7 天星數變化
- #145
Flame 是一個開源的多模態 AI 系統,旨在將 UI 設計稿轉換為高品質的 React 程式碼。它利用視覺語言模型、自動化資料合成與結構化訓練工作流程,縮短設計與前端開發之間的差距。
★ 562+0近 7 天星數變化 - #146
供 VLM 使用的各類產業特定架構中心。
★ 556+1近 7 天星數變化 - #147
精選多模態建模資源 [涵蓋 MLLM、UMM 與 NMM]
★ 544+1近 7 天星數變化 - #148★ 508+0近 7 天星數變化