跳到主要内容
buildradar
登录
主题 · multimodal

multimodal

标记 multimodal 主题、收录中的开源项目,按星标数排序。

共 148 个项目
  • stability-sdk@Stability-AI

    用于与 stability.ai API 交互的 SDK(例如 stable diffusion 推理)。

    2,435+0近 7 天星标变化
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl:用于文档理解的模块化多模态大语言模型

    2,411+0近 7 天星标变化
  • InternVideo@OpenGVLab

    [ECCV2024] 用于多模态理解的视频基础模型与数据

    2,374+0近 7 天星标变化
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer:从头开始或从种子数据生成高质量的合成数据。

    2,197+0近 7 天星标变化
  • genai-processors@google-gemini

    GenAI Processors 是一个轻量级的 Python 库,可实现高效、并行的内容处理。

    2,120+0近 7 天星标变化
  • claude-real-video@HUANGCHIHHUNGLeo

    让 Claude(或任何 LLM)真正观看视频——支持从网址或本地文件获取具场景感知、去除重复帧与文字记录的功能。本地运行,采用 MIT 授权。

    2,109+0近 7 天星标变化
  • parlor@fikrikarim

    具备类似 GPT-Live 功能的设备端实时多模态 AI

    2,048+0近 7 天星标变化
  • Show-o@showlab

    [ICLR & NeurIPS 2025] Show-o 系列存储库,统一多模态理解与生成的单一 Transformer。

    1,975+0近 7 天星标变化
  • 阿里巴巴开源的 Qwen-VL 系列微调开源实现。

    1,961+0近 7 天星标变化
  • BitNet@kyegomez

    在 pytorch 中实现“BitNet: Scaling 1-bit Transformers for Large Language Models”

    1,946+0近 7 天星标变化
  • AdvancedLiterateMachinery@AlibabaResearch

    朝向高级文学机器(Advanced Literate Machinery)的原创创新点子与算法集合。本项目由阿里巴巴集团通义实验室语言技术实验室 OCR 团队维护。

    1,835+0近 7 天星标变化
  • DeTikZify@potamides

    使用 TikZ 为科学图表和草图合成绘图程序。

    1,818+0近 7 天星标变化
  • 为你的应用程序打造的自我编码系统 — 适用于 Android 的 Alan AI SDK

    1,807+0近 7 天星标变化
  • 应用程序的自我编码系统 — 用于 Flutter 的 Alan AI SDK

    1,756+0近 7 天星标变化
  • alan-sdk-ionic@alan-ai

    应用程序的自我编码系统 — 适用于 Ionic 的 Alan AI SDK

    1,649+0近 7 天星标变化
  • pixeltable@pixeltable

    用于 AI 数据应用的统一多模态后端

    1,619+0近 7 天星标变化
  • mllm@UbiquitousLearning

    移动设备上的快速多模态 LLM

    1,602+0近 7 天星标变化
  • thepipe@emcf

    借助视觉语言模型(VLM),从复杂文档中获取干净的数据 ⚡

    1,524+0近 7 天星标变化
  • Ovis@ATH-MaaS

    一种新颖的多模态大型语言模型(MLLM)架构,旨在结构化对齐视觉与文字嵌入。

    1,514+0近 7 天星标变化
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1,468+380近 7 天星标变化
  • ha-llmvision@valentinfrlch

    你家的视觉智能。

    1,454+0近 7 天星标变化
  • awesome-japanese-llm@llm-jp

    日本語LLM总结 - 日本语LLM概览

    1,428+0近 7 天星标变化
  • SDT@dailenson

    此存储库是手写生成中分离书写者与字符风格(CVPR 2023)的官方实现

    1,406+0近 7 天星标变化
  • airunner@Capsize-Games

    用于艺术、实时语音对话、LLM 驱动的聊天机器人与自动化工作流程的离线推理引擎

    1,314+0近 7 天星标变化
  • 包含 155 种以上 VLM/MLLM 架构的精选视觉化目录:包含论文、图表、训练配方、数据集,以及多模态 AI 代理的发布时间轴。

    1,310+0近 7 天星标变化
  • claude-video-vision@jordanrendric

    赋予 Claude 观看与理解视频的能力 — 具有帧提取与多模态语音分析的 Claude Code 外挂程序

    1,281+0近 7 天星标变化
  • UForm@unum-cloud

    袖珍型多模态 AI,用于跨多语言文字、图片和视频的内容理解与生成,速度比 OpenAI CLIP 和 LLaVA 快达 5 倍

    1,247+0近 7 天星标变化
  • xtreme1@xtreme1-io

    Xtreme1 是一个用于多模态数据训练的一体化数据标注平台,支持 3D LiDAR 点云、图像和 LLM。

    1,239+0近 7 天星标变化
  • LLaMA-Mesh@nv-tlabs

    结合语言模型统一 3D 网格生成

    1,167+0近 7 天星标变化
  • doc7@magicrew

    通过视觉理解将文档转换为具备 AI 处理能力的 Markdown

    1,153+0近 7 天星标变化
← 返回主题列表