Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · vision-language-model

vision-language-model

Các kho mã nguồn mở đang theo dõi được gắn thẻ vision-language-model, sắp xếp theo số sao.

Kho mã
59
Tổng số sao
150.825
Số sao trung bình
2.556
Tỷ trọng
0,01%

Những chủ đề thường xuất hiện cùng vision-language-model trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ vision-language-model.

  • doc7@magicrew

    Chuyển đổi tài liệu thành Markdown sẵn sàng cho AI với khả năng nhận diện hình ảnh

    1.153
  • Bộ công cụ thị giác và kỹ năng được thiết kế cho các mô hình thuần văn bản để "xem ảnh" — hỗ trợ hiểu đa ảnh, hỏi đáp hình ảnh, khôi phục UI frontend, tự động hóa GUI và tích hợp liền mạch tùy chọn vào nhiều agent phổ biến, nhận diện trực tiếp ảnh dán | Bộ công cụ thị giác và kỹ năng thiết kế cho LLM thuần văn bản — hỏi đáp hình ảnh, OCR ảnh chụp màn hình dài, khôi phục UI frontend và tự động hóa GUI, tích hợp liền mạch tùy chọn cho Codex, Claude Code, Pi, Oh My Pi và OpenCode

    1.136
  • dsh-vision-toolkit@Anionex

    [dsh] Bộ công cụ thị giác mạnh mẽ hơn cho các mô hình văn bản thuần túy: cài đặt và sử dụng trong một dòng lệnh, dán ảnh để nhận diện trực tiếp, hỏi đáp nhiều ảnh, chụp màn hình để khôi phục giao diện người dùng|Tích hợp DeepSeek Harness cho bộ công cụ thị giác tác nhân: hỏi đáp ảnh, OCR chụp màn hình dài, khôi phục UI, grounding, so sánh pixel, Artifacts và Web UI.

    856
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Tinh chỉnh hướng dẫn trực quan (LLaVA) được xây dựng hướng tới khả năng ngang tầm GPT-4V và xa hơn nữa.

    25.014+9Thay đổi số sao trong 7 ngày qua
  • X-AnyLabeling@CVHub520

    X-AnyLabeling: Một ứng dụng desktop đa nền tảng gọn nhẹ, hiệu quả và thống nhất để chú thích văn bản, hình ảnh, video và dữ liệu đa phương thức, kết hợp các công cụ tích hợp linh hoạt với các mô hình AI tiên tiến và khả năng xuất đa định dạng linh hoạt.

    10.313+59Thay đổi số sao trong 7 ngày qua
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] Họ InternVL: Giải pháp thay thế nguồn mở tiên phong cho GPT-4o. Mô hình đối thoại đa phương thức nguồn mở có hiệu suất gần bằng GPT-4o

    10.150+3Thay đổi số sao trong 7 ngày qua
  • minimind-v@jingyaogong

    👀 Huấn luyện một VLM 65 triệu tham số từ đầu chỉ trong 2 giờ!

    8.535+40Thay đổi số sao trong 7 ngày qua
  • Qwen-VL@QwenLM

    Kho lưu trữ chính thức của Qwen-VL (通义千问-VL), mô hình ngôn ngữ thị giác lớn trò chuyện và huấn luyện trước do Alibaba Cloud đề xuất.

    6.727+1Thay đổi số sao trong 7 ngày qua
  • MineContext@volcengine

    MineContext là đối tác AI chủ động, nhận thức ngữ cảnh của bạn (Context-Engineering+ChatGPT Pulse)

    5.497+1Thay đổi số sao trong 7 ngày qua
  • mlx-vlm@Blaizzy

    MLX-VLM là một gói để suy luận và tinh chỉnh các Mô hình Ngôn ngữ Thị giác (VLM) trên Mac sử dụng MLX.

    5.462+25Thay đổi số sao trong 7 ngày qua
  • align-anything@PKU-Alignment

    Align Anything: Huấn luyện mô hình đa phương thức với phản hồi

    4.671+3Thay đổi số sao trong 7 ngày qua
  • lmms-eval@EvolvingLMMs-Lab

    Bộ công cụ đánh giá đa phương thức toàn diện cho các tác vụ Văn bản, Hình ảnh, Video và Âm thanh

    4.390+7Thay đổi số sao trong 7 ngày qua
  • DeepSeek-VL@deepseek-ai

    DeepSeek-VL: Hướng tới Hiểu biết Tầm nhìn-Ngôn ngữ trong Thế giới Thực

    4.177+2Thay đổi số sao trong 7 ngày qua
  • MiniMax-01@MiniMax-AI

    Kho lưu trữ chính thức của MiniMax-Text-01 và MiniMax-VL-01, mô hình ngôn ngữ lớn & mô hình ngôn ngữ thị giác dựa trên Linear Attention

    3.467+0Thay đổi số sao trong 7 ngày qua
  • MGM@JIA-Lab-research

    Kho lưu trữ chính thức cho "Mini-Gemini: Khai thác tiềm năng của các Mô hình Ngôn ngữ Tầm nhìn Đa phương thức"

    3.327+0Thay đổi số sao trong 7 ngày qua
  • VLM_survey@jingyi0000

    Bộ sưu tập các mô hình thị giác-ngôn ngữ AWESOME cho các tác vụ thị giác

    3.126+0Thay đổi số sao trong 7 ngày qua
  • OGAM@off-grid-ai

    Bộ công cụ đa năng cho AI ngoại tuyến. Trò chuyện, xem, nói chuyện và tạo hình ảnh trên điện thoại hoặc Mac — GGUF LLMs, thị giác máy tính, chuyển giọng nói thành văn bản Whisper, Stable Diffusion, gọi công cụ và máy chủ mạng nội bộ. Chạy trên CPU, GPU hoặc NPU của bạn. Không tài khoản, không khóa API, dữ liệu không rời khỏi thiết bị của bạn.

    3.038+17Thay đổi số sao trong 7 ngày qua
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Hệ thống đa phương thức toàn diện cho tương tác video và âm thanh phát streaming thời gian dài

    2.925-1Thay đổi số sao trong 7 ngày qua
  • colpali@illuin-tech

    Mã nguồn được sử dụng để huấn luyện và chạy suy luận với các mô hình ColVision, ví dụ: ColPali, ColQwen2 và ColSmol.

    2.809+7Thay đổi số sao trong 7 ngày qua
  • Cradle@BAAI-Agents

    Framework Cradle là nỗ lực đầu tiên về Điều khiển Máy tính Tổng quát (GCC). Cradle hỗ trợ các agent hoàn thành xuất sắc mọi tác vụ máy tính bằng cách cho phép khả năng suy luận mạnh mẽ, tự cải thiện và quản lý kỹ năng, trong một môi trường chung chuẩn hóa với các yêu cầu tối thiểu.

    2.578+2Thay đổi số sao trong 7 ngày qua
  • Một bản cài đặt mã nguồn mở để tinh chỉnh chuỗi Qwen-VL bởi Alibaba Cloud.

    1.961+1Thay đổi số sao trong 7 ngày qua
  • ShowUI@showlab

    [CVPR 2025] Mô hình Vision-Language-Action mã nguồn mở, đầu cuối dành cho GUI Agent & Computer Use.

    1.896+2Thay đổi số sao trong 7 ngày qua
  • Awesome-LLM4AD@Thinklab-SJTU

    Danh sách các tài nguyên tuyệt vời về LLM/VLM/VLA/Mô hình Thế giới cho Xe tự hành (LLM4AD) (được cập nhật liên tục)

    1.890-2Thay đổi số sao trong 7 ngày qua
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA AI Blueprint cho tìm kiếm và tóm tắt video (VSS) là một kiến trúc tham chiếu tăng tốc bằng GPU để xây dựng các tác nhân phân tích video với cảnh báo được xác thực theo thời gian thực, hỏi đáp trực quan và báo cáo tự động. VSS Blueprint sử dụng các mô hình ngôn ngữ tầm nhìn (VLMs) như NVIDIA Cosmos, LLMs như NVIDIA Nemotron, RAG và NVIDIA NIMs.

    1.840+10Thay đổi số sao trong 7 ngày qua
  • AdvancedLiterateMachinery@AlibabaResearch

    Bộ sưu tập các ý tưởng và thuật toán độc đáo, sáng tạo hướng tới Máy móc văn bản nâng cao. Dự án này được duy trì bởi Nhóm OCR thuộc Phòng thí nghiệm Công nghệ Ngôn ngữ, Phòng thí nghiệm Thông Y, Alibaba Group.

    1.835+1Thay đổi số sao trong 7 ngày qua
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, một mô hình nền tảng ngôn ngữ-thị giác được thiết kế để thúc đẩy khả năng hiểu và suy luận đa phương thức đa năng, đạt hiệu suất hàng đầu trên 38 trong tổng số 60 benchmark công khai.

    1.586+0Thay đổi số sao trong 7 ngày qua
  • vllm-mlx@waybarrios

    Máy chủ suy luận LLM hiệu năng cao tương thích với OpenAI và Anthropic dành cho Apple Silicon. Hỗ trợ MLX native, continuous batching, các mô hình đa phương thức, gọi công cụ MCP và Claude Code.

    1.557+6Thay đổi số sao trong 7 ngày qua
  • thepipe@emcf

    Lấy dữ liệu sạch từ các tài liệu phức tạp, được hỗ trợ bởi các mô hình thị giác-ngôn ngữ ⚡

    1.524+0Thay đổi số sao trong 7 ngày qua
  • [ICCV 2025] Triển khai cho Describe Anything: Chú thích hình ảnh và video cục bộ chi tiết

    1.517+3Thay đổi số sao trong 7 ngày qua
  • Ovis@ATH-MaaS

    Một kiến trúc Mô hình Ngôn ngữ Lớn Đa phương thức (MLLM) mới, được thiết kế để căn chỉnh cấu trúc giữa các embedding thị giác và văn bản.

    1.514+2Thay đổi số sao trong 7 ngày qua
  • awesome-japanese-llm@llm-jp

    Tổng quan về các LLM tiếng Nhật

    1.428+1Thay đổi số sao trong 7 ngày qua
  • mlx-tune@ARahim3

    Tinh chỉnh LLM trên máy Mac của bạn với Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding và tinh chỉnh OCR — chạy gốc trên MLX. API tương thích với Unsloth.

    1.398+8Thay đổi số sao trong 7 ngày qua
  • Các mô hình đa phương thức hợp nhất tuyệt vời

    1.314+1Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề