Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · vision-language-model

vision-language-model

Các kho mã nguồn mở đang theo dõi được gắn thẻ vision-language-model, sắp xếp theo số sao.

59 kho mã
  • prismer@NVlabs

    Bản cài đặt của "Prismer: A Vision-Language Model with Multi-Task Experts".

    1.309+0Thay đổi số sao trong 7 ngày qua
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Khung mã nguồn mở hoàn toàn dành cho đào tạo đa phương thức phi tập trung

    1.195+1Thay đổi số sao trong 7 ngày qua
  • vlms-zero-to-hero@SkalskiP

    Chuỗi bài viết này sẽ đưa bạn từ các kiến thức cơ bản về NLP và Computer Vision đến các mô hình Vision-Language Models tiên tiến nhất.

    1.179+0Thay đổi số sao trong 7 ngày qua
  • doc7@magicrew

    Chuyển đổi tài liệu thành Markdown sẵn sàng cho AI với khả năng nhận diện hình ảnh

    1.153-25Thay đổi số sao trong 7 ngày qua
  • Bộ công cụ thị giác và kỹ năng được thiết kế cho các mô hình thuần văn bản để "xem ảnh" — hỗ trợ hiểu đa ảnh, hỏi đáp hình ảnh, khôi phục UI frontend, tự động hóa GUI và tích hợp liền mạch tùy chọn vào nhiều agent phổ biến, nhận diện trực tiếp ảnh dán | Bộ công cụ thị giác và kỹ năng thiết kế cho LLM thuần văn bản — hỏi đáp hình ảnh, OCR ảnh chụp màn hình dài, khôi phục UI frontend và tự động hóa GUI, tích hợp liền mạch tùy chọn cho Codex, Claude Code, Pi, Oh My Pi và OpenCode

    1.136+18Thay đổi số sao trong 7 ngày qua
  • VisRAG@OpenBMB

    RAG không cần phân tích cú pháp được hỗ trợ bởi VLM

    979-1Thay đổi số sao trong 7 ngày qua
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), mô hình đầu tiên có khả năng tạo phản hồi bằng ngôn ngữ tự nhiên tích hợp liền mạch với các mặt nạ phân đoạn đối tượng.

    967+0Thay đổi số sao trong 7 ngày qua
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: Biểu diễn hình ảnh hợp nhất giúp các mô hình ngôn ngữ lớn có khả năng hiểu hình ảnh và video

    941+0Thay đổi số sao trong 7 ngày qua
  • Bộ sưu tập các bài báo CVPR 2025 nổi bật và có ảnh hưởng nhất. 🔥 [Paper + Code + Demo]

    895+1Thay đổi số sao trong 7 ngày qua
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: Mô hình CLIP tập trung vào bất kỳ vị trí nào bạn muốn

    874+0Thay đổi số sao trong 7 ngày qua
  • dsh-vision-toolkit@Anionex

    [dsh] Bộ công cụ thị giác mạnh mẽ hơn cho các mô hình văn bản thuần túy: cài đặt và sử dụng trong một dòng lệnh, dán ảnh để nhận diện trực tiếp, hỏi đáp nhiều ảnh, chụp màn hình để khôi phục giao diện người dùng|Tích hợp DeepSeek Harness cho bộ công cụ thị giác tác nhân: hỏi đáp ảnh, OCR chụp màn hình dài, khôi phục UI, grounding, so sánh pixel, Artifacts và Web UI.

    856+17Thay đổi số sao trong 7 ngày qua
  • VoxPoser@huangwl18

    VoxPoser: Bản đồ giá trị 3D có thể kết hợp cho thao tác robot với các mô hình ngôn ngữ

    834+1Thay đổi số sao trong 7 ngày qua
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA: Nền tảng mở cho các tác nhân sử dụng máy tính (Computer-Use Agents).

    833+4Thay đổi số sao trong 7 ngày qua
  • MINT-1T@mlfoundations

    🍃 MINT-1T: Một tập dữ liệu đa phương thức xen kẽ với một nghìn tỷ token

    832+0Thay đổi số sao trong 7 ngày qua
  • Danh sách tổng hợp các bài báo về 3D Vision trong lĩnh vực Robotics thời đại mô hình lớn (LLMs/VLMs), lấy cảm hứng từ awesome-computer-vision, bao gồm bài báo, mã nguồn và các trang web liên quan

    821+2Thay đổi số sao trong 7 ngày qua
  • Danh sách tổng hợp các phương pháp học prompt/adapter tuyệt vời cho các mô hình ngôn ngữ thị giác như CLIP.

    797+1Thay đổi số sao trong 7 ngày qua
  • X-VLA@2toinf

    [ICLR 2026] Triển khai chính thức của "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model".

    725+5Thay đổi số sao trong 7 ngày qua
  • OmniVinci@NVlabs

    OmniVinci là một LLM đa phương thức giúp hiểu đồng thời hình ảnh, âm thanh và ngôn ngữ.

    677+0Thay đổi số sao trong 7 ngày qua
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    642+0Thay đổi số sao trong 7 ngày qua
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID: Tập dữ liệu video quy mô lớn với chú thích không gian

    600+1Thay đổi số sao trong 7 ngày qua
  • LAMDA-PILOT@LAMDA-CL

    PILOT: Bộ công cụ học tập liên tục dựa trên mô hình được huấn luyện trước

    600+3Thay đổi số sao trong 7 ngày qua
  • t2v_metrics@linzhiqiu

    Đánh giá các mô hình chuyển văn bản thành hình ảnh/video/3D bằng VQAScore.

    600+0Thay đổi số sao trong 7 ngày qua
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Thay đổi số sao trong 7 ngày qua
  • Groma@FoundationVision

    [ECCV2024] Mô hình ngôn ngữ lớn đa phương thức có căn cứ với mã hóa hình ảnh cục bộ

    586+0Thay đổi số sao trong 7 ngày qua
  • LLaVA-Mini@ictnlp

    LLaVA-Mini là mô hình đa phương thức lớn (LMM) hợp nhất, hỗ trợ hiểu hình ảnh, hình ảnh độ phân giải cao và video một cách hiệu quả.

    577+0Thay đổi số sao trong 7 ngày qua
  • cambrian-s@cambrian-mllm

    Cambrian-S: Hướng tới siêu cảm biến không gian trong video.

    567-1Thay đổi số sao trong 7 ngày qua
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena kết hợp đa phương thức! Multi-Modality Arena cho phép bạn so sánh các mô hình ngôn ngữ thị giác cạnh nhau với đầu vào là hình ảnh. Hỗ trợ MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 và nhiều mô hình khác!

    566+0Thay đổi số sao trong 7 ngày qua
  • Flame-Code-VLM@Flame-Code-VLM

    Flame là một hệ thống AI đa phương thức mã nguồn mở được thiết kế để chuyển đổi các bản thiết kế UI thành mã React chất lượng cao. Nó tận dụng mô hình ngôn ngữ thị giác, tổng hợp dữ liệu tự động và quy trình đào tạo có cấu trúc để thu hẹp khoảng cách giữa thiết kế và phát triển front-end.

    562+0Thay đổi số sao trong 7 ngày qua
  • count-anything@Mengqi-Lei

    Mã nguồn và hướng dẫn triển khai cho bài báo Counting Anything. Trang dự án: https://mengqi-lei.github.io/count-anything-projectpage/

    539+2Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề