본문으로 건너뛰기
buildradar
Sign in
토픽 · vision-language-model

vision-language-model

vision-language-model 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
59
총 스타
150,825
평균 스타
2,556
비중
0.01%

같은 리포지토리에 vision-language-model 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 vision-language-model 태그가 달린 리포지토리예요.

  • doc7@magicrew

    시각적 이해를 통해 문서를 AI 학습용 Markdown으로 변환

    1,153
  • 텍스트 전용 LLM을 위한 더 나은 시각 툴킷 및 스킬(다중 이미지 이해, 이미지 Q&A, 프론트엔드 UI 복원, GUI 자동화 등 지원, 여러 주요 에이전트와 선택적 연동 가능, 복사한 이미지 직접 인식)

    1,136
  • dsh-vision-toolkit@Anionex

    [dsh] 순수 텍스트 모델을 위한 강력한 비주얼 툴박스: 무료 설치 및 사용, 이미지 붙여넣기로 즉시 인식, 다중 이미지 Q&A, 스크린샷에서 프론트엔드 UI 복원 등 | 에이전트 비전 툴킷을 위한 DeepSeek Harness 네이티브 통합: 이미지 Q&A, 롱 스크린샷 OCR, UI 복원, 그라운딩, 픽셀 차이, 아티팩트 및 웹 UI

    856
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] GPT-4V 수준 이상의 기능을 목표로 구축된 Visual Instruction Tuning (LLaVA).

    25,014+9최근 7일 스타 변화
  • X-AnyLabeling@CVHub520

    X-AnyLabeling: 텍스트, 이미지, 비디오, 멀티모달 데이터를 주석 처리하기 위한 가볍고 효율적인 통합 크로스플랫폼 데스크톱 애플리케이션으로, 다용도 내장 도구와 최첨단 AI 모델 및 유연한 다중 형식 내보내기를 결합했습니다.

    10,313+59최근 7일 스타 변화
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] InternVL 패밀리: GPT-4o를 대체하는 선구적인 오픈소스 대안. GPT-4o에 준하는 성능을 가진 오픈소스 멀티모달 대화형 모델

    10,150+3최근 7일 스타 변화
  • minimind-v@jingyaogong

    👀 단 2시간 만에 처음부터 65M 파라미터 VLM 학습하기!

    8,535+40최근 7일 스타 변화
  • Qwen-VL@QwenLM

    Alibaba Cloud에서 제안한 Qwen-VL(通义千问-VL) 챗 및 사전 학습된 대형 비전 언어 모델의 공식 저장소입니다.

    6,727+1최근 7일 스타 변화
  • MineContext@volcengine

    MineContext는 능동적인 컨텍스트 인식 AI 파트너입니다 (Context-Engineering+ChatGPT Pulse)

    5,497+1최근 7일 스타 변화
  • mlx-vlm@Blaizzy

    MLX-VLM은 MLX를 사용하여 Mac에서 Vision Language Models (VLM)의 추론 및 파인튜닝을 수행하기 위한 패키지입니다.

    5,462+25최근 7일 스타 변화
  • align-anything@PKU-Alignment

    Align Anything: 피드백을 통한 전모달(All-modality) 모델 학습

    4,671+3최근 7일 스타 변화
  • lmms-eval@EvolvingLMMs-Lab

    텍스트, 이미지, 비디오, 오디오 작업을 아우르는 올인원 멀티모달 평가 툴킷

    4,390+7최근 7일 스타 변화
  • DeepSeek-VL@deepseek-ai

    DeepSeek-VL: 실제 환경의 비전-언어 이해를 향하여

    4,177+2최근 7일 스타 변화
  • MiniMax-01@MiniMax-AI

    Linear Attention 기반의 거대 언어 모델 및 비전 언어 모델인 MiniMax-Text-01 및 MiniMax-VL-01의 공식 리포지토리

    3,467+0최근 7일 스타 변화
  • MGM@JIA-Lab-research

    "Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models" 공식 저장소

    3,327+0최근 7일 스타 변화
  • VLM_survey@jingyi0000

    비전 작업을 위한 멋진 비전 언어 모델(VLM) 모음

    3,126+0최근 7일 스타 변화
  • OGAM@off-grid-ai

    오프라인 AI를 위한 스위스 아미 나이프. 휴대폰이나 Mac에서 GGUF LLM, 비전, Whisper 음성 인식, Stable Diffusion, 툴 호출, 로컬 네트워크 서버를 활용해 채팅하고, 보고, 말하고, 이미지를 생성하세요. CPU, GPU, NPU에서 실행됩니다. 계정도, API 키도 없으며 데이터가 기기 외부로 전혀 유출되지 않습니다.

    3,038+17최근 7일 스타 변화
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: 장기 스트리밍 비디오 및 오디오 상호작용을 위한 종합 멀티모달 시스템

    2,925-1최근 7일 스타 변화
  • colpali@illuin-tech

    ColPali, ColQwen2, ColSmol 등 ColVision 모델을 학습하고 추론을 실행하는 데 사용되는 코드.

    2,809+7최근 7일 스타 변화
  • Cradle@BAAI-Agents

    Cradle 프레임워크는 General Computer Control(GCC)을 위한 첫 번째 시도입니다. 최소한의 요구사항을 가진 표준화된 일반 환경에서 강력한 추론 능력, 자기 개선, 스킬 큐레이션을 통해 에이전트가 모든 컴퓨터 작업을 수행할 수 있도록 지원합니다.

    2,578+2최근 7일 스타 변화
  • Alibaba Cloud의 Qwen-VL 시리즈 파인튜닝을 위한 오픈소스 구현체입니다.

    1,961+1최근 7일 스타 변화
  • ShowUI@showlab

    [CVPR 2025] GUI 에이전트 및 컴퓨터 사용을 위한 오픈소스 엔드투엔드 Vision-Language-Action 모델

    1,896+2최근 7일 스타 변화
  • Awesome-LLM4AD@Thinklab-SJTU

    자율 주행을 위한 유용한 LLM/VLM/VLA/세계 모델(LLM4AD) 리소스 큐레이션 목록 (지속 업데이트)

    1,890-2최근 7일 스타 변화
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    비디오 검색 및 요약(VSS)을 위한 NVIDIA AI Blueprint는 실시간 검증된 알림, 시각적 Q&A, 자동화된 보고 기능을 갖춘 비디오 분석 에이전트를 구축하기 위한 GPU 가속 레퍼런스 아키텍처입니다. VSS Blueprint는 NVIDIA Cosmos 같은 비전 언어 모델(VLM), NVIDIA Nemotron 같은 LLM, RAG 및 NVIDIA NIM을 사용합니다.

    1,840+10최근 7일 스타 변화
  • AdvancedLiterateMachinery@AlibabaResearch

    고급 리터러트 머시너리(Advanced Literate Machinery)를 위한 독창적이고 혁신적인 아이디어 및 알고리즘 모음입니다. 이 프로젝트는 Alibaba Group Tongyi Lab Language Technology Lab의 OCR 팀에서 유지 관리합니다.

    1,835+1최근 7일 스타 변화
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL은 범용 멀티모달 이해 및 추론 능력을 향상시키기 위해 설계된 비전-언어 파운데이션 모델로, 60개의 공개 벤치마크 중 38개에서 최고 수준(SOTA)의 성능을 달성했습니다.

    1,586+0최근 7일 스타 변화
  • vllm-mlx@waybarrios

    Apple Silicon을 위한 고성능 OpenAI 및 Anthropic 호환 LLM 추론 서버. 네이티브 MLX, 연속 배치, 멀티모달 모델, MCP 도구 호출 및 Claude Code 지원.

    1,557+6최근 7일 스타 변화
  • thepipe@emcf

    비전 언어 모델을 기반으로 복잡한 문서에서 깔끔한 데이터 추출 ⚡

    1,524+0최근 7일 스타 변화
  • [ICCV 2025] Describe Anything 구현: 상세하고 지역화된 이미지 및 비디오 캡셔닝

    1,517+3최근 7일 스타 변화
  • Ovis@ATH-MaaS

    시각 및 텍스트 임베딩을 구조적으로 정렬하도록 설계된 새로운 멀티모달 대형 언어 모델(MLLM) 아키텍처입니다.

    1,514+2최근 7일 스타 변화
  • awesome-japanese-llm@llm-jp

    일본어 LLM 모음 - Overview of Japanese LLMs

    1,428+1최근 7일 스타 변화
  • mlx-tune@ARahim3

    Apple Silicon Mac에서 LLM 파인튜닝. MLX 네이티브 기반 SFT, DPO, GRPO, Vision, TTS, STT, Embedding, OCR 파인튜닝 지원. Unsloth 호환 API.

    1,398+8최근 7일 스타 변화
  • 멋진 통합 멀티모달 모델 모음

    1,314+1최근 7일 스타 변화
← 토픽 목록으로