vision-language-model
vision-language-model 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 vision-language-model 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 vision-language-model 태그가 달린 리포지토리예요.
- #1★ 1,153
- #2
텍스트 전용 LLM을 위한 더 나은 시각 툴킷 및 스킬(다중 이미지 이해, 이미지 Q&A, 프론트엔드 UI 복원, GUI 자동화 등 지원, 여러 주요 에이전트와 선택적 연동 가능, 복사한 이미지 직접 인식)
★ 1,136 - #3
[dsh] 순수 텍스트 모델을 위한 강력한 비주얼 툴박스: 무료 설치 및 사용, 이미지 붙여넣기로 즉시 인식, 다중 이미지 Q&A, 스크린샷에서 프론트엔드 UI 복원 등 | 에이전트 비전 툴킷을 위한 DeepSeek Harness 네이티브 통합: 이미지 Q&A, 롱 스크린샷 OCR, UI 복원, 그라운딩, 픽셀 차이, 아티팩트 및 웹 UI
★ 856 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1★ 25,014+9최근 7일 스타 변화
- #2
X-AnyLabeling: 텍스트, 이미지, 비디오, 멀티모달 데이터를 주석 처리하기 위한 가볍고 효율적인 통합 크로스플랫폼 데스크톱 애플리케이션으로, 다용도 내장 도구와 최첨단 AI 모델 및 유연한 다중 형식 내보내기를 결합했습니다.
★ 10,313+59최근 7일 스타 변화 - #3
[CVPR 2024 Oral] InternVL 패밀리: GPT-4o를 대체하는 선구적인 오픈소스 대안. GPT-4o에 준하는 성능을 가진 오픈소스 멀티모달 대화형 모델
★ 10,150+3최근 7일 스타 변화 - #4
👀 단 2시간 만에 처음부터 65M 파라미터 VLM 학습하기!
★ 8,535+40최근 7일 스타 변화 - #5★ 6,727+1최근 7일 스타 변화
- #6
MineContext는 능동적인 컨텍스트 인식 AI 파트너입니다 (Context-Engineering+ChatGPT Pulse)
★ 5,497+1최근 7일 스타 변화 - #7★ 5,462+25최근 7일 스타 변화
- #8
Align Anything: 피드백을 통한 전모달(All-modality) 모델 학습
★ 4,671+3최근 7일 스타 변화 - #9★ 4,390+7최근 7일 스타 변화
- #10
DeepSeek-VL: 실제 환경의 비전-언어 이해를 향하여
★ 4,177+2최근 7일 스타 변화 - #11
Linear Attention 기반의 거대 언어 모델 및 비전 언어 모델인 MiniMax-Text-01 및 MiniMax-VL-01의 공식 리포지토리
★ 3,467+0최근 7일 스타 변화 - #12
"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models" 공식 저장소
★ 3,327+0최근 7일 스타 변화 - #13
비전 작업을 위한 멋진 비전 언어 모델(VLM) 모음
★ 3,126+0최근 7일 스타 변화 - #14
오프라인 AI를 위한 스위스 아미 나이프. 휴대폰이나 Mac에서 GGUF LLM, 비전, Whisper 음성 인식, Stable Diffusion, 툴 호출, 로컬 네트워크 서버를 활용해 채팅하고, 보고, 말하고, 이미지를 생성하세요. CPU, GPU, NPU에서 실행됩니다. 계정도, API 키도 없으며 데이터가 기기 외부로 전혀 유출되지 않습니다.
★ 3,038+17최근 7일 스타 변화 - #15
InternLM-XComposer2.5-OmniLive: 장기 스트리밍 비디오 및 오디오 상호작용을 위한 종합 멀티모달 시스템
★ 2,925-1최근 7일 스타 변화 - #16★ 2,809+7최근 7일 스타 변화
- #17
Cradle 프레임워크는 General Computer Control(GCC)을 위한 첫 번째 시도입니다. 최소한의 요구사항을 가진 표준화된 일반 환경에서 강력한 추론 능력, 자기 개선, 스킬 큐레이션을 통해 에이전트가 모든 컴퓨터 작업을 수행할 수 있도록 지원합니다.
★ 2,578+2최근 7일 스타 변화 - #18
Alibaba Cloud의 Qwen-VL 시리즈 파인튜닝을 위한 오픈소스 구현체입니다.
★ 1,961+1최근 7일 스타 변화 - #19★ 1,896+2최근 7일 스타 변화
- #20
자율 주행을 위한 유용한 LLM/VLM/VLA/세계 모델(LLM4AD) 리소스 큐레이션 목록 (지속 업데이트)
★ 1,890-2최근 7일 스타 변화 - #21
비디오 검색 및 요약(VSS)을 위한 NVIDIA AI Blueprint는 실시간 검증된 알림, 시각적 Q&A, 자동화된 보고 기능을 갖춘 비디오 분석 에이전트를 구축하기 위한 GPU 가속 레퍼런스 아키텍처입니다. VSS Blueprint는 NVIDIA Cosmos 같은 비전 언어 모델(VLM), NVIDIA Nemotron 같은 LLM, RAG 및 NVIDIA NIM을 사용합니다.
★ 1,840+10최근 7일 스타 변화 - #22
고급 리터러트 머시너리(Advanced Literate Machinery)를 위한 독창적이고 혁신적인 아이디어 및 알고리즘 모음입니다. 이 프로젝트는 Alibaba Group Tongyi Lab Language Technology Lab의 OCR 팀에서 유지 관리합니다.
★ 1,835+1최근 7일 스타 변화 - #23
Seed1.5-VL은 범용 멀티모달 이해 및 추론 능력을 향상시키기 위해 설계된 비전-언어 파운데이션 모델로, 60개의 공개 벤치마크 중 38개에서 최고 수준(SOTA)의 성능을 달성했습니다.
★ 1,586+0최근 7일 스타 변화 - #24
Apple Silicon을 위한 고성능 OpenAI 및 Anthropic 호환 LLM 추론 서버. 네이티브 MLX, 연속 배치, 멀티모달 모델, MCP 도구 호출 및 Claude Code 지원.
★ 1,557+6최근 7일 스타 변화 - #25★ 1,524+0최근 7일 스타 변화
- #26
[ICCV 2025] Describe Anything 구현: 상세하고 지역화된 이미지 및 비디오 캡셔닝
★ 1,517+3최근 7일 스타 변화 - #27★ 1,514+2최근 7일 스타 변화
- #28
일본어 LLM 모음 - Overview of Japanese LLMs
★ 1,428+1최근 7일 스타 변화 - #29
Apple Silicon Mac에서 LLM 파인튜닝. MLX 네이티브 기반 SFT, DPO, GRPO, Vision, TTS, STT, Embedding, OCR 파인튜닝 지원. Unsloth 호환 API.
★ 1,398+8최근 7일 스타 변화 - #30
멋진 통합 멀티모달 모델 모음
★ 1,314+1최근 7일 스타 변화