본문으로 건너뛰기
buildradar
Sign in
토픽 · vlm

vlm

vlm 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 77개
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    비디오 검색 및 요약(VSS)을 위한 NVIDIA AI Blueprint는 실시간 검증된 알림, 시각적 Q&A, 자동화된 보고 기능을 갖춘 비디오 분석 에이전트를 구축하기 위한 GPU 가속 레퍼런스 아키텍처입니다. VSS Blueprint는 NVIDIA Cosmos 같은 비전 언어 모델(VLM), NVIDIA Nemotron 같은 LLM, RAG 및 NVIDIA NIM을 사용합니다.

    1,840+10최근 7일 스타 변화
  • 🚀🚀🚀 유용한 공개 YOLO 객체 검출 시리즈 프로젝트 및 관련 객체 검출 데이터셋 모음

    1,783-2최근 7일 스타 변화
  • react-native-executorch@software-mansion

    ExecuTorch 기반의 React Native 기기 내 AI 모델 실행을 위한 선언적 방식.

    1,707+5최근 7일 스타 변화
  • OpenGUI@Core-Mate

    OpenGUI는 GUI를 통해 실제 모바일 앱을 보고, 계획하고, 조작할 수 있는 휴대폰 사용 AI를 위한 Android GUI 에이전트 프레임워크입니다.

    1,624+38최근 7일 스타 변화
  • AngelSlim@Tencent

    향상된 사용성, 포괄성, 효율성을 위해 설계된 모델 압축 툴킷.

    1,619+58최근 7일 스타 변화
  • Awesome-Jailbreak-on-LLMs는 최신 기술의 혁신적이고 흥미로운 LLM 탈옥(Jailbreak) 방법 모음입니다. 관련 논문, 코드, 데이터셋, 평가 및 분석을 포함하고 있습니다.

    1,610+5최근 7일 스타 변화
  • unblink@zapdos-labs

    VLM을 이용한 카메라 모니터링

    1,507+2최근 7일 스타 변화
  • AeroSandbox@peterdsharpe

    계산 그래프 변환(예: 자동 미분)을 통해 항공기 설계 최적화를 빠르게 수행합니다. 공기역학, 추진, 구조, 궤도 설계 등을 위한 조합 가능한 분석 도구입니다.

    1,323+4최근 7일 스타 변화
  • 155개 이상의 시각-언어 모델(VLM/MLLM) 아키텍처를 엄선한 시각적 카탈로그: 멀티모달 AI 에이전트를 위한 논문, 다이어그램, 학습 레시피, 데이터셋 및 출시 타임라인.

    1,310+2최근 7일 스타 변화
  • joycaption@fpgaminer

    JoyCaption은 커뮤니티가 디퓨전 모델 학습에 사용할 수 있도록 무료, 개방형, 검열되지 않은 모델로 처음부터 구축된 이미지 캡셔닝 시각 언어 모델(VLM)입니다.

    1,248+1최근 7일 스타 변화
  • CogAgent@zai-org

    오픈소스 엔드투엔드 VLM 기반 GUI 에이전트

    1,195+1최근 7일 스타 변화
  • InternNav@InternRobotics

    일반화된 내비게이션 파운데이션 모델 구축을 위한 InternRobotics의 오픈 플랫폼

    1,090+18최근 7일 스타 변화
  • Bunny@BAAI-DCAI

    경량 멀티모달 모델 패밀리.

    1,053+0최근 7일 스타 변화
  • MindAct@candle-org

    MindSpore + 🤗Huggingface: 완벽한 호환성과 가속을 통해 MindSpore에서 모든 Transformers/Diffusers 모델 실행

    920+0최근 7일 스타 변화
  • Automodel@NVIDIA-NeMo

    Hugging Face를 즉시 지원하는 LLM/VLM용 Pytorch 분산 학습 라이브러리

    906+24최근 7일 스타 변화
  • gpt-assistant-android@Skythinker616

    [에이전트 모드 추가] 음량 버튼으로 불러와 음성 대화가 가능한 안드로이드용 전천후 GPT 어시스턴트. 네트워크 연결, 사진 촬영, 템플릿, 첨부 파일(PDF 및 Office 문서) 분석, 에이전트 모드 등 지원.

    901+0최근 7일 스타 변화
  • UniWorld@PKU-YuanGroup

    UniWorld: 통합 시각적 이해 및 생성을 위한 고해상도 시맨틱 인코더

    890+0최근 7일 스타 변화
  • NEO@EvolvingLMMs-Lab

    NEO 시리즈: 기본 원칙부터 설계된 네이티브 비전-언어 모델입니다.

    888+0최근 7일 스타 변화
  • UniPic@SkyworkAI

    오픈소스 SOTA 멀티 이미지 편집 모델

    874+1최근 7일 스타 변화
  • OpenWorldLib@OpenDCAI

    고급 월드 모델을 위한 통합 코드베이스

    866+2최근 7일 스타 변화
  • "LLM × DATA" 서베이 논문의 공식 저장소

    821+2최근 7일 스타 변화
  • LLM/VLM 등 거대 모델 시대의 로보틱스 분야와 관련된 3D Vision 논문 큐레이션 목록 (awesome-computer-vision에서 영감을 받았으며 논문, 코드, 관련 웹사이트 포함)

    821+1최근 7일 스타 변화
  • LLM, VLM, VLA, AIGC 관련 데이터셋 및 애플리케이션을 다루는 우수한 공개 프로젝트 모음

    815+1최근 7일 스타 변화
  • mobilegym@Purewhiter

    MobileGym: 모바일 GUI 에이전트 연구를 위한 검증 가능하고 고도로 병렬화된 시뮬레이션 플랫폼 · 브라우저에서 실행되는 안드로이드 시뮬레이터 · Browser-hosted Android Simulator · 검증 가능한 평가 · 확장 가능한 온라인 RL 학습

    786+9최근 7일 스타 변화
  • OmniLottie@OpenVGLab

    [CVPR 2026🔥] 🧑‍🎨 OmniLottie, Lottie JSON을 생성하는 오픈소스 멀티모달 지시 기반 벡터 애니메이션 생성기.

    774+3최근 7일 스타 변화
  • dingo@MigoXLab

    Dingo: 종합 AI 데이터, 모델 및 애플리케이션 품질 평가 도구

    754+3최근 7일 스타 변화
  • GeoChat@mbzuai-oryx

    [CVPR 2024 🔥] GeoChat, 원격 탐사를 위한 최초의 그라운디드 대형 비전 언어 모델

    751+6최근 7일 스타 변화
  • SparkVSR@taco-group

    [ECCV 2026] SparkVSR: 희소 키프레임 전파를 통한 인터랙티브 비디오 초해상도

    702+3최근 7일 스타 변화
  • VLM2Vec@TIGER-AI-Lab

    VLM2Vec / MMEB (ICLR 2025), VLM2Vec-V2 / MMEB-V2 (TMLR 2026), MMEB-V3 (COLM 2026) 관련 코드를 포함하는 저장소입니다.

    682+2최근 7일 스타 변화
  • cosmo-edge@cosmo-wander-ai

    Sophon, Rockchip RKNN, x86 등에서 비디오 분석 및 온디바이스 VLM을 지원하는 프로덕션급 C++ 엣지 AI 엔진으로, 시각적 오케스트레이션, 실시간 OSD, 이벤트 및 재현 가능한 벤치마크를 제공합니다.

    658+45최근 7일 스타 변화
← 토픽 목록으로