본문으로 건너뛰기
buildradar
Sign in
토픽 · llava

llava

llava 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
21
총 스타
66,002
평균 스타
3,143
비중
0.00%

같은 리포지토리에 llava 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 llava 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] GPT-4V 수준 이상의 기능을 목표로 구축된 Visual Instruction Tuning (LLaVA).

    25,014+12최근 7일 스타 변화
  • SUPIR@Fanghua-Yu

    SUPIR은 실제 환경에서의 사실적인 이미지 복원을 위한 실용적인 알고리즘 개발을 목표로 합니다. 새로운 온라인 데모도 suppixel.ai에 공개되었습니다.

    5,649+0최근 7일 스타 변화
  • mlx-vlm@Blaizzy

    MLX-VLM은 MLX를 사용하여 Mac에서 Vision Language Models (VLM)의 추론 및 파인튜닝을 수행하기 위한 패키지입니다.

    5,462+41최근 7일 스타 변화
  • VLMEvalKit@open-compass

    대규모 멀티모달 모델(LMM)을 위한 오픈소스 평가 툴킷, 220개 이상의 LMM과 80개 이상의 벤치마크 지원

    4,375+15최근 7일 스타 변화
  • zero_nlp@yuanzhoulvpi2017

    중국어 NLP 솔루션 (대규모 모델, 데이터, 모델, 학습, 추론)

    3,836+2최근 7일 스타 변화
  • LLamaSharp@SciSharp

    로컬 기기에서 LLM(🦙LLaMA/LLaVA)을 효율적으로 실행하기 위한 C#/.NET 라이브러리.

    3,790+3최근 7일 스타 변화
  • Eagle@NVlabs

    Eagle: 데이터 중심 전략을 적용한 최첨단 비전-언어 모델

    3,511+46최근 7일 스타 변화
  • OmAgent@om-ai-lab

    [EMNLP-2024] 빠른 프로토타입 및 프로덕션을 위한 멀티모달 언어 에이전트 구축

    2,666+1최근 7일 스타 변화
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT는 비디오에 대한 의미 있는 대화를 생성할 수 있는 비디오 대화 모델입니다. LLM의 기능과 시공간 비디오 표현에 맞게 조정된 사전 훈련된 시각 인코더를 결합합니다. 또한 비디오 기반 대화 모델을 위한 엄격한 '정량적 평가 벤치마킹'을 소개합니다.

    1,507+1최근 7일 스타 변화
  • taggui@jhc13

    이미지 데이터셋을 위한 태그 관리자 및 캡션 생성기

    1,348+2최근 7일 스타 변화
  • UForm@unum-cloud

    다국어 텍스트, 이미지, 비디오 전반의 콘텐츠 이해 및 생성을 위한 포켓 사이즈 멀티모달 AI, OpenAI CLIP 및 LLaVA보다 최대 5배 빠름 🖼️ & 🖋️

    1,247+2최근 7일 스타 변화
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    민주화된 멀티모달 학습을 위한 완전 오픈 프레임워크

    1,195+3최근 7일 스타 변화
  • TinyLLaVA_Factory@TinyLLaVA

    소규모 대형 멀티모달 모델 프레임워크

    1,004+1최근 7일 스타 변화
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++: Phi-3 및 LLaMA-3로 LLaVA 확장 (LLaVA LLaMA-3, LLaVA Phi-3)

    842+0최근 7일 스타 변화
  • machina@PsyChip

    OpenCV+YOLO+LLAVA 기반 비디오 감시 시스템

    794+1최근 7일 스타 변화
  • PaddleMIX@PaddlePaddle

    Paddle 멀티모달 통합 및 탐색 도구. 엔드투엔드 대규모 멀티모달 사전 학습 모델 및 디퓨전 모델 툴박스를 포함한 주요 멀티모달 작업을 지원하며, 높은 성능과 유연성을 제공합니다.

    723+1최근 7일 스타 변화
  • 비전-언어 모델 논문 및 모델을 모아놓은 프론트엔드 컬렉션 및 조사 저장소. 지속적으로 업데이트됨

    705+5최근 7일 스타 변화
  • 주요 파운데이션 및 멀티모달 모델을 정리한 큐레이션 리스트 (논문, 코드, 예제, 튜토리얼 포함)

    637+0최근 7일 스타 변화
  • ComfyUI_VLM_nodes@gokayfem

    Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V 등 비전-언어 모델을 위한 ComfyUI 노드입니다. 오픈 어휘 탐지, SAM2/SAM3 세그멘테이션, 비디오 시간 추론, llama.cpp 기반 GGUF 및 호스팅된 LLM/VLM API를 지원합니다.

    589+1최근 7일 스타 변화
  • LLaVA-Mini@ictnlp

    LLaVA-Mini는 이미지, 고해상도 이미지 및 비디오 이해를 효율적으로 지원하는 통합 대규모 멀티모달 모델(LMM)입니다.

    577+0최근 7일 스타 변화
  • llama-assistant@nrl-ai

    Llama 3, DeepSeek R1 및 HuggingFace의 다양한 모델을 기반으로 일상 업무를 지원하는 AI 어시스턴트입니다.

    530+0최근 7일 스타 변화
← 토픽 목록으로