본문으로 건너뛰기
buildradar
Sign in
토픽 · rlhf

rlhf

rlhf 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
44
총 스타
223,657
평균 스타
5,083
비중
0.01%

같은 리포지토리에 rlhf 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 rlhf 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • LlamaFactory@hiyouga

    100개 이상의 LLM 및 VLM을 위한 통합 효율적 미세 조정(ACL 2024)

    74,532+89최근 7일 스타 변화
  • Open-Assistant@LAION-AI

    OpenAssistant는 작업을 이해하고, 타사 시스템과 상호 작용하며, 이를 위해 동적으로 정보를 검색할 수 있는 채팅 기반 어시스턴트입니다.

    37,401-7최근 7일 스타 변화
  • LLMSurvey@RUCAIBox

    "A Survey of Large Language Models" 설문 논문을 위한 공식 GitHub 페이지

    12,208+2최근 7일 스타 변화
  • InternLM@InternLM

    InternLM 시리즈 공식 릴리스 (InternLM, InternLM2, InternLM2.5, InternLM3).

    7,277+4최근 7일 스타 변화
  • 중국어 LLaMA-2 & Alpaca-2 대형 언어 모델 2기 프로젝트 + 64K 초장문 컨텍스트 모델

    7,120+0최근 7일 스타 변화
  • alignment-handbook@huggingface

    인간 및 AI 선호도에 맞춰 언어 모델을 정렬하기 위한 강력한 레시피

    5,670-3최근 7일 스타 변화
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: 대화만으로 모든 에이전트 학습

    5,665+7최근 7일 스타 변화
  • transformerlab-app@transformerlab

    AI 연구원이 로컬 하드웨어에서 GPU 클러스터에 이르기까지 모델을 원활하게 학습, 평가 및 확장할 수 있는 오픈 소스 연구 환경

    5,185+3최근 7일 스타 변화
  • reasoning-from-scratch@rasbt

    PyTorch로 처음부터 단계별로 추론 LLM 구현하기

    5,138+49최근 7일 스타 변화
  • argilla@argilla-io

    Argilla는 AI 엔지니어와 도메인 전문가가 고품질 데이터셋을 구축하기 위한 협업 도구입니다.

    5,093+5최근 7일 스타 변화
  • Kiln@Kiln-AI

    AI 시스템 구축, 평가 및 최적화. 평가, RAG, 에이전트, 파인튜닝, 합성 데이터 생성, 데이터셋 관리, MCP 등을 포함합니다.

    5,042+5최근 7일 스타 변화
  • align-anything@PKU-Alignment

    Align Anything: 피드백을 통한 전모달(All-modality) 모델 학습

    4,671+3최근 7일 스타 변화
  • awesome-RLHF@opendilab

    인간 피드백 기반 강화 학습(RLHF) 리소스 모음 (지속 업데이트)

    4,424+2최근 7일 스타 변화
  • hands-on-modern-rl@walkinglabs

    🚀 기초 RL 개념부터 LLM 정렬, RLVR, 고급 Agentic 시스템까지의 간극을 메우는 오픈소스 실습 커리큘럼

    4,199+54최근 7일 스타 변화
  • docta@Docta-ai

    데이터를 위한 닥터

    3,485-1최근 7일 스타 변화
  • distilabel@argilla-io

    Distilabel은 검증된 연구 논문을 바탕으로 빠르고 안정적이며 확장 가능한 파이프라인이 필요한 엔지니어를 위한 합성 데이터 및 AI 피드백 프레임워크입니다.

    3,384+3최근 7일 스타 변화
  • ROLL@alibaba

    대형 언어 모델을 이용한 강화 학습을 위한 효율적이고 사용자 친화적인 스케일링 라이브러리

    3,380+6최근 7일 스타 변화
  • TorchLeet@Exorust

    PyTorch를 위한 LeetCode — Google, Meta, Anthropic의 실제 인터뷰에서 출제된 65개의 ML/AI 인터뷰 문제. Jupyter 노트북, 자동 채점기, MCP AI 튜터 제공.

    2,461+12최근 7일 스타 변화
  • rlhf-book@natolambert

    인간 피드백 기반 강화학습(RLHF) 교과서

    2,357+11최근 7일 스타 변화
  • alpaca_eval@tatsu-lab

    지시사항을 따르는 언어 모델을 위한 자동 평가기. 인간 검증을 거쳤으며, 고품질이고 저렴하며 빠릅니다.

    2,012-1최근 7일 스타 변화
  • AgentsMeetRL@thinkwee

    Agentic RL 관련 유용한 목록

    1,832+29최근 7일 스타 변화
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward: 텍스트-이미지 생성을 위한 인간 선호도 학습 및 평가

    1,703+1최근 7일 스타 변화
  • safe-rlhf@PKU-Alignment

    Safe RLHF: 안전한 인간 피드백 기반 강화 학습을 통한 제약된 가치 정렬

    1,613+1최근 7일 스타 변화
  • WebGLM@THUDM

    WebGLM: 효율적인 웹 강화형 질의응답 시스템 (KDD 2023)

    1,601-1최근 7일 스타 변화
  • RLHF를 위한 리워드 모델 학습 레시피

    1,541+0최근 7일 스타 변화
  • MOSS-RLHF@OpenLMLab

    대규모 언어 모델(LLM)의 RLHF 비밀 파트 I: PPO

    1,430+0최근 7일 스타 변화
  • xtreme1@xtreme1-io

    Xtreme1은 멀티모달 데이터 학습을 위한 올인원 데이터 레이블링 및 주석 플랫폼이며 3D LiDAR 포인트 클라우드, 이미지 및 LLM을 지원합니다.

    1,239+2최근 7일 스타 변화
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO: 참조 없는 보상을 활용한 단순 선호도 최적화

    959+1최근 7일 스타 변화
  • verl-omni@verl-project

    디퓨전 및 옴니 모델을 위한 멀티모달 RL 학습 프레임워크

    955+60최근 7일 스타 변화
  • AI-Compass@tingaicompass

    AI 기술의 바다를 항해하는 커뮤니티의 길잡이가 되어 줄 'AI-Compass'. 초보자와 숙련된 개발자 모두 AI의 다양한 분야로 향하는 경로를 찾을 수 있습니다.

    933+10최근 7일 스타 변화
← 토픽 목록으로