본문으로 건너뛰기
buildradar
Sign in
토픽 · rlhf

rlhf

rlhf 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 44개
  • HALOs@ContextualAI

    DPO, KTO, PPO, ORPO 및 기타 인간 맞춤형 손실 함수(HALO)의 확장 가능한 구현을 제공하는 라이브러리

    909-1최근 7일 스타 변화
  • OpenJudge@agentscope-ai

    OpenJudge: 종합적인 평가 및 품질 보상을 위한 통합 프레임워크

    820+14최근 7일 스타 변화
  • 대형 언어 모델의 온폴리시 증류(OPD)를 위한 논문, 기술 보고서, 프레임워크 및 도구 모음

    794+31최근 7일 스타 변화
  • reward-bench@allenai

    RewardBench: 보상 모델을 위한 최초의 평가 도구입니다.

    735+2최근 7일 스타 변화
  • Trinity-RFT@agentscope-ai

    Trinity-RFT는 거대 언어 모델(LLM)의 강화 미세 조정(RFT)을 위해 설계된 범용적이고 유연하며 확장 가능한 프레임워크입니다.

    698+2최근 7일 스타 변화
  • oat@sail-sg

    OAT: 강화 학습, 선호도 학습 등을 포함하는 LLM 온라인 정렬을 위한 연구 친화적 프레임워크

    669-1최근 7일 스타 변화
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) 및 AutoTool (ICML 2026), DemyAgent: LLM 및 에이전트 시나리오를 위한 오픈소스 강화학습

    634+9최근 7일 스타 변화
  • LLamaTuner@jianzhnie

    LLM의 쉽고 효율적인 미세 조정 (Llama, Llama2, Llama3, Qwen, Baichuan, GLM, Falcon 지원). 대형 모델의 고효율 양자화 훈련 및 배포

    621+0최근 7일 스타 변화
  • Relax@redai-studio

    대규모 전모달 사후 학습을 위한 비동기 강화 학습 엔진

    592+11최근 7일 스타 변화
  • SPPO@uclaml

    Self-Play Preference Optimization (SPPO) 공식 구현체

    589+0최근 7일 스타 변화
  • TextRL@voidful

    Hugging Face transformers의 모든 생성 모델(bloomz-176B/bloom/gpt/bart/T5/MetaICL)에 ChatGPT RLHF(인간 피드백 기반 강화학습) 구현

    564+0최근 7일 스타 변화
  • Online-RLHF@RLHFlow

    온라인 RLHF 및 온라인 반복 DPO를 위한 레시피

    544+0최근 7일 스타 변화
  • 대규모 언어 모델(LLM)을 위한 On-Policy Distillation 관련 논문 및 리소스 모음

    535+10최근 7일 스타 변화
  • dLLM-RL@Gen-Verse

    [ICLR 2026] TraceRL 공식 코드: Diffusion LLM의 사후 학습을 혁신하고 SOTA TraDo 시리즈를 구동함.

    520+1최근 7일 스타 변화
← 토픽 목록으로