본문으로 건너뛰기
buildradar
Sign in
토픽 · dpo

dpo

dpo 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
11
총 스타
33,060
평균 스타
3,005
비중
0.00%

같은 리포지토리에 dpo 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 dpo 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • oumi@oumi-ai

    Qwen, Gemma 또는 모든 오픈 웨이트 LLM을 손쉽게 파인튜닝, 평가 및 배포하세요!

    9,383+3최근 7일 스타 변화
  • MedicalGPT@shibing624

    MedicalGPT: ChatGPT 학습 파이프라인으로 나만의 의료용 GPT 모델 학습하기. 사전 훈련(PT), 지도 미세 조정(SFT), RLHF, DPO, ORPO, GRPO를 포함한 의료용 대형 모델 학습 구현

    5,771+12최근 7일 스타 변화
  • Soup@MakazhanAlpamys

    단일 YAML로 LLM 파인튜닝. 레이어 스트리밍을 통해 4GB 노트북 GPU에서 8B 모델 학습 가능

    4,929+1,365최근 7일 스타 변화
  • align-anything@PKU-Alignment

    Align Anything: 피드백을 통한 전모달(All-modality) 모델 학습

    4,671+3최근 7일 스타 변화
  • hands-on-modern-rl@walkinglabs

    🚀 기초 RL 개념부터 LLM 정렬, RLVR, 고급 Agentic 시스템까지의 간극을 메우는 오픈소스 실습 커리큘럼

    4,199+54최근 7일 스타 변화
  • HALOs@ContextualAI

    DPO, KTO, PPO, ORPO 및 기타 인간 맞춤형 손실 함수(HALO)의 확장 가능한 구현을 제공하는 라이브러리

    909-1최근 7일 스타 변화
  • DeepMesh@zhaorw02

    [ICCV 2025] DeepMesh 공식 코드: 강화 학습을 활용한 자동 회귀 아티스트 메쉬 생성

    736+1최근 7일 스타 변화
  • oat@sail-sg

    OAT: 강화 학습, 선호도 학습 등을 포함하는 LLM 온라인 정렬을 위한 연구 친화적 프레임워크

    669-1최근 7일 스타 변화
  • LLamaTuner@jianzhnie

    LLM의 쉽고 효율적인 미세 조정 (Llama, Llama2, Llama3, Qwen, Baichuan, GLM, Falcon 지원). 대형 모델의 고효율 양자화 훈련 및 배포

    621+0최근 7일 스타 변화
  • 비디오 생성을 위한 강화 학습 논문 모음

    591+1최근 7일 스타 변화
  • tensorflow-nlp-tutorial@ukairia777

    Tensorflow를 사용하여 텍스트 전처리부터 Topic Models, BERT, GPT, LLM과 같은 최신 모델의 다운스트림 태스크까지 정리한 Deep Learning NLP 저장소입니다.

    581+0최근 7일 스타 변화
← 토픽 목록으로