Lompat ke konten utama
buildradar
Sign in
Topik · rlhf

rlhf

Repositori open source terpantau bertanda rlhf, diurutkan berdasarkan bintang.

44 repositori
  • HALOs@ContextualAI

    Pustaka dengan implementasi yang dapat diperluas dari DPO, KTO, PPO, ORPO, dan fungsi loss yang sadar manusia (HALO) lainnya.

    909-1Perubahan bintang dalam 7 hari terakhir
  • OpenJudge@agentscope-ai

    OpenJudge: Kerangka Kerja Terpadu untuk Evaluasi Holistik dan Quality Rewards

    820+14Perubahan bintang dalam 7 hari terakhir
  • Koleksi makalah, laporan teknis, framework, and alat pilihan untuk on-policy distillation (OPD) pada model bahasa besar

    794+31Perubahan bintang dalam 7 hari terakhir
  • reward-bench@allenai

    RewardBench: alat evaluasi pertama untuk model reward.

    735+2Perubahan bintang dalam 7 hari terakhir
  • Trinity-RFT@agentscope-ai

    Trinity-RFT adalah kerangka kerja serbaguna, fleksibel, dan skalabel yang dirancang untuk reinforcement fine-tuning (RFT) pada large language models (LLM).

    698+2Perubahan bintang dalam 7 hari terakhir
  • oat@sail-sg

    OAT: Framework yang ramah riset untuk penyelarasan daring LLM, mencakup reinforcement learning, preference learning, dan lainnya.

    669-1Perubahan bintang dalam 7 hari terakhir
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source untuk LLM dan Skenario Agen

    634+9Perubahan bintang dalam 7 hari terakhir
  • LLamaTuner@jianzhnie

    Finetuning LLM yang mudah dan efisien. (Mendukung LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon) Pelatihan dan deployment kuantisasi efisien untuk model bahasa besar.

    621+0Perubahan bintang dalam 7 hari terakhir
  • Relax@redai-studio

    Mesin Reinforcement Learning Asinkron untuk Post-Training Omni-Modal berskala besar.

    592+11Perubahan bintang dalam 7 hari terakhir
  • SPPO@uclaml

    Implementasi resmi dari Self-Play Preference Optimization (SPPO)

    589+0Perubahan bintang dalam 7 hari terakhir
  • TextRL@voidful

    Implementasi ChatGPT RLHF (Reinforcement Learning with Human Feedback) pada model bangkitan apa pun di transformer huggingface (bloomz-176B/bloom/gpt/bart/T5/MetaICL)

    564+0Perubahan bintang dalam 7 hari terakhir
  • Online-RLHF@RLHFlow

    Resep untuk RLHF online dan DPO iteratif online.

    544+0Perubahan bintang dalam 7 hari terakhir
  • Koleksi pilihan makalah dan sumber daya tentang On-Policy Distillation untuk Large Language Models.

    535+10Perubahan bintang dalam 7 hari terakhir
  • dLLM-RL@Gen-Verse

    [ICLR 2026] Kode resmi untuk TraceRL: Revolusi pasca-pelatihan untuk Diffusion LLMs, yang mendukung seri SOTA TraDo.

    520+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik