Lompat ke konten utama
buildradar
Sign in
Topik · dpo

dpo

Repositori open source terpantau bertanda dpo, diurutkan berdasarkan bintang.

Repositori
11
Total bintang
33.060
Rata-rata bintang
3.005
Porsi
0,00%

Topik yang sering muncul berdampingan dengan dpo di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda dpo.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • oumi@oumi-ai

    Lakukan fine-tuning, evaluasi, dan deploy Qwen, Gemma, atau LLM open weight lainnya dengan mudah!

    9.383+3Perubahan bintang dalam 7 hari terakhir
  • MedicalGPT@shibing624

    MedicalGPT: Melatih Model GPT Medis Anda Sendiri dengan Pipeline Pelatihan ChatGPT. Melatih model AI medis berskala besar, mengimplementasikan pra-pelatihan inkremental (PT), fine-tuning tersupervisi (SFT), RLHF, DPO, ORPO, dan GRPO.

    5.771+12Perubahan bintang dalam 7 hari terakhir
  • Soup@MakazhanAlpamys

    Fine-tune LLM dari satu file YAML. Streaming layer melatih model 8B pada GPU laptop 4 GB.

    4.929+1.365Perubahan bintang dalam 7 hari terakhir
  • align-anything@PKU-Alignment

    Align Anything: Melatih Model Semua Modalitas dengan Umpan Balik

    4.671+3Perubahan bintang dalam 7 hari terakhir
  • hands-on-modern-rl@walkinglabs

    Kurikulum praktis sumber terbuka yang menjembatani kesenjangan dari konsep dasar RL ke penyelarasan LLM, RLVR, dan sistem agen tingkat lanjut.

    4.199+54Perubahan bintang dalam 7 hari terakhir
  • HALOs@ContextualAI

    Pustaka dengan implementasi yang dapat diperluas dari DPO, KTO, PPO, ORPO, dan fungsi loss yang sadar manusia (HALO) lainnya.

    909-1Perubahan bintang dalam 7 hari terakhir
  • DeepMesh@zhaorw02

    [ICCV 2025] Kode resmi DeepMesh: Pembuatan Artist-mesh Auto-Regressive dengan Reinforcement Learning.

    736+1Perubahan bintang dalam 7 hari terakhir
  • oat@sail-sg

    OAT: Framework yang ramah riset untuk penyelarasan daring LLM, mencakup reinforcement learning, preference learning, dan lainnya.

    669-1Perubahan bintang dalam 7 hari terakhir
  • LLamaTuner@jianzhnie

    Finetuning LLM yang mudah dan efisien. (Mendukung LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon) Pelatihan dan deployment kuantisasi efisien untuk model bahasa besar.

    621+0Perubahan bintang dalam 7 hari terakhir
  • Daftar kurasi makalah tentang reinforcement learning untuk pembuatan video

    591+1Perubahan bintang dalam 7 hari terakhir
  • tensorflow-nlp-tutorial@ukairia777

    Repository NLP Deep Learning yang merangkum tugas downstream dari pra-pemrosesan teks hingga model terbaru seperti Topic Models, BERT, GPT, dan LLM menggunakan TensorFlow.

    581+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik