Lompat ke konten utama
buildradar
Sign in
Topik · rlhf

rlhf

Repositori open source terpantau bertanda rlhf, diurutkan berdasarkan bintang.

Repositori
44
Total bintang
223.657
Rata-rata bintang
5.083
Porsi
0,01%

Topik yang sering muncul berdampingan dengan rlhf di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda rlhf.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • LlamaFactory@hiyouga

    Fine-Tuning Efisien Terpadu untuk 100+ LLM & VLM (ACL 2024)

    74.532+89Perubahan bintang dalam 7 hari terakhir
  • Open-Assistant@LAION-AI

    OpenAssistant adalah asisten berbasis chat yang memahami tugas, dapat berinteraksi dengan sistem pihak ketiga, dan mengambil informasi secara dinamis untuk melakukannya.

    37.401-7Perubahan bintang dalam 7 hari terakhir
  • LLMSurvey@RUCAIBox

    Halaman GitHub resmi untuk makalah survei "A Survey of Large Language Models"

    12.208+2Perubahan bintang dalam 7 hari terakhir
  • InternLM@InternLM

    Rilis resmi seri InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).

    7.277+4Perubahan bintang dalam 7 hari terakhir
  • Proyek fase kedua model besar LLaMA-2 & Alpaca-2 bahasa Mandarin + model konteks super panjang 64K

    7.120+0Perubahan bintang dalam 7 hari terakhir
  • alignment-handbook@huggingface

    Resep tangguh untuk menyelaraskan model bahasa dengan preferensi manusia dan AI.

    5.670-3Perubahan bintang dalam 7 hari terakhir
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Latih agen apa pun hanya dengan berbicara

    5.665+7Perubahan bintang dalam 7 hari terakhir
  • transformerlab-app@transformerlab

    Lingkungan riset sumber terbuka bagi peneliti AI untuk melatih, mengevaluasi, dan menskalakan model secara mulus dari perangkat keras lokal ke kluster GPU.

    5.185+3Perubahan bintang dalam 7 hari terakhir
  • reasoning-from-scratch@rasbt

    Mengimplementasikan penalaran LLM di PyTorch dari awal, langkah demi langkah.

    5.138+49Perubahan bintang dalam 7 hari terakhir
  • argilla@argilla-io

    Argilla adalah alat kolaborasi bagi insinyur AI dan pakar domain untuk membangun dataset berkualitas tinggi

    5.093+5Perubahan bintang dalam 7 hari terakhir
  • Kiln@Kiln-AI

    Membangun, Mengevaluasi, dan Mengoptimalkan Sistem AI. Mencakup evaluasi, RAG, agen, fine-tuning, pembuatan data sintetis, manajemen dataset, MCP, dan lainnya.

    5.042+5Perubahan bintang dalam 7 hari terakhir
  • align-anything@PKU-Alignment

    Align Anything: Melatih Model Semua Modalitas dengan Umpan Balik

    4.671+3Perubahan bintang dalam 7 hari terakhir
  • awesome-RLHF@opendilab

    Daftar kurasi sumber daya reinforcement learning with human feedback (diperbarui secara berkala).

    4.424+2Perubahan bintang dalam 7 hari terakhir
  • hands-on-modern-rl@walkinglabs

    Kurikulum praktis sumber terbuka yang menjembatani kesenjangan dari konsep dasar RL ke penyelarasan LLM, RLVR, dan sistem agen tingkat lanjut.

    4.199+54Perubahan bintang dalam 7 hari terakhir
  • docta@Docta-ai

    Dokter untuk data Anda

    3.485-1Perubahan bintang dalam 7 hari terakhir
  • distilabel@argilla-io

    Distilabel adalah framework untuk data sintetis dan umpan balik AI bagi insinyur yang membutuhkan pipeline yang cepat, andal, dan dapat diskalakan berdasarkan makalah penelitian terverifikasi.

    3.384+3Perubahan bintang dalam 7 hari terakhir
  • ROLL@alibaba

    Pustaka penskalaan yang efisien dan ramah pengguna untuk Reinforcement Learning dengan Large Language Models

    3.380+6Perubahan bintang dalam 7 hari terakhir
  • TorchLeet@Exorust

    LeetCode untuk PyTorch — 65 masalah wawancara ML/AI dari wawancara nyata di Google, Meta, Anthropic. Jupyter notebook, penilai otomatis, dan tutor AI MCP.

    2.461+12Perubahan bintang dalam 7 hari terakhir
  • rlhf-book@natolambert

    Buku teks tentang reinforcement learning from human feedback

    2.357+11Perubahan bintang dalam 7 hari terakhir
  • alpaca_eval@tatsu-lab

    Evaluator otomatis untuk model bahasa yang mengikuti instruksi. Tervalidasi oleh manusia, berkualitas tinggi, murah, dan cepat.

    2.012-1Perubahan bintang dalam 7 hari terakhir
  • AgentsMeetRL@thinkwee

    Daftar Awesome untuk Agentic RL

    1.832+29Perubahan bintang dalam 7 hari terakhir
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward: Mempelajari dan Mengevaluasi Preferensi Manusia untuk Pembuatan Teks-ke-Gambar

    1.703+1Perubahan bintang dalam 7 hari terakhir
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Penyelarasan Nilai Terbatas melalui Safe Reinforcement Learning from Human Feedback

    1.613+1Perubahan bintang dalam 7 hari terakhir
  • WebGLM@THUDM

    WebGLM: Sistem Tanya Jawab yang Ditingkatkan Web yang Efisien (KDD 2023)

    1.601-1Perubahan bintang dalam 7 hari terakhir
  • Resep untuk melatih model reward untuk RLHF.

    1.541+0Perubahan bintang dalam 7 hari terakhir
  • MOSS-RLHF@OpenLMLab

    Rahasia RLHF pada Large Language Models Bagian I: PPO

    1.430+0Perubahan bintang dalam 7 hari terakhir
  • xtreme1@xtreme1-io

    Xtreme1 adalah platform pelabelan dan anotasi data serbaguna untuk pelatihan data multimodal serta mendukung point cloud 3D LiDAR, gambar, dan LLM.

    1.239+2Perubahan bintang dalam 7 hari terakhir
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO: Simple Preference Optimization with a Reference-Free Reward

    959+1Perubahan bintang dalam 7 hari terakhir
  • verl-omni@verl-project

    Kerangka kerja pelatihan RL multimodal untuk model diffusion & omni

    955+60Perubahan bintang dalam 7 hari terakhir
  • AI-Compass@tingaicompass

    “AI-Compass” akan memandu komunitas dalam menavigasi lautan teknologi AI. Baik Anda pemula maupun pengembang tingkat lanjut, Anda dapat menemukan jalur ke berbagai arah AI di sini. Bertujuan untuk membantu pengembang memahami konsep inti AI, teknologi utama, dan tren terkini secara sistematis, serta menguasai seluruh proses dari teori hingga implementasi melalui praktik.

    933+10Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik