rlhf
Repositori open source terpantau bertanda rlhf, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan rlhf di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda rlhf.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
Fine-Tuning Efisien Terpadu untuk 100+ LLM & VLM (ACL 2024)
★ 74.532+89Perubahan bintang dalam 7 hari terakhir - #2
OpenAssistant adalah asisten berbasis chat yang memahami tugas, dapat berinteraksi dengan sistem pihak ketiga, dan mengambil informasi secara dinamis untuk melakukannya.
★ 37.401-7Perubahan bintang dalam 7 hari terakhir - #3★ 12.208+2Perubahan bintang dalam 7 hari terakhir
- #4★ 7.277+4Perubahan bintang dalam 7 hari terakhir
- #5
Proyek fase kedua model besar LLaMA-2 & Alpaca-2 bahasa Mandarin + model konteks super panjang 64K
★ 7.120+0Perubahan bintang dalam 7 hari terakhir - #6
Resep tangguh untuk menyelaraskan model bahasa dengan preferensi manusia dan AI.
★ 5.670-3Perubahan bintang dalam 7 hari terakhir - #7
OpenClaw-RL: Latih agen apa pun hanya dengan berbicara
★ 5.665+7Perubahan bintang dalam 7 hari terakhir - #8
Lingkungan riset sumber terbuka bagi peneliti AI untuk melatih, mengevaluasi, dan menskalakan model secara mulus dari perangkat keras lokal ke kluster GPU.
★ 5.185+3Perubahan bintang dalam 7 hari terakhir - #9
Mengimplementasikan penalaran LLM di PyTorch dari awal, langkah demi langkah.
★ 5.138+49Perubahan bintang dalam 7 hari terakhir - #10
Argilla adalah alat kolaborasi bagi insinyur AI dan pakar domain untuk membangun dataset berkualitas tinggi
★ 5.093+5Perubahan bintang dalam 7 hari terakhir - #11
Membangun, Mengevaluasi, dan Mengoptimalkan Sistem AI. Mencakup evaluasi, RAG, agen, fine-tuning, pembuatan data sintetis, manajemen dataset, MCP, dan lainnya.
★ 5.042+5Perubahan bintang dalam 7 hari terakhir - #12
Align Anything: Melatih Model Semua Modalitas dengan Umpan Balik
★ 4.671+3Perubahan bintang dalam 7 hari terakhir - #13
Daftar kurasi sumber daya reinforcement learning with human feedback (diperbarui secara berkala).
★ 4.424+2Perubahan bintang dalam 7 hari terakhir - #14
Kurikulum praktis sumber terbuka yang menjembatani kesenjangan dari konsep dasar RL ke penyelarasan LLM, RLVR, dan sistem agen tingkat lanjut.
★ 4.199+54Perubahan bintang dalam 7 hari terakhir - #15★ 3.485-1Perubahan bintang dalam 7 hari terakhir
- #16
Distilabel adalah framework untuk data sintetis dan umpan balik AI bagi insinyur yang membutuhkan pipeline yang cepat, andal, dan dapat diskalakan berdasarkan makalah penelitian terverifikasi.
★ 3.384+3Perubahan bintang dalam 7 hari terakhir - #17
Pustaka penskalaan yang efisien dan ramah pengguna untuk Reinforcement Learning dengan Large Language Models
★ 3.380+6Perubahan bintang dalam 7 hari terakhir - #18
LeetCode untuk PyTorch — 65 masalah wawancara ML/AI dari wawancara nyata di Google, Meta, Anthropic. Jupyter notebook, penilai otomatis, dan tutor AI MCP.
★ 2.461+12Perubahan bintang dalam 7 hari terakhir - #19★ 2.357+11Perubahan bintang dalam 7 hari terakhir
- #20
Evaluator otomatis untuk model bahasa yang mengikuti instruksi. Tervalidasi oleh manusia, berkualitas tinggi, murah, dan cepat.
★ 2.012-1Perubahan bintang dalam 7 hari terakhir - #21
Daftar Awesome untuk Agentic RL
★ 1.832+29Perubahan bintang dalam 7 hari terakhir - #22
[NeurIPS 2023] ImageReward: Mempelajari dan Mengevaluasi Preferensi Manusia untuk Pembuatan Teks-ke-Gambar
★ 1.703+1Perubahan bintang dalam 7 hari terakhir - #23
Safe RLHF: Penyelarasan Nilai Terbatas melalui Safe Reinforcement Learning from Human Feedback
★ 1.613+1Perubahan bintang dalam 7 hari terakhir - #24★ 1.601-1Perubahan bintang dalam 7 hari terakhir
- #25
Resep untuk melatih model reward untuk RLHF.
★ 1.541+0Perubahan bintang dalam 7 hari terakhir - #26★ 1.430+0Perubahan bintang dalam 7 hari terakhir
- #27
Xtreme1 adalah platform pelabelan dan anotasi data serbaguna untuk pelatihan data multimodal serta mendukung point cloud 3D LiDAR, gambar, dan LLM.
★ 1.239+2Perubahan bintang dalam 7 hari terakhir - #28
[NeurIPS 2024] SimPO: Simple Preference Optimization with a Reference-Free Reward
★ 959+1Perubahan bintang dalam 7 hari terakhir - #29★ 955+60Perubahan bintang dalam 7 hari terakhir
- #30
“AI-Compass” akan memandu komunitas dalam menavigasi lautan teknologi AI. Baik Anda pemula maupun pengembang tingkat lanjut, Anda dapat menemukan jalur ke berbagai arah AI di sini. Bertujuan untuk membantu pengembang memahami konsep inti AI, teknologi utama, dan tren terkini secara sistematis, serta menguasai seluruh proses dari teori hingga implementasi melalui praktik.
★ 933+10Perubahan bintang dalam 7 hari terakhir