grpo
Repositori open source terpantau bertanda grpo, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan grpo di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda grpo.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
Gunakan PEFT atau Full-parameter untuk CPT/SFT/DPO/GRPO 600+ LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) dan 300+ MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.488+88Perubahan bintang dalam 7 hari terakhir - #2
Pustaka sumber terbuka komprehensif berisi keterampilan riset dan rekayasa AI untuk model AI apa pun. Kemas keterampilan tersebut dan agen claude code/codex/gemini Anda akan menjadi agen riset AI dengan performa penuh. Dikelola oleh Orchestra Research.
★ 12.256+104Perubahan bintang dalam 7 hari terakhir - #3
Agent Reinforcement Trainer: melatih agen multi-langkah untuk tugas dunia nyata menggunakan GRPO. Berikan pelatihan langsung kepada agen Anda. Reinforcement learning untuk Qwen3.6, GPT-OSS, Llama, dan banyak lagi!
★ 10.689+10Perubahan bintang dalam 7 hari terakhir - #4
https://adongwanai.github.io/AgentGuide | Panduan Pengembangan AI Agent | Praktik LangGraph | RAG Lanjutan | Beralih ke LLM | Wawancara LLM | Insinyur Algoritma | Bank Soal Wawancara | Pembelajaran Penguatan | Sintesis Data
★ 9.116+169Perubahan bintang dalam 7 hari terakhir - #5★ 6.018+4Perubahan bintang dalam 7 hari terakhir
- #6
OpenClaw-RL: Latih agen apa pun hanya dengan berbicara
★ 5.665+7Perubahan bintang dalam 7 hari terakhir - #7
Mengimplementasikan penalaran LLM di PyTorch dari awal, langkah demi langkah.
★ 5.138+49Perubahan bintang dalam 7 hari terakhir - #8
Kurikulum praktis sumber terbuka yang menjembatani kesenjangan dari konsep dasar RL ke penyelarasan LLM, RLVR, dan sistem agen tingkat lanjut.
★ 4.199+54Perubahan bintang dalam 7 hari terakhir - #9
Skywork-R1V adalah seri model AI multimodal canggih yang dikembangkan oleh Skywork AI, yang berspesialisasi dalam penalaran visi-bahasa.
★ 3.168+0Perubahan bintang dalam 7 hari terakhir - #10
verl-agent adalah ekstensi dari veRL, yang dirancang untuk melatih agen LLM/VLM melalui RL. verl-agent juga merupakan kode resmi untuk makalah "Group-in-Group Policy Optimization for LLM Agent Training"
★ 2.274+17Perubahan bintang dalam 7 hari terakhir - #11
[ECCV 2026] MixGRPO: Membuka Efisiensi GRPO Berbasis Aliran dengan Campuran ODE-SDE
★ 1.177+0Perubahan bintang dalam 7 hari terakhir - #12
Stack Peningkatan Berkelanjutan untuk Agen. Data lingkungan dan evaluasi kami mendukung peningkatan dan pemantauan agen.
★ 1.060+2Perubahan bintang dalam 7 hari terakhir - #13★ 959+64Perubahan bintang dalam 7 hari terakhir
- #14
OAT: Framework yang ramah riset untuk penyelarasan daring LLM, mencakup reinforcement learning, preference learning, dan lainnya.
★ 669-1Perubahan bintang dalam 7 hari terakhir - #15
[NeurIPS 2025] AutoVLA: Model Vision-Language-Action untuk Penggandengan Otonom End-to-End dengan Penalaran Adaptif dan Penyetelan Halus Penguatan
★ 641+6Perubahan bintang dalam 7 hari terakhir - #16
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source untuk LLM dan Skenario Agen
★ 634+9Perubahan bintang dalam 7 hari terakhir - #17
Jelajahi “Aha Moment” Multimodal pada Model 2B
★ 623+0Perubahan bintang dalam 7 hari terakhir - #18
Mesin Reinforcement Learning Asinkron untuk Post-Training Omni-Modal berskala besar.
★ 592+11Perubahan bintang dalam 7 hari terakhir - #19
Daftar kurasi makalah tentang reinforcement learning untuk pembuatan video
★ 591+1Perubahan bintang dalam 7 hari terakhir - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Perubahan bintang dalam 7 hari terakhir