Lompat ke konten utama
buildradar
Sign in
Topik · grpo

grpo

Repositori open source terpantau bertanda grpo, diurutkan berdasarkan bintang.

Repositori
20
Total bintang
81.418
Rata-rata bintang
4.071
Porsi
0,00%

Topik yang sering muncul berdampingan dengan grpo di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda grpo.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • ms-swift@modelscope

    Gunakan PEFT atau Full-parameter untuk CPT/SFT/DPO/GRPO 600+ LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) dan 300+ MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

    15.488+88Perubahan bintang dalam 7 hari terakhir
  • AI-Research-SKILLs@Orchestra-Research

    Pustaka sumber terbuka komprehensif berisi keterampilan riset dan rekayasa AI untuk model AI apa pun. Kemas keterampilan tersebut dan agen claude code/codex/gemini Anda akan menjadi agen riset AI dengan performa penuh. Dikelola oleh Orchestra Research.

    12.256+104Perubahan bintang dalam 7 hari terakhir
  • ART@OpenPipe

    Agent Reinforcement Trainer: melatih agen multi-langkah untuk tugas dunia nyata menggunakan GRPO. Berikan pelatihan langsung kepada agen Anda. Reinforcement learning untuk Qwen3.6, GPT-OSS, Llama, dan banyak lagi!

    10.689+10Perubahan bintang dalam 7 hari terakhir
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | Panduan Pengembangan AI Agent | Praktik LangGraph | RAG Lanjutan | Beralih ke LLM | Wawancara LLM | Insinyur Algoritma | Bank Soal Wawancara | Pembelajaran Penguatan | Sintesis Data

    9.116+169Perubahan bintang dalam 7 hari terakhir
  • VLM-R1@om-ai-lab

    Menyelesaikan Pemahaman Visual dengan VLM yang Diperkuat

    6.018+4Perubahan bintang dalam 7 hari terakhir
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Latih agen apa pun hanya dengan berbicara

    5.665+7Perubahan bintang dalam 7 hari terakhir
  • reasoning-from-scratch@rasbt

    Mengimplementasikan penalaran LLM di PyTorch dari awal, langkah demi langkah.

    5.138+49Perubahan bintang dalam 7 hari terakhir
  • hands-on-modern-rl@walkinglabs

    Kurikulum praktis sumber terbuka yang menjembatani kesenjangan dari konsep dasar RL ke penyelarasan LLM, RLVR, dan sistem agen tingkat lanjut.

    4.199+54Perubahan bintang dalam 7 hari terakhir
  • Skywork-R1V@SkyworkAI

    Skywork-R1V adalah seri model AI multimodal canggih yang dikembangkan oleh Skywork AI, yang berspesialisasi dalam penalaran visi-bahasa.

    3.168+0Perubahan bintang dalam 7 hari terakhir
  • verl-agent@langfengQ

    verl-agent adalah ekstensi dari veRL, yang dirancang untuk melatih agen LLM/VLM melalui RL. verl-agent juga merupakan kode resmi untuk makalah "Group-in-Group Policy Optimization for LLM Agent Training"

    2.274+17Perubahan bintang dalam 7 hari terakhir
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Membuka Efisiensi GRPO Berbasis Aliran dengan Campuran ODE-SDE

    1.177+0Perubahan bintang dalam 7 hari terakhir
  • judgeval@JudgmentLabs

    Stack Peningkatan Berkelanjutan untuk Agen. Data lingkungan dan evaluasi kami mendukung peningkatan dan pemantauan agen.

    1.060+2Perubahan bintang dalam 7 hari terakhir
  • verl-omni@verl-project

    Kerangka kerja pelatihan RL multimodal untuk model diffusion & omni

    959+64Perubahan bintang dalam 7 hari terakhir
  • oat@sail-sg

    OAT: Framework yang ramah riset untuk penyelarasan daring LLM, mencakup reinforcement learning, preference learning, dan lainnya.

    669-1Perubahan bintang dalam 7 hari terakhir
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA: Model Vision-Language-Action untuk Penggandengan Otonom End-to-End dengan Penalaran Adaptif dan Penyetelan Halus Penguatan

    641+6Perubahan bintang dalam 7 hari terakhir
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source untuk LLM dan Skenario Agen

    634+9Perubahan bintang dalam 7 hari terakhir
  • VisualThinker-R1-Zero@turningpoint-ai

    Jelajahi “Aha Moment” Multimodal pada Model 2B

    623+0Perubahan bintang dalam 7 hari terakhir
  • Relax@redai-studio

    Mesin Reinforcement Learning Asinkron untuk Post-Training Omni-Modal berskala besar.

    592+11Perubahan bintang dalam 7 hari terakhir
  • Daftar kurasi makalah tentang reinforcement learning untuk pembuatan video

    591+1Perubahan bintang dalam 7 hari terakhir
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik