grpo
grpo 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 grpo 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 grpo 태그가 달린 리포지토리예요.
최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.
- #1
PEFT 또는 풀 파라미터를 사용하여 600개 이상의 LLM(Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) 및 300개 이상의 MLLM(Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...)을 학습/미세조정(CPT/SFT/DPO/GRPO)하는 툴킷 (AAAI 2025).
★ 15,488+88최근 7일 스타 변화 - #2
모든 AI 모델을 위한 포괄적인 오픈소스 AI 연구 및 엔지니어링 기술 라이브러리. 기술을 패키징하면 claude code/codex/gemini 에이전트가 완전한 성능을 갖춘 AI 연구 에이전트가 됩니다. Orchestra Research에서 유지 관리합니다.
★ 12,256+104최근 7일 스타 변화 - #3
에이전트 강화학습 트레이너: GRPO를 사용하여 실제 태스크를 수행하는 다단계 에이전트를 훈련합니다. 에이전트에게 실무 교육을 제공하세요. Qwen3.6, GPT-OSS, Llama 등을 위한 강화학습!
★ 10,689+10최근 7일 스타 변화 - #4
https://adongwanai.github.io/AgentGuide | AI Agent 개발 가이드 | LangGraph 실전 | 고급 RAG | 대규모 언어 모델 전환 | LLM 면접 | 알고리즘 엔지니어 | 면접 문제 은행 | 강화 학습 | 데이터 합성
★ 9,116+169최근 7일 스타 변화 - #5★ 6,018+4최근 7일 스타 변화
- #6
OpenClaw-RL: 대화만으로 모든 에이전트 학습
★ 5,665+7최근 7일 스타 변화 - #7
PyTorch로 처음부터 단계별로 추론 LLM 구현하기
★ 5,138+49최근 7일 스타 변화 - #8
🚀 기초 RL 개념부터 LLM 정렬, RLVR, 고급 Agentic 시스템까지의 간극을 메우는 오픈소스 실습 커리큘럼
★ 4,199+54최근 7일 스타 변화 - #9
Skywork-R1V는 시각-언어 추론에 특화된 Skywork AI 개발의 고급 멀티모달 AI 모델 시리즈입니다.
★ 3,168+0최근 7일 스타 변화 - #10
verl-agent는 RL을 통한 LLM/VLM 에이전트 학습을 위해 설계된 veRL의 확장입니다. 또한 'Group-in-Group Policy Optimization for LLM Agent Training' 논문의 공식 코드입니다.
★ 2,274+17최근 7일 스타 변화 - #11★ 1,177+0최근 7일 스타 변화
- #12★ 1,060+2최근 7일 스타 변화
- #13★ 959+60최근 7일 스타 변화
- #14★ 669-1최근 7일 스타 변화
- #15★ 640+6최근 7일 스타 변화
- #16
RLAnything (ICML 2026) 및 AutoTool (ICML 2026), DemyAgent: LLM 및 에이전트 시나리오를 위한 오픈소스 강화학습
★ 632+9최근 7일 스타 변화 - #17
2B 모델에서 멀티모달 '아하 모멘트(Aha Moment)' 탐색
★ 623+0최근 7일 스타 변화 - #18★ 591+10최근 7일 스타 변화
- #19
비디오 생성을 위한 강화 학습 논문 모음
★ 591+1최근 7일 스타 변화 - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—최근 7일 스타 변화