본문으로 건너뛰기
buildradar
Sign in
토픽 · grpo

grpo

grpo 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
20
총 스타
81,418
평균 스타
4,071
비중
0.00%

같은 리포지토리에 grpo 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 grpo 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • ms-swift@modelscope

    PEFT 또는 풀 파라미터를 사용하여 600개 이상의 LLM(Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) 및 300개 이상의 MLLM(Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...)을 학습/미세조정(CPT/SFT/DPO/GRPO)하는 툴킷 (AAAI 2025).

    15,488+88최근 7일 스타 변화
  • AI-Research-SKILLs@Orchestra-Research

    모든 AI 모델을 위한 포괄적인 오픈소스 AI 연구 및 엔지니어링 기술 라이브러리. 기술을 패키징하면 claude code/codex/gemini 에이전트가 완전한 성능을 갖춘 AI 연구 에이전트가 됩니다. Orchestra Research에서 유지 관리합니다.

    12,256+104최근 7일 스타 변화
  • ART@OpenPipe

    에이전트 강화학습 트레이너: GRPO를 사용하여 실제 태스크를 수행하는 다단계 에이전트를 훈련합니다. 에이전트에게 실무 교육을 제공하세요. Qwen3.6, GPT-OSS, Llama 등을 위한 강화학습!

    10,689+10최근 7일 스타 변화
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | AI Agent 개발 가이드 | LangGraph 실전 | 고급 RAG | 대규모 언어 모델 전환 | LLM 면접 | 알고리즘 엔지니어 | 면접 문제 은행 | 강화 학습 | 데이터 합성

    9,116+169최근 7일 스타 변화
  • VLM-R1@om-ai-lab

    강화된 VLM을 통한 시각적 이해 해결

    6,018+4최근 7일 스타 변화
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: 대화만으로 모든 에이전트 학습

    5,665+7최근 7일 스타 변화
  • reasoning-from-scratch@rasbt

    PyTorch로 처음부터 단계별로 추론 LLM 구현하기

    5,138+49최근 7일 스타 변화
  • hands-on-modern-rl@walkinglabs

    🚀 기초 RL 개념부터 LLM 정렬, RLVR, 고급 Agentic 시스템까지의 간극을 메우는 오픈소스 실습 커리큘럼

    4,199+54최근 7일 스타 변화
  • Skywork-R1V@SkyworkAI

    Skywork-R1V는 시각-언어 추론에 특화된 Skywork AI 개발의 고급 멀티모달 AI 모델 시리즈입니다.

    3,168+0최근 7일 스타 변화
  • verl-agent@langfengQ

    verl-agent는 RL을 통한 LLM/VLM 에이전트 학습을 위해 설계된 veRL의 확장입니다. 또한 'Group-in-Group Policy Optimization for LLM Agent Training' 논문의 공식 코드입니다.

    2,274+17최근 7일 스타 변화
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: 혼합 ODE-SDE를 통한 Flow 기반 GRPO 효율성 극대화

    1,177+0최근 7일 스타 변화
  • judgeval@JudgmentLabs

    에이전트를 위한 지속적 개선 스택. 환경 데이터와 평가(eval)를 통해 에이전트의 성능 향상과 모니터링을 지원합니다.

    1,060+2최근 7일 스타 변화
  • verl-omni@verl-project

    디퓨전 및 옴니 모델을 위한 멀티모달 RL 학습 프레임워크

    959+60최근 7일 스타 변화
  • oat@sail-sg

    OAT: 강화 학습, 선호도 학습 등을 포함하는 LLM 온라인 정렬을 위한 연구 친화적 프레임워크

    669-1최근 7일 스타 변화
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA: 적응형 추론과 강화 미세조정을 통한 엔드투엔드 자율주행용 비전-언어-행동 모델

    640+6최근 7일 스타 변화
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) 및 AutoTool (ICML 2026), DemyAgent: LLM 및 에이전트 시나리오를 위한 오픈소스 강화학습

    632+9최근 7일 스타 변화
  • VisualThinker-R1-Zero@turningpoint-ai

    2B 모델에서 멀티모달 '아하 모멘트(Aha Moment)' 탐색

    623+0최근 7일 스타 변화
  • Relax@redai-studio

    대규모 전모달 사후 학습을 위한 비동기 강화 학습 엔진

    591+10최근 7일 스타 변화
  • 비디오 생성을 위한 강화 학습 논문 모음

    591+1최근 7일 스타 변화
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501최근 7일 스타 변화
← 토픽 목록으로