본문으로 건너뛰기
buildradar
Sign in
토픽 · reinforcement-learning

reinforcement-learning

reinforcement-learning 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 305개
  • ReCall@Agent-RL

    ReSearch: 강화학습을 통한 LLM의 검색 기반 추론 학습 및 ReCall: 강화학습을 통한 LLM의 도구 호출 기반 추론 학습

    1,432+1최근 7일 스타 변화
  • Julia로 작성된 간결하고 아름다운 알고리즘

    1,426+0최근 7일 스타 변화
  • 엄선된 멋진 모델 기반 RL 리소스 목록(지속 업데이트)

    1,393+0최근 7일 스타 변화
  • rl_games@Denys88

    RL 구현체

    1,385+2최근 7일 스타 변화
  • OpenCat-Old@PetoiCamp

    STEM 교육 및 AI 강화 서비스를 위한 프로그래밍 가능하고 기동성이 뛰어난 로봇 고양이입니다.

    1,372+1최근 7일 스타 변화
  • smac@oxwhirl

    SMAC: 스타크래프트 멀티 에이전트 챌린지

    1,367+1최근 7일 스타 변화
  • DRL-robot-navigation@reiniscimurs

    ROS Gazebo 시뮬레이터에서 모바일 로봇 내비게이션을 위한 심층 강화학습입니다. TD3 신경망을 사용하여 로봇은 장애물을 피하면서 시뮬레이션된 환경의 임의의 목표 지점으로 이동하는 법을 배웁니다.

    1,362+2최근 7일 스타 변화
  • SLM-Lab@kengz

    PyTorch 기반의 모듈식 심층 강화학습 프레임워크입니다. "Foundations of Deep Reinforcement Learning" 도서의 동반 라이브러리입니다.

    1,362+0최근 7일 스타 변화
  • Popular-RL-Algorithms@quantumiracle

    Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet의 PyTorch 구현

    1,359+1최근 7일 스타 변화
  • agent-apprenticeship@ray-r-ren

    AI 에이전트가 워크플로 루프를 통해 작업을 완료하고, 반복 실행을 통해 개선되며, 멘토 에이전트나 인간의 평가를 받고, 완료된 작업을 재사용 가능한 작업 경험 및 데이터로 전환하여 미래의 에이전트를 개선하는 생태계.

    1,334+0최근 7일 스타 변화
  • Keras로 구현한 미니멀 심층 Q-러닝(DQN & DDQN) 구현체

    1,329+1최근 7일 스타 변화
  • Minari@Farama-Foundation

    오프라인 강화 학습 데이터셋을 위한 표준 포맷으로, 인기 있는 레퍼런스 데이터셋과 관련 유틸리티를 포함합니다.

    1,294+3최근 7일 스타 변화
  • Learning-Deep-Learning@patrick-llgc

    딥러닝 및 머신러닝 논문 읽기 노트

    1,270+0최근 7일 스타 변화
  • PPO-for-Beginners@ericyangyu

    간단하고 스타일이 잘 적용된 PPO 구현. 내 Medium 시리즈 기반: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.

    1,269+1최근 7일 스타 변화
  • android_env@google-deepmind

    Android 기기에서의 강화학습(RL) 연구.

    1,240+0최근 7일 스타 변화
  • alphagen@ICT-FinD-Lab

    강화학습을 통한 정형화된 알파(예측) 주식 팩터셋 생성

    1,213+8최근 7일 스타 변화
  • LearningHumanoidWalking@rohanpsingh

    강화 학습을 사용하여 보행을 위한 휴머노이드 로봇 훈련

    1,210+3최근 7일 스타 변화
  • Paderborn University에서 주관하는 강화학습 강의의 강의 노트, 튜토리얼 과제, 솔루션 및 온라인 영상

    1,192+1최근 7일 스타 변화
  • flow@flow-project

    교통 제어 강화학습을 위한 연산 프레임워크

    1,188+0최근 7일 스타 변화
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: 혼합 ODE-SDE를 통한 Flow 기반 GRPO 효율성 극대화

    1,177+0최근 7일 스타 변화
  • Gym@NVIDIA-NeMo

    환경을 활용한 모델 및 에이전트 평가 및 개선

    1,155+7최근 7일 스타 변화
  • SimplerEnv@simpler-env

    일반적인 환경(예: Google Robot, WidowX+Bridge)의 시뮬레이션에서 실제 로봇 조작 정책(예: RT-1, RT-1-X, Octo)을 평가하고 재현합니다 (CoRL 2024)

    1,153+3최근 7일 스타 변화
  • omnisafe@PKU-Alignment

    JMLR: OmniSafe는 SafeRL 연구를 가속화하기 위한 인프라 프레임워크입니다.

    1,150+1최근 7일 스타 변화
  • evotorch@nnaisense

    NNAISENSE에서 제작하고 PyTorch 기반 위에 직접 구축된 고급 진화 연산 라이브러리입니다.

    1,144+1최근 7일 스타 변화
  • SMARTS@huawei-noah

    자율 주행을 위한 확장 가능한 멀티 에이전트 강화학습 트레이닝 스쿨

    1,134+0최근 7일 스타 변화
  • 기계 학습을 배워 프로그래밍의 수고를 덜기 위한 궁극의 학습 리스트

    1,128+0최근 7일 스타 변화
  • ir-sim@hanruihua

    내비게이션, 제어, 학습을 위해 설계된 Python 기반 경량 로봇 시뮬레이터

    1,125+6최근 7일 스타 변화
  • ASE@nv-tlabs

    물리 시뮬레이션 캐릭터를 위한 재사용 가능한 컨트롤러 학습용 적대적 스킬 임베딩입니다.

    1,121+2최근 7일 스타 변화
  • ARPO@RUC-NLPIR

    [ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)

    1,116+5최근 7일 스타 변화
  • SoundMind@xid32

    복잡한 추론 작업을 위해 특별히 설계된 6,446개의 텍스트-오디오 주석 샘플로 구성된 Audio Logical Reasoning (ALR) 데이터셋을 소개합니다. 이 리소스를 바탕으로, 오디오 언어 모델(ALM)에 깊이 있는 이중 모달 추론 능력을 부여하기 위해 맞춤형으로 제작된 규칙 기반 강화학습(RL) 알고리즘 SoundMind를 제안합니다.

    1,113+0최근 7일 스타 변화
← 토픽 목록으로