본문으로 건너뛰기
buildradar
Sign in
토픽 · reinforcement-learning

reinforcement-learning

reinforcement-learning 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 305개
  • awesome-mlss@awesome-mlss

    🤖 머신러닝 여름학교 가이드

    3,033+3최근 7일 스타 변화
  • agents@tensorflow

    TF-Agents: 컨텍스추얼 밴딧 및 강화 학습을 위한 안정적이고 확장 가능하며 사용하기 쉬운 TensorFlow 라이브러리

    3,026+0최근 7일 스타 변화
  • 딥러닝 및 심층 강화학습 연구 논문과 일부 코드

    3,026+2최근 7일 스타 변화
  • mjlab@mujocolab

    강화학습 및 로보틱스 연구를 위한 MuJoCo-Warp 기반의 Isaac Lab API

    2,960+82최근 7일 스타 변화
  • openarm@enactic

    접촉이 많은 환경에서 물리적 AI 연구 및 배포를 위한 완전 오픈 소스 휴머노이드 팔입니다.

    2,919+23최근 7일 스타 변화
  • 하이퍼파라미터 최적화와 사전 학습된 에이전트가 포함된 Stable Baselines3 강화 학습 에이전트용 학습 프레임워크.

    2,873+1최근 7일 스타 변화
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    100줄의 코드로 구현한 논문들

    2,870+3최근 7일 스타 변화
  • muzero-general@werner-duvaud

    MuZero

    2,865+2최근 7일 스타 변화
  • easy-tensorflow@easy-tensorflow

    TensorFlow에 대한 쉽고 포괄적인 튜토리얼

    2,841+0최근 7일 스타 변화
  • YC-Killer@sahibzada-allahyar

    인공지능의 대중화를 목표로 하며 고평가된 Y Combinator 스타트업에 대한 무료 오픈소스 대안을 제공하도록 설계된 엔터프라이즈급 AI 에이전트 라이브러리

    2,806+7최근 7일 스타 변화
  • RAGEN@mll-lab-nu

    RAGEN은 강화 학습을 활용하여 상호작용적이고 확률적인 환경에서 LLM 추론 에이전트를 학습시킵니다.

    2,786+6최근 7일 스타 변화
  • mctx@google-deepmind

    JAX에서의 몬테카를로 트리 탐색

    2,657+3최근 7일 스타 변화
  • PPOxFamily@opendilab

    PPO x Family DRL 튜토리얼 코스(의사결정 지능 입문 공개강좌: 알고리즘 이론 정리, 코드 로직 이해, 의사결정 AI 응용 실습을 돕는 8개의 강좌)

    2,616+2최근 7일 스타 변화
  • 산업용 검색, 추천, 광고를 위한 유용한 Deep Learning 논문 모음. 임베딩, 매칭, 사전 순위화, 순위화, 사후 순위화, 관련성, LLM 및 RL에 초점을 맞춥니다.

    2,589+0최근 7일 스타 변화
  • robosuite@ARISE-Initiative

    robosuite: 로봇 학습을 위한 모듈형 시뮬레이션 프레임워크 및 벤치마크

    2,586+4최근 7일 스타 변화
  • 추론 LLM 관련 Awesome 튜토리얼/서베이/가이드 모음

    2,533+6최근 7일 스타 변화
  • 강화학습 입문서(Reinforcement Learning: An Introduction) 솔루션

    2,433+3최근 7일 스타 변화
  • RL4LMs@allenai

    인간의 선호도에 맞춰 언어 모델을 파인튜닝하기 위한 모듈식 RL 라이브러리

    2,395+1최근 7일 스타 변화
  • gym-anytrading@AminHP

    가장 단순하고 유연하며 포괄적인 OpenAI Gym 트레이딩 환경입니다 (OpenAI Gym 승인).

    2,387+0최근 7일 스타 변화
  • PPO-PyTorch@nikhilbarhate99

    PyTorch를 이용한 클리핑된 목적 함수 기반 PPO(Proximal Policy Optimization) 최소 구현

    2,381+6최근 7일 스타 변화
  • ProtoMotions@NVlabs

    ProtoMotions는 물리 기반 시뮬레이션 디지털 휴먼 및 휴머노이드 로봇 학습을 위한 GPU 가속 시뮬레이션 및 학습 프레임워크입니다.

    2,359+10최근 7일 스타 변화
  • ICCV2019 - 모델 기반 심층 강화학습을 이용한 페인팅 학습

    2,308+2최근 7일 스타 변화
  • drl-zh@alessiodm

    심층 강화학습: 제로부터 히어로까지!

    2,293+0최근 7일 스타 변화
  • MimicKit@xbpeng

    제어기 학습을 위한 경량 모션 모방 메서드 모음.

    2,280+15최근 7일 스타 변화
  • verl-agent@langfengQ

    verl-agent는 RL을 통한 LLM/VLM 에이전트 학습을 위해 설계된 veRL의 확장입니다. 또한 'Group-in-Group Policy Optimization for LLM Agent Training' 논문의 공식 코드입니다.

    2,274+17최근 7일 스타 변화
  • RecSysPapers@tangxyw

    추천, 광고, 검색 분야의 산업계 고전 및 최신 논문 모음입니다.

    2,188-1최근 7일 스타 변화
  • gym-pybullet-drones@learnsyslab

    쿼드콥터 제어의 단일 및 다중 에이전트 강화 학습을 위한 PyBullet Gymnasium 환경입니다.

    2,119-2최근 7일 스타 변화
  • ASAP@LeCAR-Lab

    [RSS 2025] "ASAP: 민첩한 휴머노이드 전신 기술 학습을 위한 시뮬레이션 및 현실 세계 물리 정렬"

    2,107+3최근 7일 스타 변화
  • diamond@eloialonso

    DIAMOND(DIffusion As a Model Of eNvironment Dreams)는 디퓨전 월드 모델로 학습된 강화학습 에이전트입니다. NeurIPS 2024 Spotlight 선정.

    2,100+1최근 7일 스타 변화
  • ViZDoom@Farama-Foundation

    1993년 작 게임 Doom을 기반으로 한 강화 학습 환경 :godmode:

    2,065+0최근 7일 스타 변화
← 토픽 목록으로