reinforcement-learning
reinforcement-learning 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #271★ 638+0최근 7일 스타 변화
- #272
머신러닝 분야의 공통 알고리즘을 캡슐화한 코드 모음. 대부분 Numpy, Pandas, Torch 기반이며 모델 및 알고리즘 이해를 돕거나 커스텀 코드 작성에 활용 가능
★ 635+0최근 7일 스타 변화 - #273
RLAnything (ICML 2026) 및 AutoTool (ICML 2026), DemyAgent: LLM 및 에이전트 시나리오를 위한 오픈소스 강화학습
★ 634+11최근 7일 스타 변화 - #274★ 633+0최근 7일 스타 변화
- #275
다중 에이전트 가정 시뮬레이터인 VirtualHome을 실행하기 위한 API입니다.
★ 632+2최근 7일 스타 변화 - #276★ 631+0최근 7일 스타 변화
- #277
2B 모델에서 멀티모달 '아하 모멘트(Aha Moment)' 탐색
★ 623+0최근 7일 스타 변화 - #278
Unitree Go2에 walk-these-ways 프로젝트 배포
★ 623+3최근 7일 스타 변화 - #279
Nature Machine Intelligence 게재! 미분 가능한 물리 기반 학습을 활용한 최초의 실제 로봇(쿼드로터)
★ 615+9최근 7일 스타 변화 - #280
국립대만대학(NTU) 이홍이(李宏毅) 교수의 '머신러닝(Machine Learning) 2021 Spring' 강의 노트
★ 603+4최근 7일 스타 변화 - #281
[ICLR 2026] ReCogDrive: 엔드투엔드 자율 주행을 위한 강화 인지 프레임워크
★ 601+4최근 7일 스타 변화 - #282★ 597+12최근 7일 스타 변화
- #283
강화학습 관련 논문 모음 (주요 학회 최신 논문 및 고전 논문 포함)
★ 595+0최근 7일 스타 변화 - #284
비디오 생성을 위한 강화 학습 논문 모음
★ 593+1최근 7일 스타 변화 - #285
[ICML 2026] "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning" 공식 리소스
★ 591+1최근 7일 스타 변화 - #286
AAAI 2024 논문: 주요 인공지능 학회에서 발표된 혁신적인 연구 논문 모음. 코드 구현을 통합하여 이해를 돕습니다.
★ 591+0최근 7일 스타 변화 - #287★ 587+1최근 7일 스타 변화
- #288
NeurIPS 2023: Safety-Gymnasium: 통합 안전 강화 학습 벤치마크
★ 580+1최근 7일 스타 변화 - #289★ 578+4최근 7일 스타 변화
- #290
Hugging Face transformers의 모든 생성 모델(bloomz-176B/bloom/gpt/bart/T5/MetaICL)에 ChatGPT RLHF(인간 피드백 기반 강화학습) 구현
★ 564+0최근 7일 스타 변화 - #291
자율 주행(Carla)을 위한 심층 강화 학습(PPO) [처음부터 구현]
★ 563-1최근 7일 스타 변화 - #292
Meta Agents Research Environments는 동적이고 현실적인 시나리오에서 AI 에이전트를 평가하기 위한 포괄적인 플랫폼입니다. 정적 벤치마크와 달리, 이 플랫폼은 새로운 정보가 제공됨에 따라 에이전트가 전략을 조정해야 하는 진화하는 환경을 도입하여 실제 환경의 도전 과제를 반영합니다.
★ 551+4최근 7일 스타 변화 - #293
인공지능 리소스(강의, 도구, 앱, 오픈 소스 프로젝트) 큐레이션 목록
★ 549-1최근 7일 스타 변화 - #294
[NeurIPS 2025 Spotlight] LLM 후학습(post-training) 스위트 — ReasonFlux, ReasonFlux-PRM, ReasonFlux-Coder 포함.
★ 542+0최근 7일 스타 변화 - #295★ 539+4최근 7일 스타 변화
- #296
UMI on Legs: 조작 중심의 전신 제어기를 사용하여 조작 정책을 모바일화
★ 539+2최근 7일 스타 변화 - #297
CalTech, Columbia, Berkeley, MIT, Stanford에서 제공하는 공개 머신러닝 엔지니어링 강의 큐레이션 목록
★ 535+0최근 7일 스타 변화 - #298
다목적 강화 학습 알고리즘 구현체
★ 533+1최근 7일 스타 변화 - #299
[CVPR 2025 Highlight] InterMimic: 물리 기반 인간-사물 상호작용을 위한 범용 전신 제어 지향
★ 528+1최근 7일 스타 변화 - #300
MetaTrader 5 트레이딩 플랫폼을 위한 범용적이고 유연하며 사용하기 쉬운 시뮬레이터 및 OpenAI Gym 트레이딩 환경 (OpenAI Gym 승인)
★ 524+0최근 7일 스타 변화