reinforcement-learning-from-human-feedback
Erfasste Open-Source-Repos mit dem Tag reinforcement-learning-from-human-feedback, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit reinforcement-learning-from-human-feedback am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit reinforcement-learning-from-human-feedback getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Ein benutzerfreundliches, skalierbares und leistungsstarkes Agentic-RL-Framework basierend auf Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)
★ 9.969+9Sterne-Änderung der letzten 7 Tage - #2
Safe RLHF: Restriktive Werteausrichtung durch sicheres Reinforcement Learning aus menschlichem Feedback
★ 1.613+1Sterne-Änderung der letzten 7 Tage - #3
Ein Simulationsframework für RLHF und Alternativen. Entwickeln Sie Ihre RLHF-Methode ohne das Sammeln von menschlichen Daten.
★ 844-1Sterne-Änderung der letzten 7 Tage