rlhf
Erfasste Open-Source-Repos mit dem Tag rlhf, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit rlhf am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit rlhf getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Vereinheitlichte effiziente Feinabstimmung von 100+ LLMs & VLMs (ACL 2024)
★ 74.532+89Sterne-Änderung der letzten 7 Tage - #2
OpenAssistant ist ein chatbasierter Assistent, der Aufgaben versteht, mit Drittanbellsystemen interagieren und dynamisch Informationen abrufen kann, um dies zu ermöglichen.
★ 37.401-7Sterne-Änderung der letzten 7 Tage - #3
Die offizielle GitHub-Seite für das Umfragepapier "A Survey of Large Language Models".
★ 12.208+2Sterne-Änderung der letzten 7 Tage - #4
Offizielle Version der InternLM-Serie (InternLM, InternLM2, InternLM2.5, InternLM3).
★ 7.277+4Sterne-Änderung der letzten 7 Tage - #5
Chinesisches LLaMA-2 & Alpaca-2 LLM Phase-2-Projekt + 64K-Langkontextmodell (Chinese LLaMA-2 & Alpaca-2 LLMs mit 64K-Langkontextmodellen)
★ 7.120+0Sterne-Änderung der letzten 7 Tage - #6
Robuste Rezepte zur Ausrichtung von Sprachmodellen auf menschliche und KI-Präferenzen
★ 5.670-3Sterne-Änderung der letzten 7 Tage - #7
OpenClaw-RL: Trainieren Sie jeden Agenten einfach durch Sprache
★ 5.665+7Sterne-Änderung der letzten 7 Tage - #8
Die Open-Source-Forschungsumgebung für KI-Forscher zum nahtlosen Trainieren, Evaluieren und Skalieren von Modellen von lokaler Hardware bis hin zu GPU-Clustern.
★ 5.185+3Sterne-Änderung der letzten 7 Tage - #9
Implementierung eines begründenden LLM in PyTorch von Grund auf, Schritt für Schritt
★ 5.138+49Sterne-Änderung der letzten 7 Tage - #10
Argilla ist ein Kollaborationstool für KI-Ingenieure und Fachexperten zum Erstellen hochwertiger Datensätze
★ 5.093+5Sterne-Änderung der letzten 7 Tage - #11
KI-Systeme entwickeln, bewerten und optimieren. Beinhaltet Evaluierungen, RAG, Agenten, Fine-Tuning, synthetische Datenerzeugung, Dataset-Management, MCP und mehr.
★ 5.042+5Sterne-Änderung der letzten 7 Tage - #12
Align Anything: Training von Multimodus-Modellen mit Feedback
★ 4.671+3Sterne-Änderung der letzten 7 Tage - #13
Eine kuratierte Liste von Ressourcen zu Reinforcement Learning from Human Feedback (kontinuierlich aktualisiert)
★ 4.424+2Sterne-Änderung der letzten 7 Tage - #14
🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.
★ 4.199+54Sterne-Änderung der letzten 7 Tage - #15★ 3.485-1Sterne-Änderung der letzten 7 Tage
- #16
Distilabel ist ein Framework für synthetische Daten und KI-Feedback für Ingenieure, die schnelle, zuverlässige und skalierbare Pipelines auf der Grundlage verifizierter Forschungsarbeiten benötigen.
★ 3.384+3Sterne-Änderung der letzten 7 Tage - #17
Eine effiziente und benutzerfreundliche Skalierungsbibliothek für Reinforcement Learning mit Large Language Models
★ 3.380+6Sterne-Änderung der letzten 7 Tage - #18
LeetCode für PyTorch — 65 ML/AI-Interviewprobleme aus echten Interviews bei Google, Meta, Anthropic. Jupyter-Notebooks, ein automatischer Evaluator und ein MCP-KI-Tutor.
★ 2.461+12Sterne-Änderung der letzten 7 Tage - #19★ 2.357+11Sterne-Änderung der letzten 7 Tage
- #20
Ein automatischer Evaluator für anweisungsbefolgende Sprachmodelle. Von Menschen validiert, qualitativ hochwertig, günstig und schnell.
★ 2.012-1Sterne-Änderung der letzten 7 Tage - #21
Awesome List für Agentic RL
★ 1.832+29Sterne-Änderung der letzten 7 Tage - #22
[NeurIPS 2023] ImageReward: Lernen und Bewerten menschlicher Präferenzen für Text-zu-Bild-Generierung
★ 1.703+1Sterne-Änderung der letzten 7 Tage - #23
Safe RLHF: Restriktive Werteausrichtung durch sicheres Reinforcement Learning aus menschlichem Feedback
★ 1.613+1Sterne-Änderung der letzten 7 Tage - #24★ 1.601-1Sterne-Änderung der letzten 7 Tage
- #25
Rezepte zum Trainieren von Belohnungsmodellen für RLHF.
★ 1.541+0Sterne-Änderung der letzten 7 Tage - #26★ 1.430+0Sterne-Änderung der letzten 7 Tage
- #27
Xtreme1 ist eine All-in-One-Datenkennzeichnungs- und Annotationsplattform für multimodales Datentraining und unterstützt 3D-LiDAR-Punktwolken, Bilder und LLMs.
★ 1.239+2Sterne-Änderung der letzten 7 Tage - #28
[NeurIPS 2024] SimPO: Simple Preference Optimization mit einer referenzfreien Belohnung
★ 959+1Sterne-Änderung der letzten 7 Tage - #29★ 955+60Sterne-Änderung der letzten 7 Tage
- #30
„AI-Compass“ weist der Community den Weg im Ozean der KI-Technologien. Egal ob Anfänger oder fortgeschrittener Entwickler, hier findet jeder den Pfad zu den verschiedenen KI-Richtungen. Ziel ist es, Entwicklern zu helfen, die Kernkonzepte, Mainstream-Technologien und Zukunftstrends von KI systematisch zu verstehen und den gesamten Prozess von der Theorie bis zur Praxis durch Übung zu meistern.
★ 933+10Sterne-Änderung der letzten 7 Tage