Zum Hauptinhalt springen
buildradar
Sign in
Thema · rlhf

rlhf

Erfasste Open-Source-Repos mit dem Tag rlhf, sortiert nach Sternen.

Repos
44
Sterne gesamt
223.657
Sterne im Schnitt
5.083
Anteil
0,01%

Themen, die häufig gemeinsam mit rlhf am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit rlhf getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • LlamaFactory@hiyouga

    Vereinheitlichte effiziente Feinabstimmung von 100+ LLMs & VLMs (ACL 2024)

    74.532+89Sterne-Änderung der letzten 7 Tage
  • Open-Assistant@LAION-AI

    OpenAssistant ist ein chatbasierter Assistent, der Aufgaben versteht, mit Drittanbellsystemen interagieren und dynamisch Informationen abrufen kann, um dies zu ermöglichen.

    37.401-7Sterne-Änderung der letzten 7 Tage
  • LLMSurvey@RUCAIBox

    Die offizielle GitHub-Seite für das Umfragepapier "A Survey of Large Language Models".

    12.208+2Sterne-Änderung der letzten 7 Tage
  • InternLM@InternLM

    Offizielle Version der InternLM-Serie (InternLM, InternLM2, InternLM2.5, InternLM3).

    7.277+4Sterne-Änderung der letzten 7 Tage
  • Chinesisches LLaMA-2 & Alpaca-2 LLM Phase-2-Projekt + 64K-Langkontextmodell (Chinese LLaMA-2 & Alpaca-2 LLMs mit 64K-Langkontextmodellen)

    7.120+0Sterne-Änderung der letzten 7 Tage
  • alignment-handbook@huggingface

    Robuste Rezepte zur Ausrichtung von Sprachmodellen auf menschliche und KI-Präferenzen

    5.670-3Sterne-Änderung der letzten 7 Tage
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Trainieren Sie jeden Agenten einfach durch Sprache

    5.665+7Sterne-Änderung der letzten 7 Tage
  • transformerlab-app@transformerlab

    Die Open-Source-Forschungsumgebung für KI-Forscher zum nahtlosen Trainieren, Evaluieren und Skalieren von Modellen von lokaler Hardware bis hin zu GPU-Clustern.

    5.185+3Sterne-Änderung der letzten 7 Tage
  • reasoning-from-scratch@rasbt

    Implementierung eines begründenden LLM in PyTorch von Grund auf, Schritt für Schritt

    5.138+49Sterne-Änderung der letzten 7 Tage
  • argilla@argilla-io

    Argilla ist ein Kollaborationstool für KI-Ingenieure und Fachexperten zum Erstellen hochwertiger Datensätze

    5.093+5Sterne-Änderung der letzten 7 Tage
  • Kiln@Kiln-AI

    KI-Systeme entwickeln, bewerten und optimieren. Beinhaltet Evaluierungen, RAG, Agenten, Fine-Tuning, synthetische Datenerzeugung, Dataset-Management, MCP und mehr.

    5.042+5Sterne-Änderung der letzten 7 Tage
  • align-anything@PKU-Alignment

    Align Anything: Training von Multimodus-Modellen mit Feedback

    4.671+3Sterne-Änderung der letzten 7 Tage
  • awesome-RLHF@opendilab

    Eine kuratierte Liste von Ressourcen zu Reinforcement Learning from Human Feedback (kontinuierlich aktualisiert)

    4.424+2Sterne-Änderung der letzten 7 Tage
  • hands-on-modern-rl@walkinglabs

    🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.

    4.199+54Sterne-Änderung der letzten 7 Tage
  • docta@Docta-ai

    Ein Arzt für Ihre Daten

    3.485-1Sterne-Änderung der letzten 7 Tage
  • distilabel@argilla-io

    Distilabel ist ein Framework für synthetische Daten und KI-Feedback für Ingenieure, die schnelle, zuverlässige und skalierbare Pipelines auf der Grundlage verifizierter Forschungsarbeiten benötigen.

    3.384+3Sterne-Änderung der letzten 7 Tage
  • ROLL@alibaba

    Eine effiziente und benutzerfreundliche Skalierungsbibliothek für Reinforcement Learning mit Large Language Models

    3.380+6Sterne-Änderung der letzten 7 Tage
  • TorchLeet@Exorust

    LeetCode für PyTorch — 65 ML/AI-Interviewprobleme aus echten Interviews bei Google, Meta, Anthropic. Jupyter-Notebooks, ein automatischer Evaluator und ein MCP-KI-Tutor.

    2.461+12Sterne-Änderung der letzten 7 Tage
  • rlhf-book@natolambert

    Lehrbuch über Reinforcement Learning from Human Feedback

    2.357+11Sterne-Änderung der letzten 7 Tage
  • alpaca_eval@tatsu-lab

    Ein automatischer Evaluator für anweisungsbefolgende Sprachmodelle. Von Menschen validiert, qualitativ hochwertig, günstig und schnell.

    2.012-1Sterne-Änderung der letzten 7 Tage
  • AgentsMeetRL@thinkwee

    Awesome List für Agentic RL

    1.832+29Sterne-Änderung der letzten 7 Tage
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward: Lernen und Bewerten menschlicher Präferenzen für Text-zu-Bild-Generierung

    1.703+1Sterne-Änderung der letzten 7 Tage
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Restriktive Werteausrichtung durch sicheres Reinforcement Learning aus menschlichem Feedback

    1.613+1Sterne-Änderung der letzten 7 Tage
  • WebGLM@THUDM

    WebGLM: Ein effizientes, web-unterstütztes Frage-Antwort-System (KDD 2023)

    1.601-1Sterne-Änderung der letzten 7 Tage
  • Rezepte zum Trainieren von Belohnungsmodellen für RLHF.

    1.541+0Sterne-Änderung der letzten 7 Tage
  • MOSS-RLHF@OpenLMLab

    Geheimnisse von RLHF in Large Language Models Teil I: PPO

    1.430+0Sterne-Änderung der letzten 7 Tage
  • xtreme1@xtreme1-io

    Xtreme1 ist eine All-in-One-Datenkennzeichnungs- und Annotationsplattform für multimodales Datentraining und unterstützt 3D-LiDAR-Punktwolken, Bilder und LLMs.

    1.239+2Sterne-Änderung der letzten 7 Tage
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO: Simple Preference Optimization mit einer referenzfreien Belohnung

    959+1Sterne-Änderung der letzten 7 Tage
  • verl-omni@verl-project

    Multimodales RL-Trainingsframework für Diffusions- und Omni-Modelle

    955+60Sterne-Änderung der letzten 7 Tage
  • AI-Compass@tingaicompass

    „AI-Compass“ weist der Community den Weg im Ozean der KI-Technologien. Egal ob Anfänger oder fortgeschrittener Entwickler, hier findet jeder den Pfad zu den verschiedenen KI-Richtungen. Ziel ist es, Entwicklern zu helfen, die Kernkonzepte, Mainstream-Technologien und Zukunftstrends von KI systematisch zu verstehen und den gesamten Prozess von der Theorie bis zur Praxis durch Übung zu meistern.

    933+10Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen