Zum Hauptinhalt springen
buildradar
Sign in
Thema · ai-safety

ai-safety

Erfasste Open-Source-Repos mit dem Tag ai-safety, sortiert nach Sternen.

Repos
18
Sterne gesamt
41.106
Sterne im Schnitt
2.284
Anteil
0,00%

Themen, die häufig gemeinsam mit ai-safety am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit ai-safety getaggt wurden.

  • agent-safe-pipeline@decionis

    Referenzarchitektur für KI-Agenten, die Aktionen vorschlagen, diese jedoch nicht autorisieren können – umfasst unveränderliche Intent-Erfassung, eine unabhängige Entscheidungsrichtlinie (ALLOW/ESCALATE/BLOCK), verifizierte menschliche Freigabe und einen SafeExecutor, der eine einmalige, an den Intent gebundene Berechtigung verarbeitet

    533
  • floe-guard@Floe-Labs

    Ausgabenzähler und Budget-Limitierung für KI-Sprachagenten. Erfasst STT + TTS + LLM + Telefonie pro Anruf (Pipecat, LiveKit – Python & TypeScript). Stoppt den nächsten Turn, bevor das Budget überschritten wird. Lokal, kein Konto, keine Telemetrie. Entwickelt von Floe – Kostenkontrolle für Voice AI.

    434
  • iFixAi@ifixai-ai

    Unabhängige Prüfung von KI-Agenten. Ausgeführt von Menschen oder dem Agenten selbst, um die wichtigste Frage in der KI-Agenten-Wirtschaft zu beantworten: Tut der Agent das, was er tun soll? Mit iFixAi erhalten Sie diese Antwort in weniger als 120 Sekunden.

    12.643+1.247Sterne-Änderung der letzten 7 Tage
  • KI-Agenten-Governance-Toolkit – Durchsetzung von Richtlinien, Zero-Trust-Identität, Ausführungssandboxing und Zuverlässigkeitstechnik für autonome KI-Agenten. Deckt 10/10 OWASP Agentic Top 10 ab.

    6.180+32Sterne-Änderung der letzten 7 Tage
  • AI-Infra-Guard@Tencent

    Eine Full-Stack-KI-Red-Teaming-Plattform zur Sicherung von KI-Ökosystemen über Agent Scan, Skills Scan, MCP Scan, AI Infra Scan und LLM-Jailbreak-Evaluierung.

    6.117+59Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste fantastischer Ressourcen für verantwortungsvolles maschinelles Lernen.

    4.065+2Sterne-Änderung der letzten 7 Tage
  • valqore@valqore

    Sicherheitsorientierte Leitplanken für KI-gesteuerte Cloud- und Kubernetes-Operationen

    1.921+48Sterne-Änderung der letzten 7 Tage
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Restriktive Werteausrichtung durch sicheres Reinforcement Learning aus menschlichem Feedback

    1.613+1Sterne-Änderung der letzten 7 Tage
  • cc-safety-net@kenryu42

    Ein Schutzmechanismus für KI-Coding-Agenten – ein CLI-Hook, der destruktive Git- und Dateisystembefehle sowie den Zugriff auf Geheimdateien vor der Ausführung blockiert. Unterstützt Amp Code, Antigravity CLI, Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI, Hermes Agent, Kimi Code, OpenClaw, OpenCode und Pi.

    1.521+9Sterne-Änderung der letzten 7 Tage
  • MOSS-RLHF@OpenLMLab

    Geheimnisse von RLHF in Large Language Models Teil I: PPO

    1.430+0Sterne-Änderung der letzten 7 Tage
  • uqlm@cvs-health

    [JMLR 2026] „UQLM: Ein Python-Paket zur Quantifizierung von Unsicherheiten in Large Language Models“

    1.194+1Sterne-Änderung der letzten 7 Tage
  • Offizielle CLI für muapi.ai — Generieren Sie Bilder, Videos und Audio über das Terminal. MCP-Server, 14 KI-Modelle, über npm + pip installierbar.

    1.049+7Sterne-Änderung der letzten 7 Tage
  • AgentLens@ZhangJinHaHaHa

    Agentlens ist eine vertrauenswürdige Agent-Handelsplattform. Hier können Sie schnell den Agenten finden, der Ihren Anforderungen entspricht, und Ihren eigenen Agenten veröffentlichen, um ihn in ein digitales Asset zu verwandeln. Wir ermutigen jeden, seine Fachgebiete in Agenten und digitale Assets umzuwandeln, damit andere Ihre einzigartigen Stärken sehen können.

    1.035+0Sterne-Änderung der letzten 7 Tage
  • Ein Ressourcen-Repository für Machine Unlearning in Large Language Models

    623+0Sterne-Änderung der letzten 7 Tage
  • h5i@h5i-dev

    Sandkastenbasierte Zusammenarbeit für Multi-Agenten-Teams: ein Git-basiertes Nachrichtenforum, bei dem jeder Agent in seinem eigenen Einweg-Sandbox isoliert ist. Verwandelt ein Git-Repository in ein sicheres Nachrichtenforum für KI-Agenten.

    623+48Sterne-Änderung der letzten 7 Tage
  • langtest@PacificAI

    Bereitstellung sicherer und effektiver Sprachmodelle.

    559+0Sterne-Änderung der letzten 7 Tage
  • PostTrainBench@aisa-group

    Messung, wie gut CLI-Agenten wie Claude Code oder Codex CLI Basis-LLMs auf einer einzelnen H100 GPU in 10 Stunden nachtrainieren können.

    548+9Sterne-Änderung der letzten 7 Tage
  • agent-safe-pipeline@decionis

    Referenzarchitektur für KI-Agenten, die Aktionen vorschlagen, diese jedoch nicht autorisieren können – umfasst unveränderliche Intent-Erfassung, eine unabhängige Entscheidungsrichtlinie (ALLOW/ESCALATE/BLOCK), verifizierte menschliche Freigabe und einen SafeExecutor, der eine einmalige, an den Intent gebundene Berechtigung verarbeitet

    533+3Sterne-Änderung der letzten 7 Tage
  • PromptInject@agencyenterprise

    PromptInject ist ein Framework, das Prompts modular zusammenstellt, um die Robustheit von LLMs gegenüber adversariellen Angriffen quantitativ zu analysieren. Ausgezeichnet mit dem Best Paper Award auf dem NeurIPS ML Safety Workshop 2022

    522+2Sterne-Änderung der letzten 7 Tage
  • cordum@cordum-io

    The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.

    502Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen