ai-safety
Erfasste Open-Source-Repos mit dem Tag ai-safety, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit ai-safety am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit ai-safety getaggt wurden.
- #1
Referenzarchitektur für KI-Agenten, die Aktionen vorschlagen, diese jedoch nicht autorisieren können – umfasst unveränderliche Intent-Erfassung, eine unabhängige Entscheidungsrichtlinie (ALLOW/ESCALATE/BLOCK), verifizierte menschliche Freigabe und einen SafeExecutor, der eine einmalige, an den Intent gebundene Berechtigung verarbeitet
★ 533 - #2
Ausgabenzähler und Budget-Limitierung für KI-Sprachagenten. Erfasst STT + TTS + LLM + Telefonie pro Anruf (Pipecat, LiveKit – Python & TypeScript). Stoppt den nächsten Turn, bevor das Budget überschritten wird. Lokal, kein Konto, keine Telemetrie. Entwickelt von Floe – Kostenkontrolle für Voice AI.
★ 434
- #1
Unabhängige Prüfung von KI-Agenten. Ausgeführt von Menschen oder dem Agenten selbst, um die wichtigste Frage in der KI-Agenten-Wirtschaft zu beantworten: Tut der Agent das, was er tun soll? Mit iFixAi erhalten Sie diese Antwort in weniger als 120 Sekunden.
★ 12.643+1.247Sterne-Änderung der letzten 7 Tage - #2
KI-Agenten-Governance-Toolkit – Durchsetzung von Richtlinien, Zero-Trust-Identität, Ausführungssandboxing und Zuverlässigkeitstechnik für autonome KI-Agenten. Deckt 10/10 OWASP Agentic Top 10 ab.
★ 6.180+32Sterne-Änderung der letzten 7 Tage - #3
Eine Full-Stack-KI-Red-Teaming-Plattform zur Sicherung von KI-Ökosystemen über Agent Scan, Skills Scan, MCP Scan, AI Infra Scan und LLM-Jailbreak-Evaluierung.
★ 6.117+59Sterne-Änderung der letzten 7 Tage - #4
Eine kuratierte Liste fantastischer Ressourcen für verantwortungsvolles maschinelles Lernen.
★ 4.065+2Sterne-Änderung der letzten 7 Tage - #5
Sicherheitsorientierte Leitplanken für KI-gesteuerte Cloud- und Kubernetes-Operationen
★ 1.921+48Sterne-Änderung der letzten 7 Tage - #6
Safe RLHF: Restriktive Werteausrichtung durch sicheres Reinforcement Learning aus menschlichem Feedback
★ 1.613+1Sterne-Änderung der letzten 7 Tage - #7
Ein Schutzmechanismus für KI-Coding-Agenten – ein CLI-Hook, der destruktive Git- und Dateisystembefehle sowie den Zugriff auf Geheimdateien vor der Ausführung blockiert. Unterstützt Amp Code, Antigravity CLI, Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI, Hermes Agent, Kimi Code, OpenClaw, OpenCode und Pi.
★ 1.521+9Sterne-Änderung der letzten 7 Tage - #8★ 1.430+0Sterne-Änderung der letzten 7 Tage
- #9
[JMLR 2026] „UQLM: Ein Python-Paket zur Quantifizierung von Unsicherheiten in Large Language Models“
★ 1.194+1Sterne-Änderung der letzten 7 Tage - #10
Offizielle CLI für muapi.ai — Generieren Sie Bilder, Videos und Audio über das Terminal. MCP-Server, 14 KI-Modelle, über npm + pip installierbar.
★ 1.049+7Sterne-Änderung der letzten 7 Tage - #11
Agentlens ist eine vertrauenswürdige Agent-Handelsplattform. Hier können Sie schnell den Agenten finden, der Ihren Anforderungen entspricht, und Ihren eigenen Agenten veröffentlichen, um ihn in ein digitales Asset zu verwandeln. Wir ermutigen jeden, seine Fachgebiete in Agenten und digitale Assets umzuwandeln, damit andere Ihre einzigartigen Stärken sehen können.
★ 1.035+0Sterne-Änderung der letzten 7 Tage - #12
Ein Ressourcen-Repository für Machine Unlearning in Large Language Models
★ 623+0Sterne-Änderung der letzten 7 Tage - #13
Sandkastenbasierte Zusammenarbeit für Multi-Agenten-Teams: ein Git-basiertes Nachrichtenforum, bei dem jeder Agent in seinem eigenen Einweg-Sandbox isoliert ist. Verwandelt ein Git-Repository in ein sicheres Nachrichtenforum für KI-Agenten.
★ 623+48Sterne-Änderung der letzten 7 Tage - #14★ 559+0Sterne-Änderung der letzten 7 Tage
- #15
Messung, wie gut CLI-Agenten wie Claude Code oder Codex CLI Basis-LLMs auf einer einzelnen H100 GPU in 10 Stunden nachtrainieren können.
★ 548+9Sterne-Änderung der letzten 7 Tage - #16
Referenzarchitektur für KI-Agenten, die Aktionen vorschlagen, diese jedoch nicht autorisieren können – umfasst unveränderliche Intent-Erfassung, eine unabhängige Entscheidungsrichtlinie (ALLOW/ESCALATE/BLOCK), verifizierte menschliche Freigabe und einen SafeExecutor, der eine einmalige, an den Intent gebundene Berechtigung verarbeitet
★ 533+3Sterne-Änderung der letzten 7 Tage - #17
PromptInject ist ein Framework, das Prompts modular zusammenstellt, um die Robustheit von LLMs gegenüber adversariellen Angriffen quantitativ zu analysieren. Ausgezeichnet mit dem Best Paper Award auf dem NeurIPS ML Safety Workshop 2022
★ 522+2Sterne-Änderung der letzten 7 Tage - #18
The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.
★ 502—Sterne-Änderung der letzten 7 Tage