跳到主要内容
buildradar
登录
主题 · ai-safety

ai-safety

标记 ai-safety 主题、收录中的开源项目,按星标数排序。

项目数
18
总星标数
41,106
平均星标数
2,284
占比
0.00%

常跟 ai-safety 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 ai-safety 主题的项目。

  • agent-safe-pipeline@decionis

    AI 代理参考架构,仅能提议行动而无法授权:包含不可变意图撷取、独立决策策略判定(允许/升级/封锁)、验证过的人工审核,以及消耗单次意图绑定授权的 SafeExecutor。

    532
  • floe-guard@Floe-Labs

    AI 语音代理的支出计量与预算网关。开箱即用,可针对每次通话计量 STT、TTS、LLM 与电话费用(支持 Pipecat、LiveKit — Python 与 TypeScript)。在费用超出上限前强制停止下一次对话。本地执行、无需账号、无遥测。由 Floe 打造 — 语音 AI 的成本控制方案。

    434
  • iFixAi@ifixai-ai

    AI 代理的独立审计。由人类或代理自行执行,以回答 AI 代理经济中最关键的问题:代理是否在执行其应有的任务?使用 iFixAi,您可在 120 秒内得到答案。

    12,643+0近 7 天星标变化
  • AI Agent Governance Toolkit — 政策执行、零信任身份、执行沙盒和可靠性工程,适用于自主 AI 代理。覆盖 OWASP Agentic Top 10 全部项目。

    6,180+0近 7 天星标变化
  • AI-Infra-Guard@Tencent

    全栈 AI Red Teaming 平台,通过 Agent Scan、Skills Scan、MCP Scan、AI Infra Scan 以及 LLM jailbreak 评估来保护 AI 生态系统。

    6,117+0近 7 天星标变化
  • 精选负责任机器学习资源列表

    4,065+0近 7 天星标变化
  • valqore@valqore

    适用于 AI 驱动的云与 Kubernetes 运维的安全优先护栏

    1,921+0近 7 天星标变化
  • safe-rlhf@PKU-Alignment

    Safe RLHF:通过来自人类反馈的安全强化学习进行受约束的价值对齐

    1,613+0近 7 天星标变化
  • cc-safety-net@kenryu42

    AI 程式码代理防护网 — 一个 CLI 拦截勾点 (hook),可在执行前封锁具破坏性的 git 与档案系统指令以及机密档案存取。支援 Amp Code、Antigravity CLI、Claude Code、Codex、Copilot CLI、Cursor、Gemini CLI、Hermes Agent、Kimi Code、OpenClaw、OpenCode 与 Pi。

    1,521+0近 7 天星标变化
  • MOSS-RLHF@OpenLMLab

    大型语言模型中 RLHF 的秘密第一部分:PPO

    1,430+0近 7 天星标变化
  • uqlm@cvs-health

    [JMLR 2026] "UQLM:用于大型语言模型不确定性量化的 Python 套件"

    1,194+0近 7 天星标变化
  • muapi.ai 官方 CLI —— 从终端生成图像、视频与音频。具备 MCP 服务器,包含 14 种 AI 模型,可通过 npm 与 pip 安装。

    1,077+34近 7 天星标变化
  • AgentLens@ZhangJinHaHaHa

    Agentlens 是一个受信任的 Agent 交易平台。在这里,你可以快速找到符合需求的 Agent,也可以发布自己的 Agent 并将其转化为数字资产。我们鼓励每个人将自己的专业领域转化为 Agent 与数字资产,让其他人看见你的独特优势。

    1,034-1近 7 天星标变化
  • h5i@h5i-dev

    多 Agent 团队的沙盒化协作:一个以 Git 为基底的消息论坛,每个 Agent 都在各自的一次性沙盒中隔离。无需共享凭证或主机访问权限即可跨机器协调。

    633+27近 7 天星标变化
  • 大型语言模型机器遗忘(machine unlearning)资源库

    624+1近 7 天星标变化
  • langtest@PacificAI

    交付安全且有效的语言模型。

    559+0近 7 天星标变化
  • PostTrainBench@aisa-group

    评估 Claude Code 或 Codex CLI 等 CLI 代理在 10 小时内于单张 H100 GPU 上对基础 LLM 进行后训练的成效

    550+5近 7 天星标变化
  • agent-safe-pipeline@decionis

    AI 代理参考架构,仅能提议行动而无法授权:包含不可变意图撷取、独立决策策略判定(允许/升级/封锁)、验证过的人工审核,以及消耗单次意图绑定授权的 SafeExecutor。

    532-1近 7 天星标变化
  • PromptInject@agencyenterprise

    PromptInject 是一个以模块化方式组合提示词的框架,用于对 LLM 对抗性提示攻击的稳健性进行定量分析。荣获 NeurIPS ML Safety Workshop 2022 最佳论文奖。

    523+2近 7 天星标变化
  • cordum@cordum-io

    The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.

    503近 7 天星标变化
← 返回主题列表