跳到主要內容
buildradar
登入
主題 · ai-safety

ai-safety

標記 ai-safety 主題、收錄中的開源專案,依星數排序。

專案數
18
總星數
41,106
平均星數
2,284
佔比
0.00%

常跟 ai-safety 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 ai-safety 主題的專案。

  • agent-safe-pipeline@decionis

    AI 代理參考架構,僅能提議行動而無法授權:包含不可變意圖擷取、獨立決策策略判定(允許/升級/封鎖)、驗證過的人工審核,以及消耗單次意圖綁定授權的 SafeExecutor。

    532
  • floe-guard@Floe-Labs

    AI 語音代理的支出計量與預算閘道。開箱即用,可針對每次通話計量 STT、TTS、LLM 與電話費用(支援 Pipecat、LiveKit — Python 與 TypeScript)。在費用超出上限前強制停止下一次對話。本地執行、無需帳號、無遙測。由 Floe 打造 — 語音 AI 的成本控制方案。

    434
  • iFixAi@ifixai-ai

    AI 代理的獨立審計。由人類或代理自行執行,以回答 AI 代理經濟中最關鍵的問題:代理是否在執行其應有的任務?使用 iFixAi,您可在 120 秒內得到答案。

    12,643+0近 7 天星數變化
  • AI 代理治理工具包——政策執行、零信任身份、執行沙盒與可靠性工程,適用於自主 AI 代理。涵蓋 OWASP Agentic Top 10 全部項目。

    6,180+0近 7 天星數變化
  • AI-Infra-Guard@Tencent

    全棧 AI Red Teaming 平台,通過 Agent Scan、Skills Scan、MCP Scan、AI Infra Scan 以及 LLM jailbreak 評估來保護 AI 生態系統。

    6,117+0近 7 天星數變化
  • 精选负责任机器学习资源列表

    4,065+0近 7 天星數變化
  • valqore@valqore

    適用於 AI 驅動的雲端與 Kubernetes 維運的安全優先防護欄

    1,921+0近 7 天星數變化
  • safe-rlhf@PKU-Alignment

    Safe RLHF:透過來自人類回饋的安全強化學習進行受約束的價值對齊

    1,613+0近 7 天星數變化
  • cc-safety-net@kenryu42

    AI 程式碼代理防護網 — 一個 CLI 攔截勾點 (hook),可在執行前封鎖具破壞性的 git 與檔案系統指令以及機密檔案存取。支援 Amp Code、Antigravity CLI、Claude Code、Codex、Copilot CLI、Cursor、Gemini CLI、Hermes Agent、Kimi Code、OpenClaw、OpenCode 與 Pi。

    1,521+0近 7 天星數變化
  • MOSS-RLHF@OpenLMLab

    大型語言模型中 RLHF 的祕密第一部:PPO

    1,430+0近 7 天星數變化
  • uqlm@cvs-health

    [JMLR 2026] "UQLM:用於大型語言模型不確定性量化的 Python 套件"

    1,194+0近 7 天星數變化
  • muapi.ai 官方 CLI —— 從終端機產生影像、影片與音訊。具備 MCP 伺服器,包含 14 種 AI 模型,可透過 npm 與 pip 安裝。

    1,077+34近 7 天星數變化
  • AgentLens@ZhangJinHaHaHa

    Agentlens 是一個受信賴的 Agent 交易平台。在這裡,你可以快速找到符合需求的 Agent,也可以發布自己的 Agent 並將其轉化為數位資產。我們鼓勵每個人將自己的專業領域轉化為 Agent 與數位資產,讓其他人看見你的獨特優勢。

    1,034-1近 7 天星數變化
  • h5i@h5i-dev

    多 Agent 團隊的沙盒化協作:一個以 Git 為基底的訊息論壇,每個 Agent 都在各自的一次性沙盒中隔離。無需共用憑證或主機存取權即可跨機器協調。

    633+22近 7 天星數變化
  • 大型語言模型機器遺忘(machine unlearning)資源庫

    624+1近 7 天星數變化
  • langtest@PacificAI

    交付安全且有效的語言模型。

    559+0近 7 天星數變化
  • PostTrainBench@aisa-group

    評估 Claude Code 或 Codex CLI 等 CLI 代理在 10 小時內於單張 H100 GPU 上對基礎 LLM 進行後訓練的成效

    550+3近 7 天星數變化
  • agent-safe-pipeline@decionis

    AI 代理參考架構,僅能提議行動而無法授權:包含不可變意圖擷取、獨立決策策略判定(允許/升級/封鎖)、驗證過的人工審核,以及消耗單次意圖綁定授權的 SafeExecutor。

    532+0近 7 天星數變化
  • PromptInject@agencyenterprise

    PromptInject 是一個以模組化方式組合提示詞的框架,用於對 LLM 對抗性提示攻擊的穩健性進行定量分析。榮獲 NeurIPS ML Safety Workshop 2022 最佳論文獎。

    523+1近 7 天星數變化
  • cordum@cordum-io

    The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.

    502近 7 天星數變化
← 返回主題列表