본문으로 건너뛰기
buildradar
Sign in
토픽 · ai-safety

ai-safety

ai-safety 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
18
총 스타
41,106
평균 스타
2,284
비중
0.00%

같은 리포지토리에 ai-safety 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 ai-safety 태그가 달린 리포지토리예요.

  • agent-safe-pipeline@decionis

    작업을 제안하지만 승인 권한은 없는 AI 에이전트를 위한 참조 아키텍처입니다. 불변 의도 캡처, 독립적인 Decision 정책 판정(ALLOW/ESCALATE/BLOCK), 검증된 인간 승인, 일회성 의도 기반 권한을 사용하는 SafeExecutor를 포함합니다.

    533
  • floe-guard@Floe-Labs

    AI 음성 에이전트를 위한 지출 측정기 및 예산 제한 도구. STT, TTS, LLM, 전화 통화당 비용을 즉시 측정하며(Pipecat, LiveKit - Python & TypeScript), 설정한 예산을 초과하기 전에 다음 턴을 강제로 중단함. 로컬 실행, 계정 불필요, 텔레메트리 없음. Floe 제작.

    434
  • iFixAi@ifixai-ai

    AI 에이전트 독립 감사. AI 에이전트 경제에서 가장 중요한 질문에 답하기 위해 사람이 직접 또는 에이전트 스스로 실행합니다. 에이전트가 의도대로 작동하고 있나요? iFixAi를 사용하면 120초 이내에 이 질문에 대한 답을 얻을 수 있습니다.

    12,643+1,459최근 7일 스타 변화
  • AI 에이전트 거버넌스 툴킷 — 자율형 AI 에이전트를 위한 정책 집행, 제로 트러스트 신원, 실행 샌드박싱 및 신뢰성 엔지니어링. OWASP Agentic Top 10을 완벽하게 지원합니다.

    6,180+51최근 7일 스타 변화
  • AI-Infra-Guard@Tencent

    에이전트 스캔, 스킬 스캔, MCP 스캔, AI 인프라 스캔 및 LLM 탈옥 평가를 통해 AI 생태계를 보호하는 풀스택 AI 레드 테이밍 플랫폼.

    6,117+128최근 7일 스타 변화
  • 엄선된 유익한 책임감 있는 머신러닝 리소스 목록입니다.

    4,065+5최근 7일 스타 변화
  • valqore@valqore

    AI 기반 클라우드 및 Kubernetes 작업을 위한 안전 제일 가드레일

    1,921+85최근 7일 스타 변화
  • safe-rlhf@PKU-Alignment

    Safe RLHF: 안전한 인간 피드백 기반 강화 학습을 통한 제약된 가치 정렬

    1,613+2최근 7일 스타 변화
  • cc-safety-net@kenryu42

    AI 코딩 에이전트 가드레일 — 파괴적인 git 및 파일 시스템 명령어와 비밀 파일 접근을 실행 전에 차단하는 CLI 훅입니다. Amp Code, Antigravity CLI, Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI, Hermes Agent, Kimi Code, OpenClaw, OpenCode, Pi를 지원합니다.

    1,521+13최근 7일 스타 변화
  • MOSS-RLHF@OpenLMLab

    대규모 언어 모델(LLM)의 RLHF 비밀 파트 I: PPO

    1,430+1최근 7일 스타 변화
  • uqlm@cvs-health

    [JMLR 2026] "UQLM: 대형 언어 모델의 불확실성 정량화를 위한 Python 패키지"

    1,194+2최근 7일 스타 변화
  • muapi.ai 공식 CLI — 터미널에서 이미지, 비디오, 오디오 생성. MCP 서버, 14개 AI 모델, npm 및 pip 설치 지원.

    1,049+0최근 7일 스타 변화
  • AgentLens@ZhangJinHaHaHa

    Agentlens는 신뢰할 수 있는 에이전트 거래 플랫폼입니다. 이곳에서 필요에 맞는 에이전트를 빠르게 찾을 수 있으며, 자신의 에이전트를 게시하여 디지털 자산으로 만들 수도 있습니다. 우리는 모든 사람이 자신의 전문 분야를 에이전트로 변환하여 디지털 자산으로 만들고 다른 사람들이 당신의 고유한 강점을 볼 수 있도록 장려합니다.

    1,035+0최근 7일 스타 변화
  • 대규모 언어 모델(LLM)의 머신 언리닝을 위한 리소스 저장소

    623+0최근 7일 스타 변화
  • h5i@h5i-dev

    멀티 에이전트 팀을 위한 샌드박스형 협업 도구: 각 에이전트가 일회용 샌드박스에 격리된 Git 백엔드 메시지 포럼. 자격 증명이나 호스트 액세스 공유 없이 여러 기기 간에 조율을 수행합니다.

    623+60최근 7일 스타 변화
  • langtest@PacificAI

    안전하고 효과적인 언어 모델 제공

    559+0최근 7일 스타 변화
  • PostTrainBench@aisa-group

    Claude Code나 Codex CLI 같은 CLI 에이전트가 단일 H100 GPU에서 10시간 만에 베이스 LLM을 얼마나 잘 사후 학습(post-train)할 수 있는지 측정

    546+12최근 7일 스타 변화
  • agent-safe-pipeline@decionis

    작업을 제안하지만 승인 권한은 없는 AI 에이전트를 위한 참조 아키텍처입니다. 불변 의도 캡처, 독립적인 Decision 정책 판정(ALLOW/ESCALATE/BLOCK), 검증된 인간 승인, 일회성 의도 기반 권한을 사용하는 SafeExecutor를 포함합니다.

    533+2최근 7일 스타 변화
  • PromptInject@agencyenterprise

    PromptInject는 프롬프트를 모듈식으로 구성하여 LLM의 적대적 프롬프트 공격에 대한 견고성을 정량적으로 분석하는 프레임워크입니다. (NeurIPS ML Safety Workshop 2022 최우수 논문상 수상)

    522+1최근 7일 스타 변화
  • cordum@cordum-io

    The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.

    501최근 7일 스타 변화
← 토픽 목록으로