ai-safety
Repositori open source terpantau bertanda ai-safety, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan ai-safety di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda ai-safety.
- #1
Arsitektur referensi untuk agen AI yang mengusulkan tindakan tetapi tidak dapat mengotorisasinya — pengambilan intent yang tidak dapat diubah, putusan kebijakan Decionis independen (ALLOW/ESCALATE/BLOCK), persetujuan manusia yang diverifikasi, dan SafeExecutor yang menggunakan izin terikat intent sekali pakai.
★ 533 - #2
Pengukur pengeluaran dan gerbang anggaran untuk agen suara AI. Mengukur STT + TTS + LLM + telepon per panggilan secara langsung (Pipecat, LiveKit — Python & TypeScript). Menghentikan paksa giliran berikutnya sebelum melebihi batas Anda. Lokal, tanpa akun, tanpa telemetri. Dibangun oleh Floe — kontrol biaya untuk Voice AI.
★ 434
- #1
Audit independen untuk AI Agent. Dijalankan oleh manusia atau agen itu sendiri untuk menjawab pertanyaan paling krusial dalam Ekonomi AI Agent: Apakah agen melakukan apa yang seharusnya dilakukan? Dengan iFixAi, Anda bisa mendapatkan jawabannya dalam waktu kurang dari 120 detik.
★ 12.643+1.247Perubahan bintang dalam 7 hari terakhir - #2
AI Agent Governance Toolkit — Penegakan kebijakan, identitas zero-trust, sandboxing eksekusi, dan rekayasa keandalan untuk agen AI otonom. Mencakup 10/10 OWASP Agentic Top 10.
★ 6.180+32Perubahan bintang dalam 7 hari terakhir - #3
Platform AI Red Teaming full-stack untuk mengamankan ekosistem AI melalui Agent Scan, Skills Scan, MCP scan, AI Infra scan, dan evaluasi jailbreak LLM.
★ 6.117+59Perubahan bintang dalam 7 hari terakhir - #4
Daftar kurasi sumber daya machine learning yang bertanggung jawab.
★ 4.065+2Perubahan bintang dalam 7 hari terakhir - #5
Pengaman yang mengutamakan keselamatan untuk operasi cloud dan Kubernetes yang digerakkan oleh AI
★ 1.921+48Perubahan bintang dalam 7 hari terakhir - #6
Safe RLHF: Penyelarasan Nilai Terbatas melalui Safe Reinforcement Learning from Human Feedback
★ 1.613+1Perubahan bintang dalam 7 hari terakhir - #7
Pengaman agen pengkodean AI — kait CLI yang memblokir perintah git dan sistem file yang destruktif serta akses file rahasia sebelum dieksekusi. Mendukung Amp Code, Antigravity CLI, Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI, Hermes Agent, Kimi Code, OpenClaw, OpenCode, dan Pi.
★ 1.521+9Perubahan bintang dalam 7 hari terakhir - #8★ 1.430+0Perubahan bintang dalam 7 hari terakhir
- #9
[JMLR 2026] "UQLM: Paket Python untuk Kuantifikasi Ketidakpastian dalam Large Language Models"
★ 1.194+1Perubahan bintang dalam 7 hari terakhir - #10
CLI resmi untuk muapi.ai — menghasilkan gambar, video, & audio dari terminal. Mendukung server MCP, 14 model AI, serta dapat diinstal via npm dan pip.
★ 1.071+29Perubahan bintang dalam 7 hari terakhir - #11
Agentlens adalah platform trading agen tepercaya. Di sini, Anda dapat dengan cepat menemukan Agen yang memenuhi kebutuhan Anda, serta memublikasikan Agen Anda sendiri untuk mengubahnya menjadi aset digital. Kami mendorong semua orang untuk mengubah keahlian mereka menjadi Agen dan aset digital agar orang lain dapat melihat keunggulan unik Anda.
★ 1.034-1Perubahan bintang dalam 7 hari terakhir - #12
Kolaborasi tersandbox untuk tim multi-agen: forum pesan berbasis Git dengan setiap agen diisolasi dalam sandbox sekali pakai. Ubah repositori Git menjadi forum pesan yang aman untuk agen AI.
★ 629+54Perubahan bintang dalam 7 hari terakhir - #13
Repositori sumber daya untuk machine unlearning pada model bahasa besar (large language models)
★ 624+1Perubahan bintang dalam 7 hari terakhir - #14★ 559+0Perubahan bintang dalam 7 hari terakhir
- #15
Mengukur seberapa baik agen CLI seperti Claude Code atau Codex CLI dapat melatih ulang base LLM pada satu GPU H100 dalam 10 jam
★ 548+11Perubahan bintang dalam 7 hari terakhir - #16
Arsitektur referensi untuk agen AI yang mengusulkan tindakan tetapi tidak dapat mengotorisasinya — pengambilan intent yang tidak dapat diubah, putusan kebijakan Decionis independen (ALLOW/ESCALATE/BLOCK), persetujuan manusia yang diverifikasi, dan SafeExecutor yang menggunakan izin terikat intent sekali pakai.
★ 533+3Perubahan bintang dalam 7 hari terakhir - #17
PromptInject adalah kerangka kerja yang merakit prompt secara modular untuk memberikan analisis kuantitatif tentang ketahanan LLM terhadap serangan prompt adversarial. 🏆 Penghargaan Makalah Terbaik @ NeurIPS ML Safety Workshop 2022
★ 522+2Perubahan bintang dalam 7 hari terakhir - #18
The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.
★ 502—Perubahan bintang dalam 7 hari terakhir