2 projects share this name
ClawSafety
2 个独立团队从相反角度切入 AI Agent 安全——一个衡量 Agent 有多安全,另一个让它们更安全。同名,互补使命。
ClawSafety(基准测试)
by weibowen555独立(学术研究)
个人 AI Agent 安全基准测试。120 个对抗测试用例,评估前沿 LLM 作为 Agent 骨干时是否能保持安全。
Key Features
- •120 个对抗测试用例,覆盖 5 个危害领域(DevOps、金融、医疗、法律、软件工程)
- •3 种攻击向量:技能注入、邮件注入、网页注入
- •测试了 Claude Sonnet 4.6、Gemini 2.5 Pro、GPT-5.1、DeepSeek V3、Kimi K2.5
- •Scaffold 对比:OpenClaw vs Nanobot vs NemoClaw
- •核心发现:聊天安全的模型在 Agent 提示注入下 40-75% 会服从恶意指令
Best for: 安全研究者和 LLM 开发者评估 Agent 安全性。如果你构建或部署 AI Agent,这个基准测试告诉你它们有多脆弱。
基准测试提示注入对抗测试120测试用例arXiv论文