开源 · Agent 红队 skills
攻击手册,变成你的 Agent 能跑的 skill
因为攻防本就是 AI 驱动的,方法本身就是 skill。把某个 skill 丢进你的 Agent(兼容 Claude Skills / agentskills.io / Hermes 的 SKILL.md),指向一个你拥有的 Agent,它就自动跑测试、经验证、出带证据的发现。Apache-2.0。
SKILL.md · 可移植 · Apache-2.0 · 9
RT-1
提示词注入
✓ 已实测验证处理的内容能否劫持任务?直接、间接、多轮、编码。
看 SKILL.md →
RT-2
工具 / 动作滥用
被诱导调用不该调的工具、参数被劫持、或混淆代理。
看 SKILL.md →
RT-3
沙箱 / 隔离
✓ 已实测验证工具是否无隔离运行?沙箱会不会静默关闭?
看 SKILL.md →
RT-4
动作门禁绕过
高危动作能否绕过带外确认直达执行?
看 SKILL.md →
RT-5
通道注入
入站通道内容(私信/群/转发)能否操纵 Agent?
看 SKILL.md →
RT-6
记忆投毒
✓ 已实测验证注入能否写进记忆、在未来会话自动复发?
看 SKILL.md →
RT-7
供应链
被投毒的技能/MCP/依赖能否变成可信指令?
看 SKILL.md →
RT-8
数据外泄
注入能否把密钥/PII 送到攻击者出口?
看 SKILL.md →
method
静态×动态编排
编排静态分诊 → 动态证实。裁判是真打穿。
看 SKILL.md →
◇每个 skill 都强制这些
- 只测你拥有、或有书面授权的目标。
- 只在一次性环境里跑——绝不碰生产、不碰有真实数据的机器。
- 绝不碰目标的真凭证——按引用用,看不到值。
- 只用无害标记——随机 token,不破坏、不外泄、不留持久化。
- 公开方法不公开武器——只讲怎么测怎么确认,不给能直接开火的载荷。
- 负责任披露——私下带修复上报;Agent 防得好就说好。