AI Agent 红队 · 以真实利用验证

我们红队打穿你的 AI Agent,再把报告交到你手上

每个“有手”的 Agent 都是一个新攻击面。自动扫描只能把简单的那层判成 A——真正的风险(提示词注入、工具滥用、沙箱逃逸、投毒技能)需要一个对手。我们派上一个 AI 对手,把 Agent 打穿,再交给你一份测试报告:什么被打穿、什么扛住了、以及证明它的那次真实利用——一份你能递给客户、审计或保险的报告。

真实案例:一个在我们扫描器上得 A 的 Agent,第一次就倒在提示词注入上。
01我们怎么做红队 · 证实 · 报告
01 红队

像对手一样打它

我们针对你的 Agent 适配——读它自己的代码、起一次性 harness、攻真正会把 Agent 搞挂的各层:提示词注入、工具/技能滥用、框架 appsec、隔离。方法就是我们开源的 skills,不是勾清单。

02 证实与证伪

裁判是 exploit

一个发现,只有当真实、攻击者可达的 exploit 真打响了才算确认;假警报当众证伪——连我们自己的都撤回。证实、证伪、可复现——不是模型投票。

03 报告

一份你敢据此行动的裁决

你拿到一份测试报告:什么被打穿、什么扛住、证明它的那次 exploit、根因和修复——政企客户、审计、或保险公司都敢据此信赖的证据。(免费扫描作为前门可用,但报告才是产品。)

02实战记录拿结果说话
IronClaw v0.29.1 · 扫描 A · 红队:被打穿

它得了 A。十分钟后它被拿下。

我们把自动基线跑在一个真正“安全优先”的开源 Agent 上。它拿了 A:管理面只绑 localhost、网关随机 token、敏感接口返回 401。然后我们手工红队——它第一次尝试就听了藏在“待总结内容”里的一句指令。它的工具沙箱还是静默关着的。

读完整红队记录 →
03命令行零依赖 · Python 3.8+

在自己的盒子上跑免费扫描

扫本机 Agent 用 CLI(浏览器和托管后端都碰不到你的 localhost)。这是漏斗;红队才是深度。

python3 scan.py --target http://127.0.0.1:3000 --path /path/to/agent
python3 scan.py --target http://127.0.0.1:3000 --json
信壳红队打穿 AI Agent,交付以真实利用验证的测试报告。我们的方法是开放的:我们用的那套红队 skills 就在 GitHub 上(Apache-2.0),而我们的实战 field note 就是它们能打穿真实 Agent 的证明——证实能利用的、证伪不能利用的、并会撤回自己的错。真假的裁判是「真打穿」,不是模型投票。报告,就是产品。