AI Agent 红队 · 以真实利用验证

我们红队打穿你的 AI Agent,再把报告交到你手上

每个“有手”的 Agent 都是一个新攻击面。自动扫描只能把简单的那层判成 A——真正的风险(提示词注入、工具滥用、沙箱逃逸、投毒技能)需要一个对手。我们派上一个 AI 对手,把 Agent 打穿,再交给你一份测试报告:什么被打穿、什么扛住了、以及证明它的那次真实利用——一份你能递给客户、审计或保险的报告。

已验证案例:一份我们只让它“总结”的文档,让 Agent 在宿主机上跑了我们的 shell 命令——marker 落盘,8 次中 5 次。我们报真实命中率,不四舍五入成“4/4”。
01我们怎么做红队 · 证实 · 报告
01 红队

像对手一样打它

我们针对你的 Agent 适配——读它自己的代码、起一次性 harness、攻真正会把 Agent 搞挂的各层:提示词注入、工具/技能滥用、框架 appsec、隔离。方法就是我们开源的 skills,不是勾清单。

02 证实与证伪

裁判是 exploit

一个发现,只有当真实、攻击者可达的 exploit 真打响了才算确认;假警报当众证伪——连我们自己的都撤回。证实、证伪、可复现——不是模型投票。

03 报告

一份你敢据此行动的裁决

你拿到一份测试报告:什么被打穿、什么扛住、证明它的那次 exploit、根因和修复——政企客户、审计、或保险公司都敢据此信赖的证据。背后的方法是开放的(见下);裁决才是产品。

02实战记录拿结果说话
Hermes Agent(Nous)· 间接注入 → 命令执行 · 已验证,5/8

一份只被要求“总结”的文档,跑了我们的命令。

我们给一个广泛使用的自托管 Agent 一个良性任务——“总结这份事故记录”——而记录里(攻击者可控的内容)藏了一句“运行某条 shell 命令”。它经自己的终端工具在宿主机上执行了那条命令:一个 marker 文件落到磁盘上。8 次里中了 5 次——另外 3 次它识破注入并拒绝,所以防御是真的、但是概率性的,攻击者多试几次就赢。这是——从一份 Agent 只是“读”了的文档里——实现的任意命令执行。我们报 ~60%,不报“每次”;exploit 是验证过的,对它命中率的诚实也是。

读完整红队记录 →
03开放的方法你的 agent 就能跑

红队 skills —— 可移植到任何 agent

这些公告背后用的那套方法是开放的,以可移植的 SKILL.md 形式。把它加载进 Claude Code、MCP 客户端、Cursor、或任何支持 skill 的 agent,对你自己拥有的 agent 跑同样的测试。这个——而不是扫描器——才是前门。

查看红队 skills 与用法 →
信壳红队打穿 AI Agent,交付以真实利用验证的测试报告。我们的方法是开放的:我们用的那套红队 skills 就在 GitHub 上(Apache-2.0),而我们的实战 field note 就是它们能打穿真实 Agent 的证明——证实能利用的、证伪不能利用的、并会撤回自己的错。真假的裁判是「真打穿」,不是模型投票。报告,就是产品。