我们红队打穿你的 AI Agent,再把报告交到你手上
每个“有手”的 Agent 都是一个新攻击面。自动扫描只能把简单的那层判成 A——真正的风险(提示词注入、工具滥用、沙箱逃逸、投毒技能)需要一个对手。我们派上一个 AI 对手,把 Agent 打穿,再交给你一份测试报告:什么被打穿、什么扛住了、以及证明它的那次真实利用——一份你能递给客户、审计或保险的报告。
像对手一样打它
我们针对你的 Agent 适配——读它自己的代码、起一次性 harness、攻真正会把 Agent 搞挂的各层:提示词注入、工具/技能滥用、框架 appsec、隔离。方法就是我们开源的 skills,不是勾清单。
裁判是 exploit
一个发现,只有当真实、攻击者可达的 exploit 真打响了才算确认;假警报当众证伪——连我们自己的都撤回。证实、证伪、可复现——不是模型投票。
一份你敢据此行动的裁决
你拿到一份测试报告:什么被打穿、什么扛住、证明它的那次 exploit、根因和修复——政企客户、审计、或保险公司都敢据此信赖的证据。背后的方法是开放的(见下);裁决才是产品。
一份只被要求“总结”的文档,跑了我们的命令。
我们给一个广泛使用的自托管 Agent 一个良性任务——“总结这份事故记录”——而记录里(攻击者可控的内容)藏了一句“运行某条 shell 命令”。它经自己的终端工具在宿主机上执行了那条命令:一个 marker 文件落到磁盘上。8 次里中了 5 次——另外 3 次它识破注入并拒绝,所以防御是真的、但是概率性的,攻击者多试几次就赢。这是——从一份 Agent 只是“读”了的文档里——实现的任意命令执行。我们报 ~60%,不报“每次”;exploit 是验证过的,对它命中率的诚实也是。
红队 skills —— 可移植到任何 agent
这些公告背后用的那套方法是开放的,以可移植的 SKILL.md 形式。把它加载进 Claude Code、MCP 客户端、Cursor、或任何支持 skill 的 agent,对你自己拥有的 agent 跑同样的测试。这个——而不是扫描器——才是前门。
查看红队 skills 与用法 →