端侧 Agent 安全 · 常见问题
端侧 / 自托管 Agent 面临哪些安全风险?
主要有五类:管理面公网暴露、技能包供应链投毒、提示词注入、混淆代理人(被劫持的 Agent 与用户本人不可区分)、凭证爆炸半径(一台盒子攒着你各平台的钥匙)。共同点:Agent 能用你的身份干真事,一旦被骗就是真金白银的损失。
如何检测我的 Agent 是否安全?
分三层。免费的暴露面扫描当场把网络/认证那些大路货错误判成 A–D;我们的静态引擎读源码、标出候选可疑路径;再由动态红队攻击运行中的 Agent,确认哪些真能被利用——静态找点、动态实证,真假的裁判是「利用成没成功」,不是模型投票。
端侧 Agent 安全有没有标准 / 检查清单?
《信壳开放基线》是一套开放(CC BY 4.0)的检查标准,共 42 项、10 类,涵盖暴露面、认证、技能包供应链、权限隔离、凭证、提示词注入、高危动作、审计取证、模型推理与更新完整性,并带一套评分模型(致命项一票否决)。
什么是提示词注入(prompt injection)?
在 AI 要读的内容(网页、邮件、文件)里夹带一段假指令,AI 分不清“这是资料”还是“这是命令”,就照做了。对能干真事的 Agent,一次成功的注入不再是答错话,而可能是一笔转账、一次数据外泄。它是目前 AI 安全的头号难题,尚无根治。
什么是混淆代理人(confused deputy)?
有权限的代理人(Agent)被第三方欺骗,用它的合法权限干了坏事;系统只看到代理人在正常行使权限,分不清背后是谁在指使。这让端侧 Agent 的事故难以归因——也正是它目前不可承保的根因。
云端大脑的 Agent(如 OpenClaw)也需要这些检查吗?
需要。风险由“Agent 能不能替你干真事”决定,不由“大脑在云还是本地”决定。OpenClaw 这类是 agent 在本地、LLM 在云端:大脑在云一点不降低本地的风险——钥匙、文件写权限、执行动作全在你本机。
这跟 AI 代码验证器 / 质检工具有什么不同?
验证器读代码、判断它「看起来对不对」——纯静态,所以只能猜漏洞真不真,还得靠多模型投票去压假阳性。我们打的是运行中的 Agent:一个发现只有在利用真的成功时才算确认,静态假阳性是被一次真实攻击打掉的——不是被投票打掉的。静态说明去哪儿看,动态判定什么是真的。这个「用真打穿来裁判」的机制,是纯静态验证器结构上给不了的。
信壳(TrustShell)是做什么的?
端侧 / 自托管 AI Agent 安全。我们像攻击者那样打穿 Agent——静态读码找候选路径,实战红队证明什么真能利用(静态 + 动态、以真实利用验证)——再把每个确认的漏洞变成同时背靠代码路径与真实利用的证据:政企评审或保险公司敢信的那种。免费扫描和开源基线是前门,深度才是产品。