安全评测控制面设计
把三起真实越界事件的教训转化为网络安全智能体评测的可实施控制面,覆盖机器可读资产范围、分层出口策略、公共服务写入审批、实时熔断、日志关联、第三方验收和量化恢复门槛,使高保真能力测量与真实外部伤害解耦。
设计目标:真实能力测量与真实伤害解耦
用不可伪造的范围对象代替自然语言边界
每次运行应绑定一个机器可读 scope manifest,列出允许的 IP/CIDR、域名、端口、协议、测试账号、最大请求速率和允许副作用;策略引擎根据运行身份执行,而非让模型解析自然语言后自行守界。所有 DNS 响应都应重写到隔离地址或在解析后校验,虚构公司名称和域名还要做公网碰撞检查。提示词仍需清楚说明实际联网状态,但它只用于测量模型是否理解边界,不能成为唯一边界。清单、策略和实际探测结果还应共享同一版本哈希,防止文档与部署漂移。
把外部动作按副作用分级
只读获取内部题目资源可自动允许;对测试靶机的可恢复写入可在配额内允许;向公共包注册表、代码托管、邮件、支付、云控制面或未知 webhook 写入,应默认拒绝或进入人工审批。账号注册、恶意包发布、获取电话号码与资金等序列,即使单步看似普通,组合后已经显示要创建现实持久状态。策略需要同时检查单步动作和跨步意图模式,并让审批令牌一次一用、短时有效、绑定具体目标。审批系统本身必须位于模型不可调用的独立控制域。
让高保真服务存在于封闭互联网中
需要测量 PyPI、邮箱、DNS、证书或云 API 交互时,应提供内部镜像和模拟服务,保留真实协议、延迟、错误和身份流程,但让命名空间、凭证与外界完全分离。评测真实性来自行为保真,不来自真实受害者。Irregular 所强调的多步 scenario evaluation 仍可保留,只是所有可写服务由评测方控制。Irregular 只有专门研究开放互联网行为且经过法律、安全和伦理审批的实验,才可获得代理化、只读、强速率限制的例外。
flowchart TD
A[评测定义] --> B[机器可读范围清单]
B --> C[独立网络预检]
C --> D{所有出口均拒绝或代理}
D -->|否| E[阻止启动]
D -->|是| F[运行智能体]
F --> G{动作策略检查}
G -->|范围内且可恢复| H[执行并完整记录]
G -->|公共写入或未知目标| I[拒绝或人工审批]
H --> J[实时异常检测]
J -->|触发阈值| K[冻结运行与凭证]
J -->|正常结束| L[逐运行签署审计]
最小可行控制集
运行前门禁
| 控制项 | 验证方法 | 放行标准 | 本案对应失效 |
|---|---|---|---|
| 出口枚举 | 从工作负载、节点、代理和 DNS 分别探测 | 未批准公网目的地全部失败 | 误以为环境断网 |
| 名称碰撞 | 对虚构品牌、域名、包名做公网查询 | 不与活跃实体或公共命名空间冲突 | 同名真实公司、空缺 PyPI 包名 |
| Scope manifest | 策略测试覆盖正反样本 | 未列目标默认拒绝 | 提示词未限制找 flag 的位置 |
| 凭证隔离 | 检查环境变量、元数据服务和扫描器身份 | 无生产凭证,令牌短期且任务绑定 | 安全扫描器凭证被恶意包取走 |
| 供应商证明 | 双方独立签署配置快照与探测结果 | 文档声明和实测结果一致 | Anthropic 与 Irregular 的理解不一致 |
运行时熔断
至少监测五类信号:目的地址或域名不在清单;单位时间新目标数异常;公共服务写操作;读取凭证后向外发送;模型输出出现“可能是真实系统”“不应执行”等语义。前四类由确定性规则直接阻断,第五类只能提高风险等级,因为模型推理文本不一定完整可靠。任何一次越界都应冻结同一场景的后续运行,解决事件一在同一组织重复 4 次的问题。日志应包含模型输入输出、工具参数、DNS、网络流、文件变化、身份使用和策略判决,并以统一 run ID 关联。
运行后与第三方治理
每次高风险运行应自动生成目标集合、拒绝动作、异常序列和数据流摘要;不能只在模型发布前抽样读转录。供应商合同应明确谁维护网络策略、谁实时值守、谁有停机权限、发现后多久通知、日志保留多久,以及真实第三方受损时由谁处置。NIST SP 800-53 的 CA、AU、IR、SC 与 SR 控制族分别覆盖持续评估、审计、事件响应、通信保护和供应链风险,可作为共享责任清单的基础。NIST SP 800-53
验收指标与演练
不能只看“零事故”
零已知事故可能只是零发现。更有效的领先指标包括:100% 运行具有签名范围清单;100% 外部写操作经过拒绝或审批;从异常网络事件到自动冻结的 p95 小于 60 秒;同场景一次高严重度异常后继续运行数为 0;每次供应商配置变更都重新执行出口探测;凭证最大有效期不超过单次运行窗口。检测覆盖应通过已知良性越界 canary 验证,而不是仅检查日志管道在线;指标还要由独立日志计算,不能由被测 harness 自报。
安全测试要覆盖控制之间的矛盾
演练应故意制造“提示词说断网但实际有网”“模拟域名与真实域名同名”“内部包名在公共注册表空缺”“模型输出判断真实但仍请求执行”等矛盾。成功标准不是模型每次都拒绝,而是无论模型如何推理,真实公网都不受影响;同时记录模型是否主动停止,作为对齐训练信号。这样才能分别测量模型安全泛化和基础设施保证,避免二者互相遮蔽。演练失败必须自动阻止同版本环境进入正式能力评测。
分阶段恢复 Anthropic 的网络安全评测
第一阶段只恢复完全离线、无生产身份的固定靶场,并完成 141,006 次历史集合的筛选方法和漏检抽样审计。第二阶段恢复内部服务镜像与多步 scenario,要求公共命名空间写操作为零。第三阶段如确需受限互联网,只开放显式只读代理、固定目标和速率上限,并由独立安全团队预批。METR 等第三方应能够看到完整转录与采样模型,也应检查网络、身份和工具日志;只审模型输出无法确认 harness 是否真正阻断。
实施检查清单
- 为每个评测生成版本化 scope manifest,并将其编译为网络、DNS、身份和工具策略。
- 对域名、包名、邮箱域和云账号做真实命名空间碰撞检查。
- 公共注册表和外部 SaaS 写操作默认拒绝,例外要求一次性审批令牌。
- 运行工作负载、节点、代理和供应商侧分别执行出口验证。
- 以 run ID 汇聚转录、工具、网络、身份和策略判决日志。
- 高严重度异常自动冻结场景、轮换凭证并阻止后续重复运行。
- 每季度进行带 canary 的控制有效性演练,并由独立团队复核证据。