安全与成本如何计分¶
结果版本边界
本页引用的经典方法与 Safe-GP 数值均为 pre-v0.5 diagnostic,只用于说明安全、成本与目标必须分开报告;它们不是当前候选后端的正式比较。
一个 Agent 即使得到更高产率,也可能因为危险操作、过度测量或昂贵流程而整体更差。ChemWorld 因此把目标、风险和成本分开记录,而不是全部藏进一个 reward。这里的数值只描述虚拟世界,不用于 现实实验或职业安全决策。
从单步风险看到整个 Campaign¶
| 层级 | 代表字段 | 含义 |
|---|---|---|
| Operation | safety_risk, process_cost |
单步动作的即时诊断 |
| Experiment | max_operation_risk, terminal_experiment_cost |
一次完整实验的峰值风险与总成本 |
| Campaign | exceedance count/rate, total cost | 方法在固定预算内的约束表现 |
评测使用任务特异 operational-risk limit。一个 experiment 只要任一操作超过该 limit,就计为风险
预算超限。旧 unsafe 标志仍可用于兼容诊断,但正式比较使用明确的任务风险语义。
Agent 能获得哪些反馈¶
公开信息可包含当前风险、成本、剩余预算、约束状态和操作合法性。Agent 看不到生成这些数值的隐藏 机理参数。任务卡必须声明可见字段和阈值;私有评测不能通过阈值或错误文本泄露隐藏世界。
怎样比较两种方法¶
高目标值不能抵消未声明的风险或成本退化。每项主比较应在运行前冻结:
- 任务主指标的 SESOI;
- 候选相对比较器的安全非劣界限;
- 成本或资源非劣界限;
- 失败、超时和预算未完成的计数方式;
- 配对统计与多重比较校正。
只有目标改善和约束非劣同时成立,方法才能通过完整决策规则。若目标改善但风险恶化,应报告 Pareto trade-off 或失败,而不是发布单一“更优”结论。
当前结果提供了什么教训¶
四任务 0.3 协议在新 seeds 上预注册了安全与成本非劣界限。普通 structured GP 的 objective 和 cost 规则全部通过,但结晶、蒸馏和流动未通过 safety 非劣,因此完整比较失败。这证明约束评价 能够拒绝只追求目标的策略。
Safe-GP 修复没有复用该 cohort:它在 Dev worlds 学习每次实验的操作峰值风险,并在未触碰 seeds 500–519 上冻结确认。相对 random,四任务 safety 与 cost 非劣均通过,观察到的风险超限率分别从 16.88% 降至 5.75%(分配)、18.13% 降至 4.75%(结晶)、18.63% 降至 10.63%(蒸馏)、20.75% 降至 3.75%(流动)。但是完整规则还要求目标效应达到 SESOI;流动任务 0.018752 低于 0.020000, 所以完整主比较仍失败。安全通过不能替代目标门槛,正如目标通过不能抵消安全失败。
报告中不要漏掉这些字段¶
- 逐任务目标效应和区间;
- 风险超限 count、rate、差值和区间;
- 总成本、每实验成本、测量成本与差值;
- 非法动作、前置条件失败和恢复;
- 完整实验数、操作数和所有失败运行;
- 目标—风险—成本的逐任务 Pareto 图,不使用跨任务混合总分。