跳转至

安全与成本如何计分

结果版本边界

本页引用的经典方法与 Safe-GP 数值均为 pre-v0.5 diagnostic,只用于说明安全、成本与目标必须分开报告;它们不是当前候选后端的正式比较。

一个 Agent 即使得到更高产率,也可能因为危险操作、过度测量或昂贵流程而整体更差。ChemWorld 因此把目标、风险和成本分开记录,而不是全部藏进一个 reward。这里的数值只描述虚拟世界,不用于 现实实验或职业安全决策。

从单步风险看到整个 Campaign

层级 代表字段 含义
Operation safety_risk, process_cost 单步动作的即时诊断
Experiment max_operation_risk, terminal_experiment_cost 一次完整实验的峰值风险与总成本
Campaign exceedance count/rate, total cost 方法在固定预算内的约束表现

评测使用任务特异 operational-risk limit。一个 experiment 只要任一操作超过该 limit,就计为风险 预算超限。旧 unsafe 标志仍可用于兼容诊断,但正式比较使用明确的任务风险语义。

Agent 能获得哪些反馈

公开信息可包含当前风险、成本、剩余预算、约束状态和操作合法性。Agent 看不到生成这些数值的隐藏 机理参数。任务卡必须声明可见字段和阈值;私有评测不能通过阈值或错误文本泄露隐藏世界。

怎样比较两种方法

高目标值不能抵消未声明的风险或成本退化。每项主比较应在运行前冻结:

  1. 任务主指标的 SESOI;
  2. 候选相对比较器的安全非劣界限;
  3. 成本或资源非劣界限;
  4. 失败、超时和预算未完成的计数方式;
  5. 配对统计与多重比较校正。

只有目标改善和约束非劣同时成立,方法才能通过完整决策规则。若目标改善但风险恶化,应报告 Pareto trade-off 或失败,而不是发布单一“更优”结论。

当前结果提供了什么教训

四任务 0.3 协议在新 seeds 上预注册了安全与成本非劣界限。普通 structured GP 的 objective 和 cost 规则全部通过,但结晶、蒸馏和流动未通过 safety 非劣,因此完整比较失败。这证明约束评价 能够拒绝只追求目标的策略。

Safe-GP 修复没有复用该 cohort:它在 Dev worlds 学习每次实验的操作峰值风险,并在未触碰 seeds 500–519 上冻结确认。相对 random,四任务 safety 与 cost 非劣均通过,观察到的风险超限率分别从 16.88% 降至 5.75%(分配)、18.13% 降至 4.75%(结晶)、18.63% 降至 10.63%(蒸馏)、20.75% 降至 3.75%(流动)。但是完整规则还要求目标效应达到 SESOI;流动任务 0.018752 低于 0.020000, 所以完整主比较仍失败。安全通过不能替代目标门槛,正如目标通过不能抵消安全失败。

报告中不要漏掉这些字段

  • 逐任务目标效应和区间;
  • 风险超限 count、rate、差值和区间;
  • 总成本、每实验成本、测量成本与差值;
  • 非法动作、前置条件失败和恢复;
  • 完整实验数、操作数和所有失败运行;
  • 目标—风险—成本的逐任务 Pareto 图,不使用跨任务混合总分。