跳转至

会改变规律的世界

ChemWorld 的核心不是“很多任务”,而是同一公共任务背后可以存在不同、可审计、可干预的世界规律。

如果一个 Agent 只在固定参数上拿到高分,我们无法判断它学会了实验,还是记住了一个模拟器。通过 改变隐藏速率律、网络拓扑、构成律或设备边界,ChemWorld 把“规律变化后的识别与恢复”变成实验。

World、Task 与 Scenario 不一样

概念 回答的问题 例子
World 这个宇宙遵守什么规律 速率律、相行为、设备模型与仪器映射
Task Agent 要解决什么问题 提高转化率、学习分配规律、完成结晶流程
Scenario 这一次实例从哪里开始 初态、公开条件、隐藏参数和噪声实现
Seed 怎样确定性重建这次实例 随机流与场景采样索引

同一个 Task 可以运行在多个 World family 上;同一个 World 也可以生成许多 Scenario。

为什么只换 Seed 不够

Seed 通常改变初值、噪声或连续参数抽样,却可能保留同一因果结构。方法在多个 seeds 上稳定,只能 说明它对实例随机性稳健,不能证明它会适应新速率律或新反应通道。

因此 ChemWorld 区分:

  • 参数变化:速率、组成、噪声和设备参数的插值或外推;
  • 机制变化:速率律、网络拓扑、构成律或控制边界发生变化;
  • 独立后端变化:同一合同由另一实现或数据源执行;
  • 现实 Bridge:进入真实数据或物理系统的窄域适应。

公共语义保持不变

世界变化时,任务目标、Action schema 和允许披露的仪器语义保持一致。Agent 不会得到“世界 B”标签, 也不能读取隐藏机制。它需要从实验后果判断:旧模型是否仍然成立,下一次测量能否区分新的解释。

一个最小流动例子

公开条件 世界 A 世界 B 世界 C
提高温度 主反应明显加速 副反应增长更快 传热限制成为主导
可用操作 相同 相同 相同
可见仪器 相同 相同 相同
需要的策略 追求更高温度 控制选择性 先识别设备边界

只有选择诊断测量并更新模型的 Agent,才有机会区分三种情况。固定 recipe 的平均高分不能替代这个 适应过程。

Train、Dev 与 Bench 按世界族划分

  • Train:允许学习策略与世界表示;
  • Dev:用于选择模型、checkpoint 和超参数;
  • Bench:冻结方法后一次评测,不继续更新;
  • Private / Bridge:由评测端持有隐藏世界或独立系统。

机理 cells 应在不同 split 间不重叠。已经查看并用于调参的世界不能重新称为未见确认数据。

变化需要“可辨识但不灾难”

干预太弱,Agent 无法通过合理实验发现;干预太强,任务会变成世界标签识别或不可解。当前六个研究 任务已建立实际 Provider 消费的机理或构成律族;低层控制审计在 5 个世界、5 个固定探针 recipe 上检查 9 个任务—模式组合,验证确定性、局部响应分离、响应不过强和过程守恒。

世界控制证据本身不证明候选 family 在给定预算内可识别,也不代表 Agent 已经学会适应。历史 Gate A 曾在其冻结源码上认证受控可识别性和 reference policy 的在线可达性;当前绑定已经过期。 后续仍需重新认证环境,并用独立冻结的 Participant Gates B–E 测量 Agent 自身的 change detection、 feedback use、recovery 与 autonomy。精确状态见证据与当前状态

反事实世界可以检验名称先验

未来的严格消融可以保持材料标签与接口不变,同时改变其隐藏作用,检查 Agent 是否依赖名称先验而 非实验。当前已具备类别编码、语义重映射与隐藏机理合同,但反事实名称—规律矩阵仍应作为独立协议 冻结后运行,不能提前写成完成结果。

下一步:旗舰世界与任务 · Benchmark 设计