会改变规律的世界¶
ChemWorld 的核心不是“很多任务”,而是同一公共任务背后可以存在不同、可审计、可干预的世界规律。
如果一个 Agent 只在固定参数上拿到高分,我们无法判断它学会了实验,还是记住了一个模拟器。通过 改变隐藏速率律、网络拓扑、构成律或设备边界,ChemWorld 把“规律变化后的识别与恢复”变成实验。
World、Task 与 Scenario 不一样¶
| 概念 | 回答的问题 | 例子 |
|---|---|---|
| World | 这个宇宙遵守什么规律 | 速率律、相行为、设备模型与仪器映射 |
| Task | Agent 要解决什么问题 | 提高转化率、学习分配规律、完成结晶流程 |
| Scenario | 这一次实例从哪里开始 | 初态、公开条件、隐藏参数和噪声实现 |
| Seed | 怎样确定性重建这次实例 | 随机流与场景采样索引 |
同一个 Task 可以运行在多个 World family 上;同一个 World 也可以生成许多 Scenario。
为什么只换 Seed 不够¶
Seed 通常改变初值、噪声或连续参数抽样,却可能保留同一因果结构。方法在多个 seeds 上稳定,只能 说明它对实例随机性稳健,不能证明它会适应新速率律或新反应通道。
因此 ChemWorld 区分:
- 参数变化:速率、组成、噪声和设备参数的插值或外推;
- 机制变化:速率律、网络拓扑、构成律或控制边界发生变化;
- 独立后端变化:同一合同由另一实现或数据源执行;
- 现实 Bridge:进入真实数据或物理系统的窄域适应。
公共语义保持不变¶
世界变化时,任务目标、Action schema 和允许披露的仪器语义保持一致。Agent 不会得到“世界 B”标签, 也不能读取隐藏机制。它需要从实验后果判断:旧模型是否仍然成立,下一次测量能否区分新的解释。
一个最小流动例子¶
| 公开条件 | 世界 A | 世界 B | 世界 C |
|---|---|---|---|
| 提高温度 | 主反应明显加速 | 副反应增长更快 | 传热限制成为主导 |
| 可用操作 | 相同 | 相同 | 相同 |
| 可见仪器 | 相同 | 相同 | 相同 |
| 需要的策略 | 追求更高温度 | 控制选择性 | 先识别设备边界 |
只有选择诊断测量并更新模型的 Agent,才有机会区分三种情况。固定 recipe 的平均高分不能替代这个 适应过程。
Train、Dev 与 Bench 按世界族划分¶
- Train:允许学习策略与世界表示;
- Dev:用于选择模型、checkpoint 和超参数;
- Bench:冻结方法后一次评测,不继续更新;
- Private / Bridge:由评测端持有隐藏世界或独立系统。
机理 cells 应在不同 split 间不重叠。已经查看并用于调参的世界不能重新称为未见确认数据。
变化需要“可辨识但不灾难”¶
干预太弱,Agent 无法通过合理实验发现;干预太强,任务会变成世界标签识别或不可解。当前六个研究 任务已建立实际 Provider 消费的机理或构成律族;低层控制审计在 5 个世界、5 个固定探针 recipe 上检查 9 个任务—模式组合,验证确定性、局部响应分离、响应不过强和过程守恒。
世界控制证据本身不证明候选 family 在给定预算内可识别,也不代表 Agent 已经学会适应。历史 Gate A 曾在其冻结源码上认证受控可识别性和 reference policy 的在线可达性;当前绑定已经过期。 后续仍需重新认证环境,并用独立冻结的 Participant Gates B–E 测量 Agent 自身的 change detection、 feedback use、recovery 与 autonomy。精确状态见证据与当前状态。
反事实世界可以检验名称先验¶
未来的严格消融可以保持材料标签与接口不变,同时改变其隐藏作用,检查 Agent 是否依赖名称先验而 非实验。当前已具备类别编码、语义重映射与隐藏机理合同,但反事实名称—规律矩阵仍应作为独立协议 冻结后运行,不能提前写成完成结果。
下一步:旗舰世界与任务 · Benchmark 设计