为什么需要 ChemWorld¶
为什么科学智能体不能只依靠真实实验和静态数据训练?
因为实验能力来自交互经验,而真实化学实验很难提供足够安全、便宜、快速且可重复的失败。ChemWorld 的目标不是复制一个完美现实,而是先构造许多可控的因果世界,让“Agent 是否会做实验”成为可以 训练、比较和反驳的研究问题。
ChemWorld 通过统一的物理因果世界基座、实验交互运行时和任务与评测契约,将材料搜索、实验执行、 规律识别和动态适应组织为同一个实验智能问题。
Agent、训练器和模型权重位于这三层之外。ChemWorld 可以供外部方法训练,也可以评测固定权重模型, 但环境本身不更新 Agent 权重或维护其内部 world model。
实验交互的规模瓶颈¶
真实实验同时受制于样品、设备、时间、人员、安全和废物处理。即使有自动化平台,也很难像训练 语言模型或游戏 Agent 那样产生海量探索轨迹。更麻烦的是,昂贵实验往往鼓励保守复用已知流程, 反而减少了研究失败恢复和机制变化适应的机会。
静态数据集缓解了数据稀缺,却只记录已经发生的实验。它们可以测试性质预测、文本知识或条件生成, 但无法完整回答:
- 下一次实验应该做什么?
- 一次测量是否值得它的成本和耗样?
- 结果否定假设后,策略会不会改变?
- 世界规律变化时,方法多久能够恢复?
从“感知—行动”到“假设—实验—修正”¶
具身智能研究 Agent 如何在环境中感知和行动;实验智能还多了一层解释责任。Agent 不只要控制状态, 还要选择能够区分解释的实验,把新证据纳入世界模型,并在约束下决定何时停止。
观察证据 → 形成假设 → 设计实验 → 执行与测量 → 更新判断
↑ ↓
└──────────── 失败、成本与不确定性 ────────┘
为什么不追求一个“完美数字孪生”¶
任意化学体系的通用高保真模拟既不可得,也不适合作为唯一训练世界。一个再精细的模拟器仍可能让 Agent 学会它特有的捷径。ChemWorld 选择另一条路线:公开统一实验合同,系统地改变隐藏速率律、 网络拓扑、相行为或设备边界,再检查策略是否依靠实验识别变化。
这并不降低物理要求。一个有意义的虚拟世界仍需满足守恒、因果耦合、部分观测、适用域与回放合同; 只是 Core 的首要目标是决策有效性与因果有效性,不是任意现实体系的绝对数值预测。
一个具体研究问题¶
设想三个连续流世界,它们公开相同任务、流量控制和仪器:
- 世界 A 中,提高温度主要加速目标反应;
- 世界 B 中,提高温度更快地放大副反应;
- 世界 C 中,传热限制使设定温度不再代表物料真实经历。
固定 recipe 可能只在一个世界里高分。会实验的 Agent 应通过有信息价值的操作和测量判断当前规律, 再调整控制策略。ChemWorld 希望把这种识别与恢复过程变成可重放的研究对象。
系统层与产品面¶
内部系统模型固定为三层:
| 系统层 | 核心问题 |
|---|---|
| Physical Causal World Substrate | 什么隐藏物理世界可以存在、变化并产生结果 |
| Experimental Interaction Runtime | Agent 怎样通过实验、测量和生命周期动作与世界交互 |
| Task and Evaluation Contract | 要求完成什么、允许看什么、预算怎样计算、结果怎样评价 |
Engine、Bench、Lab 和 Bridge 是面向使用者的产品面,不再与上述系统层混称:
| 层 | 负责什么 | 当前定位 |
|---|---|---|
| ChemWorld Engine | 世界基座、实验运行时、仪器、因果干预与回放 | 可运行、持续验证 |
| ChemWorld Bench | 任务划分、资源合同、适应指标与私有评测 | 候选协议,正式证据未闭合 |
| ChemWorld Lab | Student Lab 与 Agent Observatory | 本地可用 |
| ChemWorld Bridge | 独立模型、真实数据与窄域物理系统连接 | 验证路线,尚非完成产品 |
核心研究问题¶
- 固定世界中的高分,能否预测规律变化后的适应?
- 哪类 Agent 最擅长选择测量、识别机理和从失败中恢复?
- 记忆、世界模型与因果消融如何改善信息效率?
- 虚拟预训练能否减少适应独立模型、真实数据和物理实验所需的实验数量?
范围
ChemWorld 不预测任意真实反应,不替代流程设计、安全审批或设备控制。它首先研究实验策略如何 学习与适应;现实有效性需要通过独立 Bridge 实验逐级建立。它面向选定物理化学原型追求实验交互 栈的结构完整性,化学覆盖和数值保真度均为有界、显式声明,而非穷尽。