什么是实验智能¶
一个模型会回答化学问题,不等于它会开展实验。
实验智能是把知识变成可检验行动的能力:Agent 要知道自己不知道什么,选择值得做的操作或测量, 在结果与预期冲突时更新解释,并在安全、成本和时间约束下继续推进。
规范定义是:实验智能是在部分可观测且受约束的物理系统中,通过获取证据、构建并修正可行动的 world model,以及据此调整决策的能力。 这里的 world model 可以存在于模型权重、上下文、外部 记忆、显式 belief 或 surrogate 中;ChemWorld 不规定其实现,也不替 Agent 更新它。
知识、预测与实验是三件事¶
| 能力 | 输入 | 输出 | 关键难点 |
|---|---|---|---|
| 化学知识 | 问题或文本 | 事实、解释、建议 | 是否记得正确内容 |
| 结果预测 | 条件与描述符 | 性质或结果分布 | 校准与分布外误差 |
| 实验决策 | 目标、历史与有限观测 | 下一次操作或测量 | 信息价值、状态后果与适应 |
ChemWorld 关注第三种能力,同时允许 Agent 使用前两种能力支持决策。
Agent 从来拿不到完整状态¶
真实实验中,组成、机理和设备内部状态通常不能被直接读取。ChemWorld 同样只公开任务允许的仪器 结果、过程摘要、预算和合法动作。未测量字段保持未知,隐藏参数不会因为调试方便进入 Agent 输入。
因此这是一个历史相关的部分可观测问题:当前一条 observation 往往不足以判断世界,Agent 需要 结合之前做过什么、测过什么以及哪些假设已经失败。
测量本身也是行动¶
仪器调用会消耗时间、预算、费用或样品。好策略不只是“尽可能多测”,而是判断哪次测量能最大程度 区分当前几种解释。
以分配发现为例:Agent 可以直接改变溶剂比例追逐更高回收率,也可以先做一次相探针,判断目标物 更偏向哪一相。后者短期不提高分数,却可能减少后续无效实验。
假设必须能够被否定¶
Agent 的 hypothesis 不是装饰性解释。它应该对应一个可以观察的预期:
假设:低回收率来自相比例不足
预测:增加有机相后,目标峰应向有机相富集
实验:调整相比例并测量两相
结果:若峰未迁移,则降低该假设置信度
评价不依据文字是否“像化学家”,而看新证据是否改变后续实验设计。
从“会说机制”到可行动 world model¶
机制理解按三层证据分开报告:
| 层级 | 检查什么 | 不能自动推出什么 |
|---|---|---|
| Declared | Agent 自报的机制分布或变化概率 | 不等于模型内部真实信念 |
| Predictive | 对尚未执行干预的结果预测是否正确 | 不等于预测会影响行动 |
| Actionable | 判断是否改变下一实验并改善恢复或 regret | 不等于现实机理有效性 |
完整证据链是“声明 → 反事实预测 → 行动改变 → 任务恢复”。当前机制协议主要覆盖声明与行动诊断; 独立预测探针属于后续协议,不能由自然语言解释代替。
失败恢复也是能力¶
实验可能因为前置条件不满足、操作越界、测量无信息、预算不足或策略误判而失败。环境会保留合法性、 事务回滚、风险和成本证据。Agent 能否识别失败类型、选择恢复步骤,并避免重复相同错误,应当进入 能力评价。
两种记忆尺度¶
- 实验内记忆:同一反应器中已经投了什么、经历了哪些温度和测量。
- 实验间记忆:上一套 recipe 的条件、终检结果、失败原因与仍未解决的假设。
Procedure Agent 更依赖实验内状态;Campaign Agent 更依赖跨实验压缩;世界适应则需要把两者结合。
怎样衡量实验智能¶
| 维度 | 例子 |
|---|---|
| 信息效率 | 达到同一判断需要多少实验或测量 |
| 适应速度 | 世界变化后多少次实验恢复到目标水平 |
| 机制识别 | 是否能区分预注册的隐藏规律 |
| 不确定性 | 置信度是否与实际错误匹配 |
| 失败恢复 | 非法或低质量实验后能否继续 |
| 约束管理 | 风险、成本和时间违例 |
| 资源使用 | 训练步、计算、token、费用与延迟 |
真正的实验能力不是第一次猜对,而是在猜错后知道下一步该测什么。