跳转至

什么是实验智能

一个模型会回答化学问题,不等于它会开展实验。

实验智能是把知识变成可检验行动的能力:Agent 要知道自己不知道什么,选择值得做的操作或测量, 在结果与预期冲突时更新解释,并在安全、成本和时间约束下继续推进。

规范定义是:实验智能是在部分可观测且受约束的物理系统中,通过获取证据、构建并修正可行动的 world model,以及据此调整决策的能力。 这里的 world model 可以存在于模型权重、上下文、外部 记忆、显式 belief 或 surrogate 中;ChemWorld 不规定其实现,也不替 Agent 更新它。

知识、预测与实验是三件事

能力 输入 输出 关键难点
化学知识 问题或文本 事实、解释、建议 是否记得正确内容
结果预测 条件与描述符 性质或结果分布 校准与分布外误差
实验决策 目标、历史与有限观测 下一次操作或测量 信息价值、状态后果与适应

ChemWorld 关注第三种能力,同时允许 Agent 使用前两种能力支持决策。

Agent 从来拿不到完整状态

真实实验中,组成、机理和设备内部状态通常不能被直接读取。ChemWorld 同样只公开任务允许的仪器 结果、过程摘要、预算和合法动作。未测量字段保持未知,隐藏参数不会因为调试方便进入 Agent 输入。

因此这是一个历史相关的部分可观测问题:当前一条 observation 往往不足以判断世界,Agent 需要 结合之前做过什么、测过什么以及哪些假设已经失败。

测量本身也是行动

仪器调用会消耗时间、预算、费用或样品。好策略不只是“尽可能多测”,而是判断哪次测量能最大程度 区分当前几种解释。

以分配发现为例:Agent 可以直接改变溶剂比例追逐更高回收率,也可以先做一次相探针,判断目标物 更偏向哪一相。后者短期不提高分数,却可能减少后续无效实验。

假设必须能够被否定

Agent 的 hypothesis 不是装饰性解释。它应该对应一个可以观察的预期:

假设:低回收率来自相比例不足
预测:增加有机相后,目标峰应向有机相富集
实验:调整相比例并测量两相
结果:若峰未迁移,则降低该假设置信度

评价不依据文字是否“像化学家”,而看新证据是否改变后续实验设计。

从“会说机制”到可行动 world model

机制理解按三层证据分开报告:

层级 检查什么 不能自动推出什么
Declared Agent 自报的机制分布或变化概率 不等于模型内部真实信念
Predictive 对尚未执行干预的结果预测是否正确 不等于预测会影响行动
Actionable 判断是否改变下一实验并改善恢复或 regret 不等于现实机理有效性

完整证据链是“声明 → 反事实预测 → 行动改变 → 任务恢复”。当前机制协议主要覆盖声明与行动诊断; 独立预测探针属于后续协议,不能由自然语言解释代替。

失败恢复也是能力

实验可能因为前置条件不满足、操作越界、测量无信息、预算不足或策略误判而失败。环境会保留合法性、 事务回滚、风险和成本证据。Agent 能否识别失败类型、选择恢复步骤,并避免重复相同错误,应当进入 能力评价。

两种记忆尺度

  • 实验内记忆:同一反应器中已经投了什么、经历了哪些温度和测量。
  • 实验间记忆:上一套 recipe 的条件、终检结果、失败原因与仍未解决的假设。

Procedure Agent 更依赖实验内状态;Campaign Agent 更依赖跨实验压缩;世界适应则需要把两者结合。

怎样衡量实验智能

维度 例子
信息效率 达到同一判断需要多少实验或测量
适应速度 世界变化后多少次实验恢复到目标水平
机制识别 是否能区分预注册的隐藏规律
不确定性 置信度是否与实际错误匹配
失败恢复 非法或低质量实验后能否继续
约束管理 风险、成本和时间违例
资源使用 训练步、计算、token、费用与延迟

真正的实验能力不是第一次猜对,而是在猜错后知道下一步该测什么。

下一步:一次闭环实验 · 选择交互层级