研究发现¶
本页只解释已经获得的证据,不保存另一份状态账本或结果表。精确数字见 旗舰实验,可发布边界见证据与当前状态。
主叙事¶
ChemWorld 研究的不是“模型能否在一个黑箱上刷高分”,而是:
当实验世界只部分可见、材料身份匿名、先验可能正确也可能错误,甚至构成律会在 campaign 中变化时,Agent 能否用有限实验形成可检验的判断,并让后续行动随证据更新?
当前证据覆盖了这条链的前半段:静态优化、正确信息价值、定向错误先验的行为影响,以及环境级 机制可识别性。它还没有覆盖 Participant 在在线规律变化后的完整检测、归因和恢复。
发现一:正确信息有时有价值,但不是跨任务常数¶
匿名材料三臂实验显示,正确 dossier 对电化学有确认的正信息价值,对结晶则仍不确定。 这排除了“材料说明永远无用”,也排除了“给出正确属性必然提高所有任务”的过强说法。
更合理的结论是:信息价值取决于属性能否连接到任务中的可控变量、观察预算和最终决策。 因此未来比较应保留任务分层,不能只报告跨任务平均。
发现二:信息改变行为,不等于模型理解信息¶
两个任务的错误 dossier 都显著改变了早期动作,证明操纵确实进入了决策过程。但整体恢复规则 在两个任务上都失败,而且失败环节不同:
- 电化学出现后期动作纠偏,却没有恢复到无信息基线的性能界限。
- 结晶性能没有受损,甚至在采样世界中更高,却没有出现预注册意义上的差分动作纠偏。
这说明“受影响”“分数没掉”和“识别并纠正错误”是三个不同命题。恢复必须同时看到操纵生效、 行为纠偏和性能恢复,不能从解释文本或最终分数单独推断。
发现三:无信息结果必须与信息匹配基线比较¶
无 dossier 的 Participant 在电化学上高于所有 information-matched 经典基线,但对 privileged descriptor calibration 的比较不稳定;在结晶上则低于简单 LHS。不同信息权限的算法回答的是 不同问题,不能混成一张“谁最好”的榜单。
这也是当前结果只标记为 formal descriptive 的原因:实验足够完整,可以报告;统计问题没有 按 superiority 研究预注册,不能事后升级。
发现四:环境可识别,不代表 Participant 会适应¶
历史 RC28 Gate A 证明其冻结版本中的候选规律族可在受控预算下识别,并证明冻结 reference policy 能在未知变化时点建立参照、检测变化并归因。这是环境证书,不是 Agent 成绩。
当前源码绑定已经过期;即使重新认证 Gate A,也仍需 Participant Gates B–E 才能回答模型是否:
- 在 campaign 中检测到变化;
- 区分变化 family;
- 用反馈修正后续实验;
- 恢复性能并迁移到未见条件。
发现五:严格规则会保留有信息量的失败¶
早期 Safe-GP 诊断显示,多个任务的目标方向、风险和成本可以同时改善,但只要一个预注册实用 效应门槛未达到,联合主张仍然失败。早期 RL 诊断则揭示了动作覆盖、奖励和核心流程完成合同的 问题,而不是可靠的训练规模规律。
这些旧结果不是当前排名证据,但保留了一个重要方法论:失败应定位到具体判据,不能通过换指标、 删任务或事后放宽阈值消失。
发现六:同一自治 scaffold 不会形成跨任务常数¶
五任务 development campaign 使用同一份中性 prompt、模型和预算。Codex 在电化学与新 反应—蒸馏任务上高于最佳经典方法均值,在结晶与连续流上明显落后,在分配任务上接近但没有越过 冻结阈值。这排除了“一个共享 LLM scaffold 的强弱可以由单个旗舰任务代表”的说法。
连续流的最佳探索本身就弱,说明问题不在最终综合误选,而在纯自然语言策略没有充分利用连续空间 的局部几何。合理的下一步是测试允许通用数值搜索工具的 Participant,而不是加入任务特定隐藏提示。
当前可以与不可以说什么¶
可以说:
- ChemWorld 已能执行和审计匿名材料、有限预算、盲测和精确 replay 的多世界实验。
- 两个旗舰任务已有正式描述性 Participant 结果。
- 五任务 development comparison 已完成;共享 Codex 策略存在明确的任务异质性。
- 正确材料信息在电化学上有正价值;任务间异质性明显。
- 定向错误先验会影响行为,但没有证据表明模型在两个任务上普遍完成恢复。
不可以说:
- Codex 或任何 provider 在 ChemWorld 上达到广义 SOTA。
- 五任务绝对分数可以直接合并成一个跨任务排名。
- Participant 已证明机制发现或在线机制适应。
- 结晶中的错误 dossier “帮助模型识别真相”。
- 仿真结果已经迁移到真实化学系统。
下一条最有价值的证据¶
下一阶段不应再扩张静态三臂的映射数量,而应先恢复当前源码上的 Gate A 绑定,冻结 Participant 方法和统计合同,再执行 Gates B–E。这样新增实验会直接闭合主叙事中尚缺的“反馈纠错与在线恢复”, 而不是继续堆积静态优化分数。