了解适用范围¶
ChemWorld Bench 适合研究预算受限、部分可观测的闭环实验决策。它回答“Agent 如何实验”, 不回答“现实反应一定会怎样”。材料、风险和结果都属于版本化虚拟世界,不能直接指导真实实验。
精确的完成状态只在证据与当前状态维护。
当前证据支持¶
- task、scenario、mechanism、observation、scoring 和 trajectory 使用版本化合同;
- Agent 只能通过公开操作、测量、成本、约束和历史与环境交互;
- 正式轨迹可以 digest 校验、确定性 replay 和指标重算;
- 15 个完整实验适配器和全部声明指标端点可执行;
- 两个旗舰任务已有正式描述性 Participant 多世界结果;
- 正确匿名材料信息的价值具有任务差异,定向错误先验会改变行为;
- 历史 RC28 Gate A 在其冻结源码上通过环境证书。
这些事实不自动升级为模型优越性、机制理解或外部有效性。
当前证据不支持¶
- 输出能够预测或指导真实反应、分离、谱图、装置或危险实验;
- 15 个任务都已有正式模型实验或排名;
- Codex 或其他 provider 达到广义 SOTA;
- 环境 Gate A 通过等于 Participant Gates B–E 通过;
- 错误先验影响动作等于模型识别并纠正错误;
- 公开世界结果证明私有世界、未见机理或现实系统泛化;
- 当前候选包是 submission-ready benchmark release。
模型精度边界¶
- 反应动力学是局部虚拟机制与速率律,不是数据库级反应预测;
- 物性、分配、设备和材料效应是版本化 benchmark 参数;
- HPLC、GC、UV–vis、IR、NMR、MS 和 final assay 是状态耦合的合成观测;
- 平衡、电化学、结晶、流动和蒸馏只在各模型卡声明的窄适用域内解释;
- cost/risk 是虚拟约束,不是采购报价、职业健康或法规指标;
reference_validated表示窄域参考检查,不表示专业模拟或现实验证。
方法比较边界¶
终点、风险、成本、样本效率、交互能力和方法资源分开报告。不同交互层级只能作系统级比较; 要归因于算法,必须共享信息、操作、预算和资源合同。
早于 v0.5 的 Safe-GP、SAC、PPO 和经典矩阵只作为开发诊断保存,不得进入当前排名。当前正式 Participant 结果可以按冻结范围报告,但不能事后升级为 provider 因果效应、广义 superiority 或样本外泛化。
机制与迁移边界¶
隐藏干预和精确 replay 证明环境能产生可审计的因果变化。它不证明给定动作、测量和预算足以让 任意 Agent 识别变化,也不证明策略可迁移到现实实验。
当前机制证据与源码绑定过期,需先重新认证环境,再通过 Participant Gates B–E 检验变化检测、 归因和恢复。现实桥接还需要独立 backend、真实数据、shadow-mode 实验和专业安全审查。
LLM 记录边界¶
正式 LLM 运行记录 provider、模型、请求参数、token、费用、重试、失败和信息披露条件。系统不请求 或保存私有逐字 chain-of-thought;结构化 evidence、hypothesis、uncertainty 和 rationale 可供审计, 但不能证明模型内部机理与文字解释一致。
安全与第三方代码¶
本地学生 harness 是有界消息与进程接口,不是针对恶意代码的操作系统沙箱。运行不可信提交仍需 低权限、无网络、只读资源并限制 CPU、内存、进程和墙钟。任何真实实验决策都必须由有资质人员和 机构安全流程独立审查。