张鲁独立研究 · MIST transfer benchmark
Fine-tuned 分子基础模型能否匹敌专用模型?
我设计并运行了这项独立 benchmark:在相同 QM9 数据划分和 12 个分子性质上,先比较 fine-tuned MIST 与传统模型,再检验两类模型组合后的 ensemble。
Live prediction client
预测结果,不是 benchmark 分数
输入一个公开示例,比较四个固定模型对同一分子的预测。这个页面不声称哪个模型获胜;模型优劣需要单独、受控的评估。
实时 API 已配置 提交时会向版本化的 POST /v1/predict 端点发送一个 SMILES。
浏览器和模型怎样连接?
浏览器只发送 {"smiles":"CCO"},不携带 cookie、账号或 API token。后端必须一次返回四个模型、12 个目标及其单位,并声明 schema_version="live-demo-prediction-v1";否则页面拒绝显示。
模型原生单位输出
对比分子 —
| 性质 | 单位 | Ridge | XGBoost | MLP | MIST-28M |
|---|
怎样读这些数字
- 它们是模型预测,不是实测值、置信区间或正式 benchmark 分数。
- 在 QM9 基准中,DFT 计算值被当作训练与评估的目标标签(ground truth);这不等同于实验真值。
- QM9 主要覆盖小型有机分子和 DFT 计算标签;远离这个化学域时,误差可能明显增大。
- 四个模型意见不一致,不等于经过校准的不确定性。
- HOMO、LUMO 和 gap 与分子筛选有关,但不能直接代表电解液、电极界面或电池性能。
页面不会保存输入,但配置的预测服务会收到你提交的 SMILES。请不要输入保密分子。