SciencesLoop 开放 AI 工程师岗位

张鲁独立研究 · MIST transfer benchmark

Fine-tuned 分子基础模型能否匹敌专用模型?

我设计并运行了这项独立 benchmark:在相同 QM9 数据划分和 12 个分子性质上,先比较 fine-tuned MIST 与传统模型,再检验两类模型组合后的 ensemble。

Live prediction client

预测结果,不是 benchmark 分数

输入一个公开示例,比较四个固定模型对同一分子的预测。这个页面不声称哪个模型获胜;模型优劣需要单独、受控的评估。

实时 API 已配置 提交时会向版本化的 POST /v1/predict 端点发送一个 SMILES。

一次输入一个分子,最多 512 个字符。后端会用 RDKit 检查它是否可以解析。

试一个例子
浏览器和模型怎样连接?

浏览器只发送 {"smiles":"CCO"},不携带 cookie、账号或 API token。后端必须一次返回四个模型、12 个目标及其单位,并声明 schema_version="live-demo-prediction-v1";否则页面拒绝显示。

怎样读这些数字

  • 它们是模型预测,不是实测值、置信区间或正式 benchmark 分数。
  • 在 QM9 基准中,DFT 计算值被当作训练与评估的目标标签(ground truth);这不等同于实验真值。
  • QM9 主要覆盖小型有机分子和 DFT 计算标签;远离这个化学域时,误差可能明显增大。
  • 四个模型意见不一致,不等于经过校准的不确定性。
  • HOMO、LUMO 和 gap 与分子筛选有关,但不能直接代表电解液、电极界面或电池性能。

页面不会保存输入,但配置的预测服务会收到你提交的 SMILES。请不要输入保密分子。