我在建什么
实验室
我的工作沿两条长期主线展开。一条是把东西造出来,一条是证明它何时可信 —— 后者是把前者做扎实的方法。项目会来会走;这两条河不会。可公开的项目可点开在线 Demo 或公开仓库;早期原型只保留高层说明。
想看完整的项目分组? 全部项目 →
01 — 主线
6 AI 辅助分子发现
朝着一个可信、可复现、能对分子性质做推理的系统 —— 从 agentic 化学工作流,到基础模型 benchmark,再到氧化还原 / 电池相关候选分子。
● 在线 Demo
ChemGraph Loop
一个可以现场跑的真实 agentic 化学工作流
用大白话问一个小分子问题,看真实 ChemGraph agent 识别分子、跑仿真、画 3D 结构,并对照工作流护栏审计结果。
试用 Demo ↗
● 在线 Demo MIST 迁移学习 Benchmark
比较结构机器学习与微调分子基础模型
输入 SMILES,同时比较固定 Ridge、XGBoost、MLP 和 fine-tuned MIST-28M 对 QM9 DFT 性质标签的预测。
试用 Demo ↗
● 在线 Demo 液流电池氧化还原电位预测器
在预测前先确认分子身份的公开氧化还原电位 Demo
输入 SMILES 或化学名称,先检查 PubChem 支持的名称选项与可编辑 RDKit 结构,确认后才由固定 Random Forest 在 RedDB DFT 尺度上预测。
试用 Demo ↗
● 在线 Demo 分子发现工作流
解析身份、检查结构,再明确展示证据缺口
一个私有分子发现原型的公开受限版本:PubChem 身份解析、人工结构确认、RDKit 描述符,以及明确的证据缺口,而不是编造性质数值。
试用 Demo ↗
● 早期独立原型
● 公开仓库 Property-Aware Molecular Discovery Agent
正向/反向分子发现内核
一个 Python-first 的早期内核,围绕正向与反向工作流组织 —— 分子→性质档案、目标性质→候选发现 —— 架构围绕 Query Planner、Skill Registry 与 Evidence Objects,而不是把 LLM 输出当作科学真理。
Scientific Foundation Model Lab
训练与理解科学基础模型
一个动手的实验室,用于训练和理解科学基础模型 —— 表示学习、性质预测,以及模型素养工具。
在 GitHub 查看 ↗
02 — 主线
5 可信、可评估的科学 AI
科学下面那一层:结果什么时候能信?评估 harness、诚实的局限边界、确定性可复现,以及人在环把关 —— 让上面那条发现之河可信的方法。
● 公开仓库
Scientific Agent Lab
科学 AI 的评估与可复现层
不是科学助手,而是它下面那一层 —— 回答“结果什么时候能信”的骨架。一个确定性、零依赖的管道:把证据和假设分开、标出缺失的必需数据、证据不全时拒绝下结论,并交出可复现、可被评估 harness 打分的轨迹。全程无 LLM。
在 GitHub 查看 ↗
● 在线 Demo 设备状态监测智能体
一个可以现场跑的确定性预测维护管道
在 NASA 公开涡扇发动机数据上跑 10 阶段剩余寿命分析,带人工决策把关、带证据的决策卡和带引用的诊断。
试用 Demo ↗
● 在线 Demo 电池早期预警回放
回放 228 个实测电芯,检验 EIS 能否改善未来三次检查的预测
回放由 Luh 与 Blank 的 KIT v2 结果数据转换而来的派生数据,对比加入 EIS 前后的配对 development OOF 预测,并在三次检查后打开实测答案。结果随老化方式和模型而变,不是生产报警。
试用 Demo ↗
● 在线 Demo 预防健康模型实验室
一个能从头看到尾的 QLoRA 微调研究
在同一个预防健康任务、同一批合成数据和同一评估 harness 上,对比 Gemma 3 与 MedGemma 的受控 QLoRA 研究。
试用 Demo ↗
● 在线 Demo 指南忠实度聊天
如实复述临床指南立场,并保住每一份的官方推荐力度
问一个膝关节炎的问题,答案如实复述 NICE NG226 和 ACR/AF 怎么说,并回读原文让推荐力度保持忠实,而不是糊成一句笃定的话。指南忠实度的研究 demo——非医疗建议。
试用 Demo ↗