当一个新的科学应用需求出现时,最难的问题往往是:如何快速构建一套真正围绕这个需求的评测。
例如,你想评估大模型在“周环反应”上的能力,现成benchmark要么粒度过粗,要么根本没有覆盖;逐题人工编写又很难跟上科学应用不断扩展的速度。
这正是SciCustom试图解决的问题:把科学应用拆解为可复用的知识单元组合,并基于真实科学语料自动生成面向新需求的定制化benchmark。
近日,北京中关村学院联合北京大学、华盛顿大学等多家机构,提出了SciCustom,一个面向大模型科学能力的定制化评测框架。给定任意一个科学应用需求(如“周环反应”、“病毒学”),SciCustom可以通过知识单元组合自动构建对应benchmark,无需专家标注。该工作已被自然语言处理顶级会议ACL 2026正式接收为主会论文。
论文标题: SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
论文地址: https://arxiv.org/abs/2605.19357
代码开源: https://github.com/yjwtheonly/SciCustom

▲ 图1:(a)传统off-the-shelf benchmarking与SciCustom本体驱动框架的对比。(b)通用科学benchmark GPQA Diamond与“技术化学”专家评测的排名几乎无关,说明现成benchmark难以直接代表细分科学任务。(c)SciCustom构建的benchmark能更好复现专家评测中的模型排序。
为什么需要SciCustom?
随着大模型在科学研究中的应用日益广泛,从辅助药物发现到预测材料性质、从临床决策到基因分析,一个核心问题摆在每位科学家面前:“对于我的具体科学任务,哪个大模型最好用?”
直觉做法是查现有benchmark。但现实是:
- 通用benchmark(MMLU、GPQA、SimpleQA) 评测的是广泛的推理与知识覆盖能力,无法反映细分任务上的真实表现;
- 领域benchmark(ChemBench、MedQA) 虽然更聚焦,但粒度仍然过粗。MedQA在“人类衰老”任务上与专家排名较吻合,但在“解剖学”上却完全失效;
- 人工为每个新需求定制benchmark? 科学应用的版图在快速演变,人工策划根本跟不上。
结论很清楚:新的科学评测需求需要可自动生成、可复用的定制化评测。SciCustom要做的,就是用知识单元组合把这种评测生成过程规模化。
核心思想:用知识单元的组合来逼近科学应用
SciCustom的关键洞察是:一个复杂的科学应用,可以被近似分解为一组细粒度、可复用的“知识单元”的组合,这些知识单元锚定在已建立的科学本体上。
这一思想自然带来三个关键性质:
可复用性。 同一个知识单元可以服务于多个应用。“药理学”同时是药物发现和临床决策的基石,框架无需对每个新需求从零构建。
可组合性。 复杂需求被分解为多个知识单元的组合。例如,“周环反应”被分解为“环化反应”+“芳香烃”+“环状化合物”+……这种组合方式天然支持跨学科、交叉领域的评测需求。
数据真实性。 每个知识单元由来自真实科学语料的问答对填充,而非大模型合成。我们的实验表明,完全合成的benchmark(GPT-5直接生成题目)很难预测模型的真实科学能力。
框架如何运作?
SciCustom分为离线和在线两个阶段。

▲ 图2:SciCustom框架总览。离线阶段(左):从科学本体中选取知识单元,训练Tagger将大规模语料索引到知识单元中。在线阶段(右):给定用户需求,通过多模型投票、二分搜索、代理子集选择和选择题生成,全自动构建定制化benchmark。
离线阶段:一次构建,反复复用
第一步:构建知识单元。我们整合了OBO、BioPortal、OLS三大权威科学本体仓库,覆盖227个科学子学科,以有向无环图形式组织。通过深度优先遍历,利用大模型将每个概念节点分类为“粗粒度/适中/细粒度”。适中的节点(大致对应“教科书章节标题”的层级)被选为知识单元。最终获得642个知识单元,覆盖从有机化学到病毒学的科学知识空间。
第二步:训练科学Tagger。为了将大规模科学语料(200万+条问答对)映射到知识单元,我们训练了一个基于LLaMA-3-8B的本地Tagger。训练数据的构建充分利用了本体的层次结构:先采样若干知识单元,提取其后代关键词,再由大模型组合这些关键词生成查询,以此训练由查询到知识单元的Tagger。

▲ 图3:Tagger训练数据构建流程。采样知识单元(绿色圆圈),提取后代关键词(蓝色方块),由LLM组合生成标注好的训练查询。例如,采样“有机化学”和“精神疾病”,提取“醇类”和“睡眠障碍”等关键词,生成“醇类如何导致睡眠障碍?”这样的跨领域查询。
最终Tagger的Macro F1达到75.2%,Micro F1达到78.6%。这两步只需执行一次。之后,不同用户的不同评测需求,都可以复用同一套知识单元和索引好的语料。
在线阶段:从需求到Benchmark的全自动流水线
当用户提交一个评测需求(如“周环反应”),在线阶段分四步执行:
① 多模型投票选取知识单元。 GPT-5、Claude-opus-4.5、Gemini-3-pro三个异构大模型独立对知识单元按相关性排序,通过平均排名聚合选出Top-K个最相关的知识单元。
② 二分搜索过滤数据。 将候选数据按匹配知识单元数量和平均排名排序后,利用二分搜索高效定位相关性截断点,将LLM验证调用从O(n)降至O(log n)。
③ 代理子集选择。 过滤后的数据集可能超过20万条。我们在RoBERTa嵌入空间中进行聚类,以最小化与完整集合在难度和质量分布上的Wasserstein距离为目标,选出100条代表性样本。
④ 选择题生成。 将问答对转化为标准化多选题,由大模型生成具有干扰性的错误选项,用于自动化评估。

▲ 图4:在线阶段四步流程示意图。从用户需求出发,经过投票选取知识单元、二分搜索数据过滤、代理子集选择,最终生成标准化多选题。
实验:11个任务中的系统验证
实验设置
我们在化学(6个子任务)和医疗健康(5个子任务)两大领域进行了系统评估。评测协议清晰直接:在专家策划的ground-truth benchmark上评估10个大模型获得参考排名,然后衡量各方法自动构建的benchmark在多大程度上能复现该排名。
对比基线涵盖:通用benchmark(IfBench、SimpleQA)、科学benchmark(GPQA-Diamond)、领域benchmark(MMLU-Pro化学子集、MedQA)、纯合成方案(GPT-5直接出题)、以及基于嵌入检索的方案(k-NN,不使用本体)。
核心结果

▲ 图5:化学领域6个子任务的排名一致性分析。SciCustom在全部6个任务上均取得最高Spearman相关系数,平均ρ=0.74。注意通用benchmark(IfBench、SimpleQA)大面积出现负相关。
化学领域:SciCustom在全部6个任务上均取得最高Spearman相关系数,平均ρ=0.74,最佳基线GPQA仅为0.38。在有机化学任务上,SciCustom达到ρ=0.89。

▲ 图6:医疗健康领域5个子任务的排名一致性分析。SciCustom在4/5个任务上最优。即使是领域特定的MedQA也表现不一致。
医疗健康领域:SciCustom在5个任务中的4个上最优。
总计:在11个任务中的10个上,SciCustom的排名一致性最高。
几个值得关注的发现:
- 通用benchmark并非为细分科学需求设计。 IfBench和SimpleQA在多数化学任务上的Spearman相关系数为负,说明通用能力排序不能直接等同于专业化任务表现。
- 领域benchmark也存在覆盖边界。 MedQA在“人类衰老”上有效(ρ=0.62),在“解剖学”上却完全失灵(ρ=-0.19)。没有任何一个现有benchmark能跨子领域稳定工作。
- 合成数据不可替代真实数据。 GPT-5直接生成的benchmark在所有任务上表现平庸,验证了科学评测必须依赖真实、可验证的数据。
- 本体组织优于简单检索。 基于嵌入的k-NN检索使用了相同的底层语料,但绕过了知识单元映射,结果全面落后,说明“有组织”的知识比“有数据”更关键。
- 人工评估验证了质量。 三位AI4Chemistry方向的硕士研究生对50道化学题进行了标注,正确性得分0.92,相关性得分0.70。
消融实验

▲ 图7:消融实验。移除二分搜索截断(w/o cutoff)或将分布感知代理选择替换为随机采样(w/o selection)均导致性能下降,完整SciCustom在全部11个任务上表现最优。
每个组件都不可或缺:
•移除二分搜索截断 → 纳入松散相关的数据,性能下降
•移除分布感知的代理子集选择 → 使用随机采样替代,性能大幅下降
•完整的SciCustom在全部11个任务上表现最优
案例研究:为“周环反应”从零构建Benchmark
为了验证SciCustom在全新领域的能力,我们将其应用于周环反应,一个高度专业化的有机化学课题,此前没有任何LLM benchmark覆盖。

▲ 图8:周环反应案例研究。(左)通过多模型投票识别出“环化反应”、“芳香烃”等相关知识单元,排名与专家判断高度吻合(颜色越深越相关)。(中)从200万+语料中检索到的真实问答数据,关键术语已高亮。(右)最终生成的标准化多选题,考察Woodward-Hoffmann规则等核心知识。
框架自动完成了以下过程:
1. 知识单元识别: 通过多模型投票,优先选出“环化反应”、“芳香烃”、“环状化合物”等高度相关的知识单元,排名与专家判断高度吻合。
2. 数据检索: 从200万+语料中检索到关于环加成反应、轨道对称性、立体化学的真实问答数据。
3. 选择题生成: 生成的题目准确考察了Woodward-Hoffmann规则、热反应与光化学反应路径等核心知识点,经专家验证具有高质量。
这说明,即使面对此前从未被评测过的科学前沿,SciCustom也有潜力可靠地构建出有意义的benchmark。
SciCustom解决了什么问题?
回到开头的场景:你面对一个新的科学任务,想系统评估大模型是否真的具备相关能力。
在SciCustom之前,常见选择是:
•查通用排行榜(往往不能直接回答这个细分需求)
•查领域排行榜(可能覆盖不到你的子方向)
•自己出题测试(耗时、主观、不可规模化)
在SciCustom之后,你只需描述你的需求,框架就能全自动生成一套围绕该需求的定制化benchmark。更重要的是,这个框架具有内在的可扩展性。642个知识单元和200万+条索引数据构成了一个“知识积木库”,每个新需求只是这些积木的一种新组合,不需要重新采集数据或重新训练模型。
总结
SciCustom的三个核心贡献:
1. 提出了知识单元组合的建模范式,将科学应用分解为可复用的细粒度知识单元,实现了benchmark构建从“逐个定制”到“组合复用”的范式转变。
2. 设计了完整的自动化流水线,从本体遍历、Tagger训练、多模型投票、二分搜索到代理子集选择,每个环节都有明确的设计动机和实验验证。
3. 目前在化学和生物医学两大领域的11个任务上验证了有效性,并成功为此前没有benchmark的“周环反应”构建了高质量评测集。
当前版本的实验与知识单元覆盖重点仍集中在生物医学和化学领域,向数学、物理、地球科学等更多学科扩展,是后续工作的重要方向。
作者团队与合作信息
本文共同第一作者为北京大学计算机学院博士生顾怿洋和杨君维,通讯作者为北京大学张铭教授、北京中关村学院×中关村人工智能研究院研究员刘泽群、华盛顿大学肖之屏博士后。合作作者包括中关村两院夏应策副教授和研究员解曙方。研究团队来自中关村两院、北京大学多媒体信息处理全国重点实验室/计算机学院/PKU-Anker大模型联合实验室、IDEA研究院、西安电子科技大学、华盛顿大学、威斯康星大学麦迪逊分校、伊利诺伊大学芝加哥分校等机构。



