介绍 LifeSciBench:针对生命科学研究的基准测试
# 介绍 LifeSciBench
我们推出了 LifeSciBench,一个基于真实生命科学研究的专家撰写和评审的基准测试。
[阅读论文](https://cdn.openai.com/pdf/b4299379-0a97-4ffa-8b9b-c3fbb299caa9/lifescibench_preprint.pdf)
## LifeSciBench 概述
随着智能 AI 系统在科学任务中的能力不断提升,它们对生命科学研究者的帮助取决于它们如何处理现实研究的复杂性。科研工作往往并不是简单的事实回忆问题或干净的预测问题。研究者需要解读不完整的证据,调和冲突的结果,设计复杂的实验,排查检测,评估转化风险,以及在不确定性中决定下一步行动。
目前的基准测试未能充分捕捉这些能力。许多生命科学评估专注于狭窄的领域或孤立的技能,导致结构化问题格式和清晰的参考答案,尽管这些评估有其价值,但往往不能真正评估一个模型是否能够在更广泛的研究领域中做出贡献。
为了解决这一差距,我们设计了 LifeSciBench。每项任务都基于拥有博士学位、在生物技术和制药环境中推进药物发现项目的实践生命科学家的判断。
LifeSciBench 包含 750 个专家撰写的任务,涵盖七个工作流程和七个生物学领域。
- **任务资料**:1,062
- **科学家贡献者**:173
- **评估标准**:19,020
- **专家审评**:453
## LifeSciBench 的评估标准
LifeSciBench 测试 AI 系统是否能够支持现实的生命科学研究任务,而不仅仅是回答生物学问题。我们通过调查生命科学家在应用研究中最常用的工作流程来定义基准的分类法,并将他们的回答分为七个经常出现的类别:证据处理、分析、设计与优化、科学推理、验证与操作、转化,以及科学传播。
每项任务的结构都像是一位科学家对知识渊博的合作者的请求:科学提示、任何相关的上下文或资料,以及自由回答。专家撰写的评分标准评估模型是否能够为特定问题提供正确答案,附带适当的细节、理由、警示和格式,这是科学家所期待的。
## 数据集构建
LifeSciBench 在评估科学推理的同时,也关注现实科学使用需要的实用技能。它的任务要求模型解决现实的研究问题:解析证据,做出基于领域的判断,并传达对专家审评者有用的结论。许多任务还要求模型处理不确定性,并根据支持数据文件做出推理,而不仅仅依赖提示文本。
基准测试旨在反映生命科学工作的复杂性。总体上,79% 的任务需要多个推理或决策步骤,每个任务平均需要四个步骤。LifeSciBench 包含 1,062 个附带的资料,包括图表、PDF、表格、序列文件、结构或化学文件,以及网络链接。超过一半的任务(53%)要求模型从至少一种资料中解读或综合信息。
这些任务由 173 位来自不同生命科学学科的专家科学家创建,每位科学家都拥有博士级培训和生物技术或制药行业经验。在接受之前,每项任务可以经历若干轮修订,没有固定的轮次限制;被接受的任务平均经历了六轮自我导向的自动审查,并完成至少两轮的专家审查。审查过程基于可验证的正确答案或强烈的专家共识,审查者在相关领域的同意率超过 90%。这一过程确保了被接受的任务具有科学依据、清晰易于评分,并能够代表应用研究。

## 评分标准和细则
LifeSciBench 的任务通过详细的、特定任务的评分标准进行评分,这些标准将期望的回答分解为具体的科学声明、计算、决策、证明等。在整个基准中,由专家开发的评分标准包括 19,020 条标准——每项任务平均 25 条——以有效评估科学正确性和对研究决策的实用性。
这种设计反映了科学工作在实践中的评估方式:许多生命科学任务不能仅通过检查最终答案来评分。一个回答可能得出正确的高层结论,但如果忽略了关键的检测限制或未能主动提出某些影响重大的生物学细节,仍然可能被判断为不完整。反之,一个部分的回答即使没有完全解决任务,但可能包含高质量的推理。
细化的评分标准捕捉了这一细微差别。LifeSciBench 不仅评估最终答案的准确性,还评估模型是否以科学有效和操作实用的方式得出其答案。
## 结果
LifeSciBench 显示,前沿模型在科学综合、传播和结构化解读方面相对最强。虽然绝对通过率仍然适中,这些基准领域远未饱和,但 GPT‑Rosalind相比GPT‑5.5,整体准确通过率从 25.7% 提高到 36.1%。在需要专家有用或可操作输出的任务中,GPT‑Rosalind 的得分为 44.7%,而 GPT‑5.5 则为 29.1%。这一模式显示,在任务具有明确的证据边界并需要结构化科学判断的情况下,模型的实用性最大。
## 总结
LifeSciBench 为 AI 系统提供了评估生命科学任务的有效工具,推动了这一领域的科研进展。
---
原文链接:[点击查看](https://openai.com/index/introducing-life-sci-bench)
我们推出了 LifeSciBench,一个基于真实生命科学研究的专家撰写和评审的基准测试。
[阅读论文](https://cdn.openai.com/pdf/b4299379-0a97-4ffa-8b9b-c3fbb299caa9/lifescibench_preprint.pdf)
## LifeSciBench 概述
随着智能 AI 系统在科学任务中的能力不断提升,它们对生命科学研究者的帮助取决于它们如何处理现实研究的复杂性。科研工作往往并不是简单的事实回忆问题或干净的预测问题。研究者需要解读不完整的证据,调和冲突的结果,设计复杂的实验,排查检测,评估转化风险,以及在不确定性中决定下一步行动。
目前的基准测试未能充分捕捉这些能力。许多生命科学评估专注于狭窄的领域或孤立的技能,导致结构化问题格式和清晰的参考答案,尽管这些评估有其价值,但往往不能真正评估一个模型是否能够在更广泛的研究领域中做出贡献。
为了解决这一差距,我们设计了 LifeSciBench。每项任务都基于拥有博士学位、在生物技术和制药环境中推进药物发现项目的实践生命科学家的判断。
LifeSciBench 包含 750 个专家撰写的任务,涵盖七个工作流程和七个生物学领域。
- **任务资料**:1,062
- **科学家贡献者**:173
- **评估标准**:19,020
- **专家审评**:453
## LifeSciBench 的评估标准
LifeSciBench 测试 AI 系统是否能够支持现实的生命科学研究任务,而不仅仅是回答生物学问题。我们通过调查生命科学家在应用研究中最常用的工作流程来定义基准的分类法,并将他们的回答分为七个经常出现的类别:证据处理、分析、设计与优化、科学推理、验证与操作、转化,以及科学传播。
每项任务的结构都像是一位科学家对知识渊博的合作者的请求:科学提示、任何相关的上下文或资料,以及自由回答。专家撰写的评分标准评估模型是否能够为特定问题提供正确答案,附带适当的细节、理由、警示和格式,这是科学家所期待的。
## 数据集构建
LifeSciBench 在评估科学推理的同时,也关注现实科学使用需要的实用技能。它的任务要求模型解决现实的研究问题:解析证据,做出基于领域的判断,并传达对专家审评者有用的结论。许多任务还要求模型处理不确定性,并根据支持数据文件做出推理,而不仅仅依赖提示文本。
基准测试旨在反映生命科学工作的复杂性。总体上,79% 的任务需要多个推理或决策步骤,每个任务平均需要四个步骤。LifeSciBench 包含 1,062 个附带的资料,包括图表、PDF、表格、序列文件、结构或化学文件,以及网络链接。超过一半的任务(53%)要求模型从至少一种资料中解读或综合信息。
这些任务由 173 位来自不同生命科学学科的专家科学家创建,每位科学家都拥有博士级培训和生物技术或制药行业经验。在接受之前,每项任务可以经历若干轮修订,没有固定的轮次限制;被接受的任务平均经历了六轮自我导向的自动审查,并完成至少两轮的专家审查。审查过程基于可验证的正确答案或强烈的专家共识,审查者在相关领域的同意率超过 90%。这一过程确保了被接受的任务具有科学依据、清晰易于评分,并能够代表应用研究。

## 评分标准和细则
LifeSciBench 的任务通过详细的、特定任务的评分标准进行评分,这些标准将期望的回答分解为具体的科学声明、计算、决策、证明等。在整个基准中,由专家开发的评分标准包括 19,020 条标准——每项任务平均 25 条——以有效评估科学正确性和对研究决策的实用性。
这种设计反映了科学工作在实践中的评估方式:许多生命科学任务不能仅通过检查最终答案来评分。一个回答可能得出正确的高层结论,但如果忽略了关键的检测限制或未能主动提出某些影响重大的生物学细节,仍然可能被判断为不完整。反之,一个部分的回答即使没有完全解决任务,但可能包含高质量的推理。
细化的评分标准捕捉了这一细微差别。LifeSciBench 不仅评估最终答案的准确性,还评估模型是否以科学有效和操作实用的方式得出其答案。
## 结果
LifeSciBench 显示,前沿模型在科学综合、传播和结构化解读方面相对最强。虽然绝对通过率仍然适中,这些基准领域远未饱和,但 GPT‑Rosalind相比GPT‑5.5,整体准确通过率从 25.7% 提高到 36.1%。在需要专家有用或可操作输出的任务中,GPT‑Rosalind 的得分为 44.7%,而 GPT‑5.5 则为 29.1%。这一模式显示,在任务具有明确的证据边界并需要结构化科学判断的情况下,模型的实用性最大。
## 总结
LifeSciBench 为 AI 系统提供了评估生命科学任务的有效工具,推动了这一领域的科研进展。
---
原文链接:[点击查看](https://openai.com/index/introducing-life-sci-bench)
评论
暂无评论。