推出 GeneBench-Pro:AI 在计算生物学中的判断力测试

发布于

# 推出 GeneBench-Pro

OpenAI 今天推出了 GeneBench-Pro,这是一个研究级的基准测试,旨在评估 AI 代理如何在计算生物学中处理模糊性并做出重要判断。

在科学研究中,数据往往没有附带说明,研究者必须判断数据中的模式是否反映生物现象或噪音,是否能支持他们的问题,以及每个结果如何影响后续行动。尽管 AI 代理在执行复杂分析方面的能力在不断提高,但真正的科学研究不仅依赖于记忆事实或遵循预定义工作流程,还依赖于对更高层次判断的能力。

GeneBench-Pro 是一个典型的基准测试,针对现实世界计算生物学所需的判断重分析进行挑战。它发展自 GeneBench,涵盖了基因组学、定量生物学和转化医学中更难、更现实的任务,反映了计算生物学中科学研究的复杂性、迭代性和模糊性。

### 数据集构建

在生物学中,数据生成的成本(例如基因组测序)已显著下降,一些研究者认为现时的限制因素已不再是样本收集,而是下游计算和分析。GeneBench-Pro 旨在评估解决这一瓶颈的进展,涵盖 129 道问题,涉及广泛的计算生物学场景和方法。

### 域图谱:129 个问题

- 统计遗传学 n=17
- 群体遗传学 n=21
- 定量遗传学 n=17
- 调节组学 n=17
- 功能基因组学 n=9
- 蛋白质组学 n=7
- 临床、药物基因组学与诊断 n=26
- 癌症基因组学 n=10
- 微生物基因组学 n=3
- 法医遗传学 n=2

GeneBench-Pro 还设计得避免常见的基准失败,确保问题是合成构建的,能够精确测量更高层次的能力。每一个问题都有真实且混乱的数据集、实验背景以及与下游决策相关的目标估算。在回答问题时,模型必须探索数据、选择适当的分析方法,并进行迭代实验过程,最终提供答案。

### 评估与评分

每个 GeneBench-Pro 问题都是一个独立的科学分析,代理可以访问一个隔离工作区,其中包含简短的提示和数据文件,使用标准的生物信息学工具包。我们的最终模型,GPT-5.6 Sol,在最高推理水平的通过率为 28.7%。

综上所述,GeneBench-Pro 代表了对 AI 能力进行系统评估的努力,将帮助科学界理解和提升模型在处理高级科学判断时的表现,从而加速科学发现的步伐。

---

原文链接:[点击查看](https://openai.com/index/introducing-genebench-pro)

评论

暂无评论。