在主动人工智能时代的科学计算

发布于

# 在主动人工智能时代的科学计算

一份领域报告展示了科学家们如何利用编码代理来现代化基因组学和其他数据丰富领域的科学软件。

[阅读论文(在新窗口打开)](https://cdn.openai.com/pdf/scientific-computing-in-the-age-of-agentic-ai-an-exploratory-field-report.pdf)

科学计算是现代学术界和工业界研究的核心支柱。然而,分析科学信息所需的软件难以跟上数据生成的快速步伐。许多广泛使用的研究工具最初是作为研究论文的配套代码,由小型学术团队在有限的工程经验和较少的打包、测试、优化或长期支持的时间下构建的。结果是科学基础设施通常依赖于缓慢、脆弱的工作流程,需要持续维护。这些限制阻碍了发现的速度。

人工智能代理开始改变这种局面。通过降低工程工作的成本并承担繁琐的实施任务,它们有助于研究人员更快地原型化想法,追求之前不切实际的项目,并更轻松地对软件进行长期维护。因此,科学软件变得更加高效和更好维护,使研究人员能够花更多时间在发现上。

我们分享了一份探索性领域报告,包含八个主要在生命科学领域的代理辅助科学计算项目;其中五个仅使用 Codex,三个使用 Codex 和 Claude Code 的组合。报告汇集了每个项目背后团队撰写的案例研究,并识别出重复出现的主题。这些项目涵盖了从常规维护和针对性优化到大规模语言迁移和 GPU 本地重构。贡献者报告说,代理显著加速了软件开发和维护,在某些情况下,帮助小团队承担了原本需要更多时间或专业工程支持的工作。但他们也强调了建立明确的长期责任和管理这些工具的持续挑战。

贡献者们一致描述了研究者角色的转变,从实施转向验证和协调:指定要构建的内容,定义如何测量正确性,以及决定何时项目准备好发布。在这一新兴模型中,研究者仍然掌握科学方向和质量标准,但借助主动的协助提升了速度。

![绘制代理辅助科学软件项目的图表,涵盖从维护到工作流程重构的范围。](https://images.ctfassets.net/kftzwdyauwt9/1l4AGq9PGmoCMR6wqKwTBY/2f21781b97f5fab792d74e44907feb69/diagram1-desktop-light.svg?w=3840&q=90)

## 案例研究

#### **现代化一个广泛使用的基因组数据解析库**

cyvcf2 是一个用 Python 编写的库,用于读取和写入基因变异文件。GPT‑5.5 替换了该库的遗留构建和打包系统,采用了一个现代化的统一流程,旨在使库的安装、测试和发布变得更加容易。

> “使用编码代理,快速前进相当简单;为了在科学上走得更远,仍然需要专家的指导、理解、品位和关心。”
> —布伦特·彼得森

## 重复主题

尽管项目范围各异,但它们表明编码代理正在使科学计算中的工程劳动和专业知识不再是限制。目前的瓶颈则是验证 AI 代理的输出,这仍然依赖于人类的判断。

在案例研究中,代理成功处理了特定的、明确范围的请求,但无法可靠判断其工作是否科学有效或符合预期。事实上,代理通常在工作包含明显错误时依然表现出信心。因此,人类审阅者需要找到可靠的方法来验证结果。最有效的方法使用外部参考或可测量的接受目标,例如精确输出一致性、与现有工具的对比、适当的统计行为或使用模拟数据预先确定的答案。

另一个重复出现的主题是项目通常采用反馈驱动的迭代而不是一次性的方法。贡献者们将广泛的目标分解成较小的变化,然后使用中间基准和测试系统来评估和细化代理的工作。代理通常快速生成初步实现,但解决边缘情况和微妙的数值差异则需要更长时间。完成实现的“最后一公里”往往需要最多的工作。

总体而言,这些案例研究表明,代理正在使研究人员花更少的时间在实施上,花更多的时间在指导科学工作上。人们定义目标,将复杂项目分解为可管理的部分,并判断结果是否科学有效。通过减轻长期以来的工程限制,代理扩展了研究人员可以构建的内容,同时使他们能够专注于最重要的科学问题和决策。

## 长期管理仍然至关重要

研究软件中的维护缺口长期以来减缓了迭代速度,并限制了可复制性和可靠性。对“[研究代码⁠(在新窗口打开)](https://doi.org/10.1038/s41597-022-01143-6)”和[组学工具⁠(在新窗口打开)](https://doi.org/10.1371/journal.pbio.3000333)的已发布研究发现,已发布软件往往无法在新的计算设置中正确安装或按文档运行,迫使研究人员在配置和调试上花费大量时间。即使是常规改进也能为研究人员节省时间,减少计算需求,而基于性能的重构和重写则能带来更大的收益。

但较低的实施成本也使产生许多类似的重写变得更容易,从而分散用户并传播保持任何一个工具可靠所需的专业注意力。这使得长期管理和归属显得尤为重要。成熟的科学软件具有未记录的约定、兼容性要求和用户信任,仅翻译源代码无法复现。

这些案例研究展示了几条可能的前进路径。MHCflurry 和 cyvcf2 的更改被纳入其原始上游项目,而 rustar-aligner 则由于原项目已被放弃而转移到新的社区管理中。协调现有维护者的工作应尽早开始。当必要时,独立实现需要明确的所有者和可信的维护计划。没有这一点,今天的现代重写可能会成为明天被弃用的代码,而不是可靠的科学基础设施。

## 朝着更持久的科学软件前进

这份领域报告是回顾性的和探索性的,但案例研究指向了科学软件开发方式的实用转变。编码代理如 Codex 能显著降低维护、迁移、优化和新实施的成本。它们的长期科学价值仍然依赖于人类对于构建内容、如何验证以及谁来维护的决策。更深层的变化不仅在于研究人员可以生产更多的软件,而在于他们可以将更多精力放在定义、验证和管理工具上。

这些案例研究表明,代理已经可以加速科学计算中的迭代速度。随着编码代理的改善,研究人员将能够花更少的时间保持分析管道的运行,而更多的时间推动他们的领域向前发展。

- [2026](https://openai.com/research/index/?tags=2026)
- [软件与工程](https://openai.com/research/index/?tags=software-engineering)

## 作者

OpenAI

### 继续阅读

[查看全部](https://openai.com/news/)

![GPT-Red艺术卡片](http://pic.zhso.org/2026/07/21/282447f9091e.png) [GPT-Red:解锁自我提升以增强鲁棒性安全 2026年7月15日](https://openai.com/index/unlocking-self-improvement-gpt-red/)

![在编码评估中分离信号与噪声 > 艺术卡片](http://pic.zhso.org/2026/07/29/38af0a3fafa9.png) [在编码评估中分离信号与噪声研究 2026年7月8日](https://openai.com/index/separating-signal-from-noise-coding-evaluations/)

![介绍 GeneBench-Pro > 封面图](http://pic.zhso.org/2026/07/29/660bd391f07f.png) [介绍 GeneBench-Pro研究 2026年6月30日](https://openai.com/index/introducing-genebench-pro/)

---

原文链接:[点击查看](https://openai.com/index/scientific-computing-agentic-ai)

评论

暂无评论。

0.055447s