把论文变成“会工作的科研智能体”:Nature 论文 Paper2Agent 解析

论文 Reimagining research papers as interactive and reliable AI agents 于二零二六年九月十六日发表于《Nature》,由斯坦福大学 Jiacheng Miao、James Zou 等研究人员完成。论文提出 Paper2Agent 框架,核心思想非常明确:未来的科研论文不应该只是供人阅读的静态文档,而可以进一步变成能够回答问题、运行代码、分析数据甚至与其他论文协作的人工智能智能体。(Nature)

Paper2Agent:论文变成智能体

一、它真正想解决什么问题

今天很多计算类论文虽然公开了代码,但“论文公开”并不等于“方法可以直接使用”。研究人员往往还需要寻找代码仓库、安装依赖、配置运行环境、理解接口、确定参数,再研究作者究竟按照什么顺序运行程序。对于跨学科研究人员来说,这些技术障碍甚至可能比阅读论文本身更困难。

Paper2Agent试图把这层障碍消除掉。它不是简单地把论文送给大语言模型,让模型回答“这篇论文讲了什么”,而是把论文、补充材料、代码、数据、教程和分析流程整体重新组织成一个可以直接调用的科研系统。用户面对的不再只是一个文档,而更像是在与这篇论文的“虚拟通讯作者”交流。(Nature)

这是这项工作的关键区别。传统的论文问答主要解决“读懂论文”,Paper2Agent进一步解决“使用论文”。

二、Paper2Agent实际上做了什么

整个系统以模型上下文协议,也就是 MCP作为连接层。可以把 MCP 理解成一套面向人工智能智能体的标准接口,它让大语言模型知道论文中有哪些数据、有哪些程序可以调用、每个工具应该怎样使用以及不同工具按照什么顺序组合。

Paper2Agent最终为一篇论文建立三类内容。

第一类是可执行工具。例如一篇基因组论文包含变异影响预测程序,Paper2Agent会把相关功能封装成可以直接调用的工具。

第二类是论文资源,包括正文、代码仓库、数据、补充材料、表格和图片等。

第三类是工作流程。系统不仅知道“有哪些工具”,还会从论文和教程中总结出“应该先做什么、再做什么”,避免智能体随意拼接分析步骤。(Nature)

因此,用户以后可能只需要说:“把这篇论文的方法应用到我的新数据上。”智能体就可以自行选择工具、运行程序并整理结果,而用户不必先花几天时间研究代码库。

三、可靠性是这篇论文最值得关注的部分

科研智能体最大的风险并不是不会回答,而是很自信地运行了错误的程序

因此Paper2Agent没有让大模型临时生成一段代码然后直接相信结果,而是设计了一套自动验证流程。系统首先找到论文代码库,建立独立的软件环境,再寻找官方教程并实际运行。随后,它把教程中的分析步骤提取成通用工具,再利用原教程的数据和结果进行自动测试。只有能够重复得到预期结果的工具,才会进入最终的 MCP 服务。反复测试仍然失败的工具会被剔除。(Nature)

这实际上是在给科研智能体增加一个“软件工程质量控制层”。

因此Paper2Agent与普通的论文加大语言模型模式有明显不同。普通模型每次遇到问题都可能重新理解论文、重新编写代码;Paper2Agent则尽量把经过验证的方法提前固化下来。这样既降低代码幻觉,也提高结果的可重复性。

四、大规模实验效果如何

作者没有只展示几个精心挑选的案例,而是进行了较大规模测试。

在一百篇计算生物学论文中,有七十四篇被成功转化成智能体。系统共提出五百九十九个工具,其中五百九十三个通过自动验证。无法成功转换的论文主要存在代码缺失、数据或模型文件缺失、依赖环境损坏以及程序过度针对单个实验而无法通用化等问题。(Nature)

在三百个基于论文教程构建的问题中,Paper2Agent使用Claude Sonnet 4时,平均正确率约为百分之九十一点二,而让Claude直接面对论文和代码仓库时,结果明显更低。同时,Paper2Agent单次查询的时间和费用也更少。

作者还测试了人工智能、统计学、计量经济学、博弈论等非生物领域的软件论文。在四十二个需要真正运行程序的任务中,其正确率约为百分之九十八点一。这说明这种方法至少在当前实验范围内,并不仅限于生物信息学。(Nature)

这组结果说明了一个重要问题:让大模型直接阅读代码,并不一定是最好的科研智能体方案。提前把论文整理成经过验证的工具和工作流程,反而更可靠。

五、更重要的一步:论文智能体之间开始协作

Paper2Agent最有想象力的部分并不是“与论文聊天”,而是让不同论文形成的智能体协同工作

Nature正式版本展示了一个银屑病研究案例。研究人员把AlphaGenome相关论文、单细胞基因调控实验论文以及Perturb-seq数据论文分别转换成智能体,然后让它们共同分析一个疾病相关基因区域。不同智能体分别承担预测、读取实验数据和交叉验证等任务,最终将GPR137确定为重点候选基因,并利用独立实验数据进一步提供支持。值得注意的是,其中使用的一种跨实验数据整合策略并不是原始论文直接提出的,而是在智能体组合不同论文资源过程中形成的。(Nature)

这意味着科研智能体开始从“执行论文方法”向“组合不同论文的能力”发展。

六、这篇论文真正重要在哪里

这项工作的意义并不只是又做了一个科研智能体,而是提出了一种新的科研知识组织方式。

传统路径是:

论文发表,人阅读论文,人下载代码,人配置环境,人运行方法。

Paper2Agent设想的路径则变成:

论文发表,论文同时被封装成智能体,人或其他人工智能直接调用它。

如果这种模式真正成熟,未来论文可能像今天的软件接口一样,可以被其他科研系统直接连接。一个智能体掌握新的算法,一个智能体代表新的实验数据,另一个智能体掌握某种分析工具,它们可以被同一个“人工智能科学家”组合起来完成研究任务。

作者甚至提出,未来论文除了“代码可用性”和“数据可用性”之外,可能还会出现“智能体可用性”这一新的出版内容。(Nature)

七、但它距离“自动科学家”仍有明显距离

论文对此比较克制。首先,并不是所有论文都能够智能体化。此次实验中,一百篇计算生物学论文只有七十四篇成功,说明科研代码的完整性和工程质量仍然是瓶颈。

其次,工具能够正确执行,并不等于科学结论一定正确。尤其是开放式科学问题,可能同时存在多种合理解释。作者明确强调,假设生成、机制解释和最终证据判断仍然需要研究人员参与。Paper2Agent的定位是增强科研,而不是成为权威的自动科学家。(Nature)

此外,把论文代码变成可远程执行的智能体,也会带来新的软件安全、知识产权、代码维护、版本漂移和科研责任归属问题。

总体来看

Paper2Agent最值得关注的地方,可以浓缩成一句话:

它试图把科研论文从“人类阅读的知识载体”,升级为“人工智能可以直接调用的科研能力模块”。

如果说过去的人工智能科研工具主要是在“读论文、总结论文”,那么Paper2Agent代表的下一阶段很可能是执行论文、组合论文和让论文之间协作。从这个角度看,这篇论文真正讨论的并不只是一个新的智能体框架,而是在探索未来科学知识是否会从“文档化”进一步走向“智能体化”。这也可能成为 AI for Science 下一阶段非常重要的一条技术路线。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

Are you human? Please solve:Captcha