AI开始自己做科研,但真正重要的是:它能不能拿出证据

Google Research最近介绍了一套名为Science One Framework的自主科研框架,对应论文中的系统名称是ScientistOne。它想解决的,并不只是“让AI自动写论文”,而是一个更重要的问题:AI写出来的论文,里面的数字、引用、实验结果和方法描述,到底是不是真的。

现在的大模型已经很会写文章了。它可以快速生成一篇结构完整、术语专业、读起来很像学术论文的文本。但“写得像”并不等于“做得真”。一篇AI生成的论文,可能引用了不存在的文献,报告了无法重复出来的实验成绩,甚至在方法部分写了一套听起来非常复杂的算法,实际代码却根本没有实现。

ScientistOne就是针对这个问题设计的。

它的核心思想叫作“证据链”,英文是Chain-of-Evidence。简单来说,就是要求AI论文里的每一个重要说法,都必须能够回答一个问题:

你的依据在哪里?

比如,论文中说某个方法的准确率达到95%,这个数字就必须能追溯到真实的实验日志;论文中说自己采用了某种算法,代码中就必须真的实现了这套算法;论文中引用了一篇文献,这篇文献不仅要真实存在,还应该与当前讨论的问题有关。

也就是说,论文不再只是最后生成的一份文字,而更像是一份可以逐项检查的研究档案。

ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

为什么现有的AI科研系统容易出问题

许多AI科研系统的工作方式大致相同:先搜索资料,再提出想法,接着写代码、做实验,最后生成论文。

表面上看,这和人类做科研的流程很像。但问题在于,AI在任何一个环节出错,错误都可能一路传到最后。

比如,AI一开始误读了一篇论文,后面就可能根据这个错误理解提出研究方案;实验结果出来后,它又可能错误解释某个数字;到了写论文时,它甚至会把这些错误组织成一套看似完整、前后一致的故事。

最麻烦的是,一篇内部逻辑一致的错误论文,往往比一篇明显混乱的论文更难发现问题。

因为它读起来很顺,图表也很漂亮,结论似乎也有道理。只有真正检查代码、数据和原始文献,才可能发现里面的问题。

ScientistOne希望改变这种做法。它不是等论文写完后再检查,而是在整个研究过程中,一直保存资料来源、代码版本、实验记录和中间结果。

它是怎样工作的

ScientistOne大体分为三个阶段。

第一个阶段是查资料。

系统会从一些种子论文出发,继续寻找相关论文,建立一个文献网络。它会读取论文全文,而不只是看标题和摘要,然后整理出当前领域已经有哪些方法、最好的结果是什么、还有哪些可能的研究方向。

这个阶段有一个重要原则:不能只靠大模型“记忆中的知识”来写参考文献。

因为大模型有时会把作者、标题、年份和期刊名称混在一起,生成一篇看起来很真实、实际上并不存在的论文。ScientistOne要求参考资料来自真实检索结果,而不是模型临时编造。

第二个阶段是提出方案并做实验。

系统会同时想出多个研究方案,然后让多个AI智能体分别编写代码和运行实验。这些方案彼此独立,类似多个研究小组同时解决同一个问题。

完成一轮实验后,系统会保留表现较好的方案,再在这些方案的基础上继续改进。

这种方式有点像比赛,也有点像自然选择:表现较差的方案被淘汰,表现较好的方案继续演化。

不过,系统不能只看最终分数。因为有些程序可能通过钻评分规则的空子获得高分,却没有真正解决问题。因此,ScientistOne还会检查代码是否违反任务规则,例如是否偷偷读取了答案、是否把测试数据直接写进程序、是否利用了评估器漏洞。

第三个阶段是写论文和核对论文。

普通AI通常是直接根据实验结果生成一篇文章。ScientistOne的做法更谨慎。

它首先把实验结果、代码、日志、参考文献和消融实验整理成一份结构化材料。每个重要结论都会绑定相应的证据,例如某个实验文件、某段日志、某个代码版本或某篇论文。

只有这些对应关系建立以后,系统才开始把内容写成论文。

可以把这个原则概括为一句话:

先确定证据,再组织语言。

论文生成后,系统还会进行第二轮检查。它会重新提取文章中的数字、方法和引用,然后逐项核对。

如果论文里说“实验结果是0.92”,但日志中实际是0.89,系统就应该修改;如果论文声称使用了某种复杂算法,但代码中没有实现,就需要删掉或改写;如果某个结论没有足够证据,也不能用肯定语气表达。

它还设计了一套“论文审计工具”

除了ScientistOne本身,研究团队还开发了一套可以检查其他AI论文的工具,称为CoE Integrity Audit,可以理解为“证据链完整性审计”。

它主要检查四类问题。

第一,论文中的成绩能不能重新运行出来。

审计工具会执行作者提交的代码,然后比较真实结果和论文中报告的结果。如果论文说准确率是95%,重新运行却只有80%,显然存在问题。

第二,程序有没有违反规则。

有些AI可能找到一种投机方法。例如直接读取测试答案,或者针对评分器的漏洞写特殊代码。虽然分数很高,但这不属于真正的科研成果。

第三,参考文献是不是真的存在。

系统会到多个学术数据库中查询论文标题、作者、年份和出版信息,检查引用是否真实。

第四,方法描述和代码是否一致。

这是非常关键的一项检查。论文里写的算法,必须和实际代码对应。不能论文中说自己使用了神经网络、进化算法或强化学习,代码里却只是几条简单规则。

这类问题在人类阅读论文时并不容易发现,因为评审者通常没有时间逐行检查代码。

实验结果说明了什么

研究团队让ScientistOne和其他几套自主科研系统完成相同任务,并对它们生成的论文进行审计。

结果显示,ScientistOne在可重复性、参考文献真实性、方法与代码一致性等方面,整体表现更好。

它报告的大部分实验成绩都能够重新运行出来,也没有发现虚构参考文献。它生成的论文中,绝大多数方法描述与代码基本一致。

相比之下,其他系统出现了多种问题。

有的论文引用了根本不存在的文献;有的论文报告的最好成绩无法重现;有的系统代码本身可以运行,但论文挑选了对自己最有利的一次结果;还有的论文把一个简单的规则程序描述成复杂的智能算法。

这些结果说明,一个AI能够找到不错的解决方案,并不代表它能够准确、诚实地描述自己做过的事情。

“会做实验”和“会写真实的论文”,其实是两种不同的能力。

不过,ScientistOne也没有完全避免错误。研究人员发现,它有一次把一个比较简单的程序描述成“神经符号求解器”和“由大模型引导的进化搜索”,但实际代码并没有这么复杂。

这说明证据链方法虽然能明显减少问题,但还不能彻底消除AI夸大和误写。

它真的达到“人类科学家水平”了吗

论文标题中使用了“接近人类水平的自主科研”这样的说法,但需要谨慎理解。

ScientistOne测试的任务,大多是可以在计算机中自动运行、自动评分的优化问题。程序写出来以后,可以直接得到一个分数,因此很适合AI反复试验。

但现实中的科研要复杂得多。

生物实验可能需要培养细胞,材料实验需要真实设备和测量,医学研究涉及患者和伦理,理论研究还要判断证明是否严密。很多科学问题甚至没有一个明确的评分函数。

此外,真正优秀的科学家不仅会解决已有问题,还要判断什么问题值得研究,能够提出重要假设,设计可靠实验,并理解结果背后的原因。

目前的ScientistOne更像是一套自动化程度很高的计算研究系统,而不是能够在所有领域独立工作的科学家。

因此,更准确的说法是:它在一些边界清楚、规则明确、实验可以自动运行的任务中,表现出了较强的自主研究能力。

这项研究真正重要的地方

ScientistOne最大的价值,不一定是它取得了多高的成绩,而是它提出了一种更可靠的AI科研思路。

过去,人们往往关注AI能不能生成新想法、能不能写代码、能不能自动写论文。现在,这项研究提醒我们,另一个问题同样重要:

AI说的这些话,能不能被验证?

未来的AI科研系统,可能不能只提交一篇PDF论文。它还应该同时提交完整的研究材料,包括代码版本、运行环境、实验日志、数据来源、引用记录,以及每个关键结论对应的证据位置。

这样的科研成果更像一个完整的软件项目,而不是一篇孤立的文章。

别人可以重新运行,可以检查每个数字,也可以看到某个结论是怎样一步步产生的。

这种模式不仅可以用于学术论文,也可以用于工程设计、药物研发、仿真计算、企业研究报告和模型测试。

比如,在工程研发中,AI给出一个设计结论时,应该同时说明它来自哪一次仿真、使用了什么参数、采用了哪个软件版本以及是否经过验证。这样,人类工程师才能真正信任并使用它的结果。

它仍然有哪些局限

首先,ScientistOne主要在计算机任务上进行测试。这些任务方便自动运行和评分,但不能代表全部科学研究。

其次,检查一篇参考文献是否存在,相对容易;判断这篇文献是否真的支持某个观点,则要困难得多。一篇论文可能是真实的,但引用者可能误解了它,或者夸大了原文结论。

第三,一些审计工作仍然依赖大模型判断。例如,判断论文描述和代码是否一致,并不完全是机械比较,也需要模型理解代码和文字。大模型本身仍可能漏掉问题。

第四,这套系统的运行成本可能不低。它要阅读大量论文,同时运行多个智能体,多轮生成代码、执行实验和检查结果。论文没有完整说明每篇研究需要多少模型调用、计算资源和费用。

第五,比较不同系统时,研究人员对部分系统进行了适配和修改。虽然已经尽量统一条件,但这种比较仍不能被看作绝对公平的最终排名。

总结

ScientistOne并没有证明AI已经能够全面取代科学家,但它指出了AI科研发展的一个重要方向。

未来衡量一个AI科研系统,不能只看它能不能写出漂亮论文,也不能只看它能不能得到高分。

还要看它的实验能否重复,引用是否真实,代码是否符合描述,结论是否有充分证据。

真正可信的AI科学家,不只是一个很会表达、很会总结的大模型,而应该是一套能够对自己的每一个重要说法负责的系统。

它不仅要告诉人类“我得出了什么结论”,还应该能够清楚回答:

这个结论是怎样得出来的,证据在哪里,别人能不能重新验证。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

Are you human? Please solve:Captcha