从论文仓库到科研数据基础设施:arXiv论文数据的综合利用

1991 年诞生的 arXiv,最初解决的是一个很简单的问题:怎样让研究人员不用等待漫长的期刊出版过程,就能迅速把最新成果传播出去。三十多年以后,arXiv 的意义已经远远超出一个“免费下载论文的网站”。

截至 2026 年,arXiv 官方资料称其数据库已经接近 300 万份 submissions,平均每月新增约 2.4 万篇,一些月份甚至超过 3 万篇。(arXiv信息) 更重要的是,这些论文并不是只能让人一篇篇打开 PDF 阅读。arXiv 同时提供结构化元数据、API、OAI-PMH、RSS、批量数据以及论文 PDF 和源文件等机器可访问资源。官方推荐通过 OAI-PMH 获取全量及每日更新的元数据,也提供 API 实时查询;完整机器可读数据可通过 Kaggle 获取,而处理后的 PDF 和源文件还可以通过 Amazon S3 进行批量访问。(arXiv信息)

这意味着 arXiv 实际上形成了一套相当难得的开放科研数据基础设施

论文标题、作者、摘要、学科分类、提交日期、版本、标识符,以及在一定条件下可以获得的正文和 LaTeX 源文件,可以被机器持续采集、解析和重新组织。于是,在 arXiv 之上逐渐生长出另一层互联网:有人给论文重新排序,有人建立推荐系统,有人构造论文知识图谱,有人用大模型阅读论文,还有人把 PDF 变成网页、视频、播客甚至可以直接运行的模型。

arXiv论文数据的综合利用

目前比较有代表性的 arXiv 二次开发服务,大致可以分为以下几类。

类型代表网站/服务对 arXiv 数据做了什么
社区化论文平台alphaXiv论文发现、关注作者、社区讨论、AI 问答和带论文引用的研究检索
AI 论文评级KurateAI 阅读全文,对论文从创新性、严谨性、影响力等多个维度评分
热门论文发现Hugging Face Papers每日、每周、每月论文榜单,加入社区投票,并关联 GitHub、模型和数据
AI 科研情报Emergent MindarXiv 热门论文、主题聚合、摘要、问答、视频和外部讨论聚合
每日论文浏览Cool Papers / papers.cool同步 arXiv 分类和每日更新,并加入 AI 解读
个性化科研信息流Distill AI、IArxiv、Scholar Inbox、arXivDigest、PaperPush根据研究方向筛选和推荐新论文,生成摘要或邮件简报
AI 论文阅读SummarizePaper自动生成论文摘要、通俗解释,并可与一篇或多篇 arXiv 论文对话
HTML 化阅读ar5iv将 arXiv LaTeX 论文转换成响应式 HTML
多媒体论文ScienceCast、arXivisual将论文转换为视频、音频、动画或可视化讲解
引用关系发现Connected Papers、Litmaps、Bibliographic Explorer根据论文构建相关论文和引用关系网络
引用质量分析Scite分析论文被其他工作引用时,是支持、反驳还是普通引用
代码和模型关联Hugging Face、Replicate、DagsHub将论文与代码、数据集、模型、在线 Demo 和可复现实验联系起来
跨库推荐CORE Recommender以当前 arXiv 论文为种子,从 arXiv 及其他开放论文库推荐相关文献

其中有些网站几乎以 arXiv 为核心数据源,有些则把 arXiv 作为更大科研数据库的一部分,因此严格来说,它们与 arXiv 的关系深浅不同。

alphaXiv:把 arXiv 变成“科研社区”

alphaXiv 是这种二次开发中很有代表性的一种。

它不是简单复制 arXiv 的搜索功能,而是在论文之上增加“人”的关系:研究者、机构、关注、讨论和社区推荐。同时又加入 AI,使用户可以针对整个研究领域提问,由系统通过底层论文提供带引用依据的回答。其首页目前明确强调“连接 papers、researchers 和 organizations”,并提供论文发现、研究人员发现以及 grounded literature review 等功能。(alphaXiv)

因此可以把 alphaXiv 理解成:

arXiv + Reddit/社交网络 + AI Research Assistant。

原始 arXiv 回答的是“这里有什么论文”,alphaXiv 希望回答的则是:

“哪些论文值得看?谁正在研究它?大家怎么看?这个方向最近发生了什么?”

Kurate:让 AI 给整个 arXiv 做“初筛”

Kurate 走的是另一条路线。

它持续收集支持的 arXiv 分类中的新论文,再让 AI 阅读论文全文,从 significance、rigor、novelty、clarity、reproducibility、evidence strength 等 16 个维度进行评分,并通过热力图和排行榜展示。(Kurate.org)

这解决的是科研人员越来越现实的问题:

每天出现的论文已经多到不可能全部阅读,那么第一步应该看哪些?

传统方法主要依赖引用数,但一篇昨天才上传的论文显然没有时间积累引用。Kurate 尝试建立一种“引用产生以前的早期质量信号”。

不过这种评分只能作为筛选工具,而不能等同于同行评审。Kurate 自己也明确说明,其排名是 discovery signal,而不是 peer review。(Kurate.org)

Hugging Face Papers:论文正在变成“论文 + 代码 + 模型”

在 AI 领域,Hugging Face Papers 是另一个非常重要的形态。

它把 arXiv 论文重新组织为 Daily、Weekly 和 Monthly Papers,并加入社区提交和 Upvote。更重要的是,论文页面可以进一步关联 GitHub repository、模型、数据集以及 Hugging Face Spaces。现在很多论文在 Hugging Face 上已经不再是孤零零的一份 PDF,而成为:

Paper → Code → Model → Dataset → Demo

这样一个完整技术对象。(Hugging Face)

过去这一方向最著名的是 Papers with Code。它建立了论文、代码、数据集、任务和 benchmark leaderboard 之间的关系。值得注意的是,截至 2026 年 8 月,Papers with Code 的域名已经直接跳转到 Hugging Face Trending Papers。(论文与代码)

这其实具有象征意义:论文数据正在与模型、代码和开源 AI 平台进一步融合。

Emergent Mind:从“论文搜索”走向“科研情报”

Emergent Mind 更接近一个建立在 arXiv 上面的“科研情报网站”。

它不仅按照时间和学科组织最新 arXiv 论文,还提供 Trending Papers、Topics、Authors、论文解释和视频内容,并把 GitHub、社交媒体讨论等外围信号与论文结合。(Emergent Mind)

这里发生了一个很重要的变化:

传统论文数据库的基本单位是论文

而这一类新产品的基本单位正在变成研究主题

用户真正关心的可能不是某篇论文,而是:

“Agent Memory 最近有什么新方法?”

“World Model 最近一个月发生了什么?”

“具身智能有哪些研究团队突然活跃起来?”

当系统能够持续聚合几百篇论文之后,arXiv 数据就开始从“文献数据库”转变为一种科技趋势监测数据源

Cool Papers:给 arXiv 加一个 AI 阅读层

Cool Papers(papers.cool)也是很有代表性的轻量化二次开发。

它基本保持了 arXiv 的学科分类体系,并与官方更新同步,同时加入搜索以及基于 Kimi 的论文解释能力。网站称其更新时间通常与 arXiv 官方更新相差不超过约 10 分钟。(酷论文)

这种产品思路并不复杂:

arXiv 数据流 + 更好的界面 + 中文/AI 解读。

但从实际使用角度看,这可能恰恰是非常有效的一种模式——原始科研数据保持不变,只在上面增加一个“认知层”。

SummarizePaper:从“阅读论文”变成“询问论文”

SummarizePaper 则展示了大语言模型带来的另一种变化。

系统针对 arXiv 论文自动生成 key points 和 layman’s summary,同时允许用户直接与一篇甚至多篇论文进行对话。(SummarizePaper)

这意味着论文的传统线性阅读方式:

摘要 → Introduction → Method → Experiments → Conclusion

开始出现另一种入口:

“这篇论文解决了什么问题?”
“和 Transformer 有什么区别?”
“实验中最大的缺陷是什么?”
“作者为什么采用这个损失函数?”

换句话说,论文正在从文档变成一个可以被查询的知识对象

ar5iv:连 PDF 本身也可以被重新设计

另一个很有意思的项目是 ar5iv。

它把 arXiv 中大量以 LaTeX 编写的论文转换为 HTML5。最简单的使用方式甚至只是把论文地址中的 “x” 换成 “5”。(ar5iv)

这件事看起来只是格式变化,意义却很大。

PDF 本质上是“电子纸张”,强调页面排版;HTML 则天然适合网页搜索、屏幕适配、结构解析、超链接、辅助阅读以及机器处理。

arXiv 自己后来也开始推进 HTML 论文。其相关研究指出,HTML 对使用辅助技术的读者尤其重要,也是提升科研论文 accessibility 的重要手段。(arXiv)

因此 ar5iv 所代表的实际上是:

把科研论文从“固定页面文件”重新转换成结构化互联网内容。

Connected Papers 和 Litmaps:把论文从“列表”变成“地图”

另一个非常成熟的方向是科研知识图谱。

Connected Papers 从一篇论文出发,通过关联关系绘制一个视觉化的“论文空间”,帮助用户发现相关工作、早期工作和后续工作。它甚至曾作为 arXivLabs 项目直接出现在 arXiv 论文页面中。(News from arXiv)

Litmaps 则进一步将论文、preprint、专利和书籍等资源连接成动态文献地图,并可以从一篇 arXiv 论文直接建立 citation map。(arXiv信息)

arXiv 自己的 Bibliographic Explorer 也在做类似的事情:展示某篇 arXiv 论文引用了哪些工作,又有哪些论文引用了它。(arXiv信息)

这实际上把科研文献从数据库中的一行记录变成了图数据库中的节点

论文不再只是:

Paper A

而变成:

Paper A → 引用了 B、C
D、E 又引用 A
作者与 F、G 合作
属于 Topic H
使用 Dataset I
Code 位于 Repository J

一旦完成这一步,就可以进一步进行社区发现、技术谱系分析、研究趋势预测甚至研究人员关系分析。

ScienceCast 和 arXivisual:论文甚至可以变成视频

arXiv 的二次开发还出现了一个越来越明显的方向:多媒体化

arXivLabs 中的 ScienceCast 可以把 arXiv 论文关联到视频和音频演示,同时提供 AI 生成的论文音频摘要。(arXiv信息)

arXivisual 则更进一步,可以输入一篇 arXiv 论文,将复杂论文转换为包含 AI 生成动画的交互式视觉讲解。(arXivisual)

这类网站实际上是在完成:

Paper → Script → Illustration → Animation → Video/Audio

于是同一份 arXiv 数据可以服务完全不同的人群:

研究人员看原文;

工程师看方法和代码;

学生看图解;

普通读者看视频;

AI Agent 直接读取结构化文本。

arXiv 数据甚至已经成为机器学习研究本身的数据集

arXiv 的价值还不仅是做网站。

论文集合天然包含:

  • 长文本;
  • 数学公式;
  • 图表;
  • 作者关系;
  • 学科标签;
  • 时间序列;
  • 引用网络;
  • 版本演化;
  • 研究主题演化。

这使它成为研究 NLP、图神经网络、推荐算法、科学知识图谱和大语言模型的理想数据集。

早在 2019 年就有研究把 arXiv 数据处理成超过 110 亿词的全文语料库以及约 670 万条边的引用图,用于研究论文分类和图模型。(arXiv)

到了大模型时代,arXiv 又成为科学文本训练语料的重要来源。例如 2025 年发布的 Common Pile 在构建开放许可文本训练集时,就使用了 arXiv 的开放许可论文以及全部可合法使用的 CC0 元数据。(arXiv)

换句话说:

人类把论文上传到 arXiv;
研究者再用这些论文训练下一代能够理解论文的 AI。

形成了一个很有意思的闭环。

为什么 arXiv 特别适合二次开发?

关键并不仅仅是“免费”。

真正重要的是它同时具备几个非常罕见的条件。

首先是规模足够大。接近 300 万份投稿已经足以形成具有统计意义的科研数据集。(arXiv信息)

其次是更新足够快。arXiv 平均每月增加约 2.4 万份新投稿,因此非常适合技术趋势监测。(arXiv信息)

第三是结构高度统一。论文拥有稳定的 arXiv ID、作者、摘要、分类、版本和时间等字段。

第四是机器接口完善。API、OAI-PMH、RSS、Kaggle 和 S3 共同形成从实时查询到大规模离线分析的完整入口。(arXiv信息)

第五,也是经常被忽视的一点,是 arXiv 还保存大量论文源文件。与只能拿到 PDF 的论文数据库相比,LaTeX 源文件对于公式解析、章节识别、参考文献抽取、语义结构恢复和 AI 数据处理具有很高价值。

所以 arXiv 与其说是一个“论文网站”,不如说是一块已经运行三十多年的开放科学数据底座

但“开放获取”并不意味着全文可以随便复制

这里有一个很重要的边界。

arXiv 明确规定,其论文的描述性元数据——例如标题、作者、摘要、标识符和分类——采用 CC0,可以自由获取、存储、转换和再利用。(arXiv信息)

但论文全文并不全部属于公共领域。

不同作者投稿时采用的许可协议不同,相当大比例论文采用的是 arXiv 的 non-exclusive distribution license。arXiv 官方明确提醒:如果没有版权持有人的许可或者论文自身许可证不允许,第三方不能简单把大量 PDF 和源文件下载下来以后再从自己的服务器公开重新分发。(arXiv信息)

因此,比较规范的产品架构通常是:

本地保存和处理元数据 → 建立搜索、推荐和 AI 索引 → 用户需要原文时链接回 arXiv。

如果需要处理全文,则必须进一步检查相应论文的许可。

此外,arXiv API 也存在调用限制,目前官方规定 legacy API、OAI-PMH、RSS 等接口总体上不得超过每三秒一次请求,并保持单连接。(arXiv信息)

所以真正大规模的数据分析一般应该使用官方 bulk dataset,而不是暴力抓取网站页面。

下一阶段:从“论文数据库”走向“科研智能层”

把这些网站放在一起看,会发现 arXiv 二次开发大致经历了几个方向上的演化:

搜索

推荐

排序与筛选

引用和知识图谱

论文 + Code + Dataset + Model

AI 摘要和论文问答

跨论文综合分析

科研趋势监测与 Research Intelligence

alphaXiv 已经在尝试回答跨论文的研究问题;Kurate 试图在引用产生之前评估论文;Emergent Mind 将论文、主题和外部讨论连接起来;Hugging Face 则把论文进一步连接到模型、代码和可运行 Demo。(alphaXiv)

这说明真正有价值的数据已经不再只是“论文正文”,而是围绕论文形成的一张越来越复杂的网络:

Paper

Author — Institution

Citation — Topic

Code — Dataset — Model

Benchmark — Result

Discussion — Attention — Impact

未来的科研信息平台,很可能不会再要求用户自己搜索二三十篇论文逐篇阅读,而是让 AI 持续监视这个网络,然后告诉用户:

这个领域过去一个月出现了三个值得注意的新方向;
其中五篇论文使用了相似的方法;
两篇论文的实验结论互相矛盾;
一个新 benchmark 正在迅速成为主流;
某个研究团队最近连续发布了四篇相关工作;
同时已经出现三个开源实现。

到那个阶段,arXiv 的角色就有些类似科研世界里的 GitHub:它保存的是最基础的开放科研对象,而真正丰富的应用、分析、社区和智能工具,则建立在它之上。

所以,从今天回头看,arXiv 最重要的价值可能已经不只是“让人免费读论文”。

它正在成为一个可由机器持续读取、重新组织、计算和理解的全球科研数据源。

而 alphaXiv、Kurate、Hugging Face Papers、Emergent Mind、Cool Papers、Connected Papers、ar5iv 等网站,不过是这个巨大数据层之上已经显现出来的第一批“应用程序”。

真正值得关注的下一步,是把 arXiv 从一个 Paper Repository,进一步变成一个 Research Intelligence Infrastructure——科研智能基础设施

另外有一个很值得继续研究的方向:如果把这些网站按“数据源—处理方式—AI能力—最终产品形态”拆开,其实可以归纳出一套相当清晰的 arXiv 二次开发技术架构。例如“arXiv OAI/S3 → 元数据数据库 → 全文解析 → Embedding/向量数据库 → 排名模型 → LLM 摘要 → 趋势分析 → 网站/邮件/RSS”。这已经很接近可以自己实现一个类似 Kurate + alphaXiv + Cool Papers 的产品方案了。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

Are you human? Please solve:Captcha