PDF当死,ARA该立!论文是时候Agent原生了

以后论文的第一读者不是人,而是AI?

PDF当死,ARA该立!论文是时候Agent原生了 – 量子位

首页

资讯

智能车

智库

活动

MEET大会

AIGC

扫码关注量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

PDF当死,ARA该立!论文是时候Agent原生了

听雨

2026-08-10

21:53:22

来源:

量子位

以后论文的第一读者不是人,而是AI?

文婷 发自 凹非寺

量子位 | 公众号 QbitAI

啥情况?

统治科研圈几十年的PDF格式,都需要因AI而“退休”…

因为以后

论文的第一读者不是人,而是AI??

近日,IEEE Spectrum重点关注了一项新研究——

ARA

(Agent-Native Research Artifact)。它不仅能让AI理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究,

让AI从辅助工具升级为科研协作者

据IEEE报道,ARA团队在一篇名为

The Last Human-Written Paper: Agent-Native Research Artifacts

的论文中,呼吁科学家们停止继续使用PDF撰写传统论文,并表示:

AI需要一种不同的内容格式,而

AI的需求,理应被置于首位。

论文的第一作者

刘嘉晨

核心论点是:

一旦AI“榨干”了人类专家所有的数据,它就不再需要人类的任何输入。到那时,AI将开始自主进化。

现在这些只提升AI科学家的能力,却不改造科研知识的共享方式,就像在泥泞路上开F1赛车,难以复现并接续前人的工作。

PDF

就是过去科研知识共享的最核心代表。

是时候了,ARA当立。

为什么PDF该死?

PDF代表的是传统论文的最终结果,是科研最后成果的最终呈现,但就是这种呈现,“有问题”。

ARA团队认为,

真实的科研从来不是一条从问题直通答案的直线

,研究者往往要提出十几个假设、尝试几十种方案、调整无数次参数,在经历大量失败后,才能摸索出一条走得通的路径。

然而,当这些探索被写成论文时,那棵枝杈横生的“探索树”通常会被修剪成一条干净、连贯的成功路径。

ARA团队

将这种损失称为

“叙事税”

,即为了让研究成为一个有头有尾、逻辑自洽且成功的故事,大量的探索过程被主动舍弃,

后来者只能被闪耀的新突破亮瞎眼,却看不见前人踩过的坑、受过的罪。

除了“叙事税”,传统论文还存在着

“工程税”

一篇论文只要能让审稿人信服,便算完成了使命。

但“说服审稿人”与“让AI完整复现”完全是两套标准。

模型版本、运行环境、超参数、预处理方式、训练技巧……这些决定实验成败的关键细节,往往散落在正文、附录和代码仓库中,有些甚至从未被记录。

研究团队统计了PaperBench中的8921项专家复现要求,发现

仅有45.4%

在论文PDF中得到了完整说明。

对咱来说,实验信息少了,我们可以根据过往经验、求助导师或者不断试错补上;

但对

AI来说,论文里没写,那就意味着只能靠猜(或者瞎编)

,它也很无奈。

因此,ARA选择彻底换一种思路:

不再将线性叙事的论文视为科研成果本身,而是把研究重组为一个机器可直接操作的知识包。

这个知识包包含四个层次:

科学逻辑层:

记录研究解决了什么问题、为何采用该方法,以及哪些主张可被证伪。

可执行代码层:

不仅提供代码仓库,还包含复现实验所需的环境、配置与关键参数。

探索图层:

将实验过程还原为一张可追踪的路线图,成功与失败的方向、放弃某条路线的原因均被保留。

证据层:

将论文中的每一项主张关联至原始实验结果,方便AI核验结论,而非仅采信正文中的概括性描述。

概括来说,论文最后通过PDF呈现的只是

“我们最后做成了什么”

但如果通过ARA,展现的还有

“为什么这么做”“具体怎么做”“哪些方法已失败”以及“原始证据在哪里”

,追求的是

知识优于叙事

更形而上来说,

PDF只有结果,ARA还包括了整个过程。

道理似乎是这个么道理,但“一切存在皆合理”,PDF能成为人类科研论文最终呈现形式这么多年,一定是有其内在合理性的。

ARA要取而代之,需要的就不光是理念了。

ARA真的比PDF好用吗?

为了让ARA真正跑起来,研究团队设计了三套配套机制:

1、Live Research Manager:

负责在研究过程中持续记录实验、决策、转向与失败路线;

2、ARA Compiler:

负责将现有的PDF和代码仓库转换为ARA格式;

3、ARA原生审稿系统:

负责让机器先行完成结构检查与复现验证,并将创新性、重要性与研究品位等判断留给人类审稿人。

为了体现ARA真的比PDF好用,研究团队分别从

理解

复现

延伸

三个维度进行了测试。

在理解测试中,研究人员设置了450个问题,要求AI从ARA或传统PDF加代码仓库中寻找答案。

结果显示,使用ARA的AI准确率达

93.7%

,而传统材料组仅为

72.4%

,相差

21.3%

差距最大的是“复盘失败”

,当问题涉及失败方案、替代路线和实验教训时,

ARA组准确率为81.4%,传统材料组仅15.7%

——原因很简单,

传统论文里压根就没有这些信息。

在复现测试中,团队选取了15篇附带GitHub仓库的机器学习论文,设置了150项复现任务。

其中,ARA组的难度加权成功率为

64.4%

,传统组为

57.4%

。且

任务越难,ARA的优势就越明显

ARA在简单、中等和困难三档任务中,分别领先

4.9%

5.6%

8.5%

但ARA的表现

并非一路开挂。

在最具挑战性的研究延伸环节,ARA组赢下了3项RE-Bench开放任务,但

另有2项被传统论文组反超。

不过,也有可取之处。

ARA组在全部5项任务中,都抢先摸到了那步最关键、最值钱的第一步实验操作:

利用失败记录迅速绕开已经被验证过无效的研究方向,省去大量重复探索。

这也对应了论文中的另一组数据。在论文分析24008次AI Agent运行中,

90.2%的资金成本都消耗在失败探索上

,而传统论文几乎不会保存这些失败。

对刘嘉晨而言,这正是ARA最重要的价值。

在她设想的人机科研关系中,AI不再只是润色论文、查找资料或生成代码的辅助工具,而是能

真正成为参与阅读、复现和延伸研究的科研主体。

科研人员则可以更加聚焦于那些AI难以替代的判断、创新和品味工作

,即判断问题是否重要、工作是否真正新颖、某条路线是否值得投入。

ARA也并非完美

不过,虽然ARA的成绩单看起来非常亮眼,但它目前更像一位野心勃勃、天资聪颖却根基尚浅的高一新生,才刚入学就想要在高考中考进北大。

它离成为“PDF终结者”还有很长的一段道路要走。

篇幅有限,简单说三点。

ARA的第一个缺陷,就是它目前

实验的范围较窄,普适性较弱

,只覆盖了天然适合代码复现的机器学习领域,能否用于湿实验或理论学科还尚未得到验证。

第二个问题,就是

隐私和数据安全问题。

ARA目前不仅还没有实现细粒度的访问控制,缺少沙箱执行和内容异常检测,相关规则和标准也还没完善妥当。

要是你就这么大大咧咧地把机密数据喂给它,小心下一秒就被你的竞争对手拿走哦。

第三个是

不可避免的AI幻觉和路径依赖问题。

在15篇论文的复现实验中,传统材料组出现了2次结果编造,ARA组也出现了1次。

所以

它目前应该既不能保证AI永远不捏造结果、也不能保证它不会过度傻白甜地相信前人的判断。

当然,这种思考和理念,依然有其创新性和价值。

如果你需要更详细了解,建议你直接前往文末附上的论文和开源地址。

或者更进一步与ARA的研究团队、提出者交流。

ARA提出者

ARA研究由来自斯坦福大学、密歇根大学、卡内基梅隆大学和MIT等多家机构的37名研究者共同完成。

其中第一作者是

刘嘉晨

她是

密歇根大学的计算机科学博士

,深耕机器学习系统与大模型基础设施领域。

刘嘉晨,来源IEEE Spectrum

她曾参与大模型服务、训练系统和Agentic RL系统研究,也曾在Meta从事大模型预训练与后训练基础设施相关工作。

刘嘉晨的个人主页和密歇根大学官网显示,她曾在2023年入选

Machine Learning and Systems Rising Stars

荣誉榜单。

图源密歇根大学官网

今年5月,刘嘉晨在帕洛阿尔托创立

Agent-Native Research Lab

,已经联动产学研来推动ARA Commons科研生态建设。目前,其公开成果主要包括ARA协议及论文、配套代码、研究生态构想,以及面向NeurIPS 2026的AI驱动科研生态研讨会。

实际上,

这种Agent-Native的理念,也在AI狂飙这几年,正在给千行百业带来范式变革。

从PDF到ARA,一方面是AI能力的涌现,可以让整个科研过程的价值被重新发现和重视,而不仅仅是呈现一个最终的结果。

过去我们形成了PDF,是因为所有论文都是人类作为阅读者、使用者、核心对象。

但现在AI能力加持,Agent能力突破,人类看不过来的科研过程Agent可以看,人类难以并行的科研复现Agent可以复现……

以前是

人类—PDF—人类

,以后可能是

人类—Agent—ARA—Agent—人类

这种变革也不局限于科研领域,在更早之前,一脉源流的已经有:

GUI已死,CLI当立…

Markdown已死,HTML当立…

Prompt已死,Loop当立…

……

“PDF已死,ARA当立”

只是这种趋势下的一种因循结果罢了。

这更本质的是一种AI观、价值观上的哲学体现,

你依然支持的是“人是万物的尺度”,还是AI才是更终极的尺度?

你是碳基生命守护者,还是完全拥抱硅基时代降临…

这无关对错,只是选择,选择的人多了,也就会在某个节点分出对错。

而ARA的提出者,显然选择的是AI为中心、Agent Native。

当然,

目前为止,ARA这篇研究和论文,依然是PDF提交和呈现的。

参考链接:

[1]https://spectrum.ieee.org/ai-scientist-research-paper-format?itm_source=homepage&itm_medium=hero&itm_campaign=hero-2026-08-06&itm_content=hero1

[2]https://arxiv.org/abs/2604.24658

[3]https://amberljc.github.io/

[4]https://micl.engin.umich.edu/stories/two-cse-phd-students-named-machine-learning-and-systems-rising-stars

[5]https://github.com/ARA-Labs/Agent-Native-Research-Artifact

[6]https://the-future-of-research-ecosystem.github.io/

[7]https://www.agenticresearch.sh/

版权所有,未经授权不得以任何形式转载及使用,违者必究。

AI

听雨

AI倒查论文100年!99.2%的顶刊都有问题…

2026-08-10

Opus 5狂烧6.9亿token做游戏,GPT-5.6用5美元复刻了

2026-08-09

爆料:哈萨比斯原本要和Jeff Dean一起走!

2026-08-09

这人谁啊?哈萨比斯都让位了

2026-08-06

扫码分享至朋友圈

相关阅读

5G+AI能带来什么新机遇?工业和学术界大咖带来一次深度剖析

未来非常美,但是离它完全能够实现还有一点点的距离。

问耕

2019-05-17

5G

AI

索尼推出全能音乐AI工具:作曲混音编曲都OK!留给人类发挥的空间不多了

索尼喊来一群AI帮音乐人写歌

博雯

2022-01-11

AI

索尼

音乐

美团王兴,中国具身智能第一投资人

爆肝他了背后更有野心的投资版图

衡宇

2025-07-14

AI

Robotics

具身智能

王兴

8B模型做生物实验:实验步骤顺序不乱、剂量无幻觉|ICLR 2026

超越GPT-4o

听雨

2026-05-18

AI

解锁产业互联网新周期,他们都说了什么

梦瑶

2025-12-05

AI

撸猫撸出SOTA!3个00后2个月,造出史上最快流式音视频社交模型

速度快7倍,成本只有Veo 3的1/2000

听雨

2026-06-20

AI

热门文章

突发,Jeff Dean离职创业!谷歌股价应声蒸发1.34万亿

2026-08-06

Artificial Analysis榜单:阿里Qwen3.8Agentic能力得分全球第一

2026-08-06

等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……

2026-08-05

美学升维,流畅突破:荣耀MagicOS11双架构重塑体验

2026-08-06

MiniMax H3登顶开源社区第一,定义视频模型领域“斩杀线”

2026-08-06

关于量子位

加入我们

寻求报道

商务合作

扫码关注量子位

追踪人工智能新趋势,报道科技行业新突破

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司

京ICP备17005886号-1


本文来源:量子位