大数跨境

AI让写论文变便宜,限流的arXiv,挡住了谁又放过了谁

AI让写论文变便宜,限流的arXiv,挡住了谁又放过了谁 AI驱动数字化转型
2026-10-06
3
导读:限流拧的是水龙头,不是水管。4万篇稿子背后站着的那300个人,才是这套系统真正的限速环节。要让系统撑得住,得有人先回答账怎么算,验证的成本,最后会记在谁的头上。
40363篇稿子,摆在300来个不领工资的人面前。arXiv上个月的单月投稿量,创了它建站以来的纪录。要看懂这个数字的分量,得把三个九月摆到一起看。
2016年9月,它收了9869篇。八年过去,涨到20569。再走两年,这个数直接跳到40363,前八年涨的量,后两年又涨了一遍。
跑得最快的是人工智能分类,两年间cs.AI的投稿量涨到原来的六倍以上,其余分类同期翻倍。
二十多年前,这还只是物理学家互相传预印本的角落,如今它已经是全球科研人员每天都要路过的地方。
10月1日,arXiv给所有投稿账号上了一道闸。
每个自然月最多投两篇,同时留在活跃状态、还没走完流程的稿子不能超过三篇。被拒的也算数,因为占掉审核员时间的是投稿,不是最后上线的那一篇。
闸门挡住的不是稿子,是越拉越开的速度差。
一条线是产出一篇论文的成本,这一头正在往零掉,一年比一年便宜。另一条线是判断一篇论文的成本,它一动不动。在人工智能出现之前,这两条线是黏在一起的,几乎没有分开过。
写出一份像样的东西要花上几个月,这意味着想糊弄一份像样的东西,代价也差不多。
学术界那点脆弱的信任,一直是用写作的代价垫着的。
读的人不必逐条去核实,因为成本已经替他筛过一遍。
这道筛子没写进章程,却是体系的承重墙。
大模型把这道墙抽掉了一半。写这件事变便宜了,判断这件事没有跟着便宜。核对一条参考文献是不是真存在、一张图里的数字能不能复现,这些活还得人来做。
一段实验描述背后有没有真的代码,同样得有人去翻。这些事一分钟都省不下来。
更麻烦的地方在于,判断一篇文章值不值得发,本身就没有标准答案。
审核员要看的是选题有没有分量、结果是不是新的,这类判断没有可以照着比对的口径。模型能把编出来的参考文献揪出来,却判不了轻重。
arXiv的立命之本是先发,不是评审。稿子在上线之前只走一道审核,看的也只是形式,比如合不合规范,分类放得对不对。
这个只筛形式、不问分量的定位,是它立身的本钱,也是它今天难受的根源。AI最擅长的事,恰好就是量产形式合格的东西。
这些活只有300来个人干,还是义务的。
官方的说法是,近来窄而薄的论文明显多了,整段由大模型铺出来的稿子也多了。守住这道关口的全部人力,是大约300名各领域的研究者。
今年9月这4万篇稿子,给他们带出了将近9000张工单。把9000张工单摊到4万篇稿子上,差不多每四五篇就要人工过问一次。
这个量搁在一个靠义务劳动撑着的系统里,是撑不住的。
闸门压得住多出来的那块,斜率压不住。
4万篇里本来就有相当一部分是冲着多挂几篇去的,入口一收,他们会换条路挂上来。而老老实实做研究的那批人,只能排在这些人后面。
PART 01
香肠论文的困局

香肠论文的算法并不复杂。
同一批数据、同一个实验拆成三篇,每篇补一块分析就成。以前这么干,容易在审稿环节被抓出来;现在有大模型帮着铺字数、补文献,把一篇拆成三篇,几乎不花额外力气。
编辑咨询委员会主席Thomas Dietterich把话说得很直,麻烦来自那一小撮人,他们往外倒低质量论文,把审核员的时间吃掉了一大块,结果是老老实实做研究的人,要替这些人多等几天,甚至几周。
这句话的分量全在后半句。
被挤出去的从来不是刷稿的人,是排队的人。
一个审核员要否掉一篇稿子,得先走一遍判断,再写一段说明。要是作者不服,后面还有申诉要接。这些动作没法批量做,也没法丢给模型做。
稿子翻倍,这些动作也跟着翻倍,而做这些动作的人一个都没多。
积压也不是十月才有的。8月17日,Dietterich就公开讲过AI相关分类稿子堆积、发布变慢。
两个月后,平台动手的地方,是入口。
这把刀不只砍在人工智能身上。cs.AI涨得最快,可限流对所有投稿人、所有学科一起生效,物理和数学的人也在同一道口子里面。

PART 02
钱买不来志愿者

这一回真正缺的东西,其实并不是钱。
9月23日,arXiv公布了一笔多年期的捐赠,总额1720万美元,出钱的是三家慈善机构,钱分三到五年到账,其中一块指名投给管AI生成内容的技术。
它今年7月1日才刚从康奈尔大学独立出来,成为一家非营利组织,这笔钱是它单飞之后的第一笔底气。
钱能买来工具和服务器。志愿者它买不来。
新工具从开发到上线要时间,而愿意每周拿出几个小时替陌生人看稿子的人数,不会因为账上多了几个零就涨起来。
守门人的产能,是这套系统唯一扩不动的。
瓶颈扩不动,能动的就剩入口,偏偏入口这件事,arXiv掐得不准。稿子递进系统的那一瞬间,arXiv手里能确认的身份只有一个,就是按下提交键的这个人。
作者名单由提交人填,共同作者要事后拿到论文密码,然后在系统里认领,才会和自己的工作记录挂上钩。帮助页写得很清楚,稿子第一次交上去时,提交人是它唯一的主人。
所以限额只能落在点下提交键的那个人头上。官方问答把话说满了,所有限额只针对提交人,你替几个合作者交一篇,只算你的,不算他们的,合作者要自己协调。
平台自己也知道这把尺子粗。官方说得很明白,交上去才发现问题不要紧,只要还没正式公开,作者可以自己把稿子删掉,这一篇既不算月度名额,也不占在审名额。
官方还保留了一条,必要时可以要求某些作者先建立常规发表记录,把投稿限制在已经过同行评审的稿件上。

将就的规则:漏了一部分,也护了一部分
同样是把人数管住,会议的办法细得多。
ICLR 2027今年的线是这样划的,一个作者的名字最多出现在20篇投稿上;要是整篇论文找不到一个有审稿资格的作者,每人就只剩一个名额。
它敢按人头计数,底子在于每位作者在OpenReview上都挂着一个账号,名字和身份对得上。arXiv没有这样一层底层身份,只能退回到提交人这一格。
这个将就出来的口径,一边漏,一边也躲开了一个旧毛病。漏的地方,评论区很快就有人点出来。合作者轮流上传,限制就绕过去了。
三个人轮着交,一个月就是六篇,而真正该被管住的那类人,一个人一年照样能发24篇单作者的低质量论文。
躲开的地方在另一头。
按人头计数的会议上,导师要是投得太多,学生的论文可能被连带拒掉。arXiv只认提交人,学生自己交的稿子不会受导师牵连。
代价落在没有合作者的人身上。
独立研究者没人替他分担,每月两篇就是硬顶。另一头的门也在收,1月21日起,新人光挂机构邮箱已经不算数,还得名下在这个领域有过被收录的论文。两条凑不齐,就只能请一位老作者出面替他背书。
而这两拨人最需要的,恰恰是一块不问出身、能先把成果挂出来的地方。

PART 03
正在收窄的门

团队的分工也得跟着挪。
设想一个组有六篇稿子等着公开,以前找一个人几天之内陆续传完就行,现在同一个账号一个月只能交两篇,还压着三篇在审的天花板,至少要三个人分头提交。
把arXiv这一年的动作排成一行,还能看到另一条线。去年10月底,它要求计算机领域的综述和立场论文,必须先被期刊或者会议接收、完成同行评审才能上传。
今年1月,背书的口径改过一道,光有机构邮箱不再算数。今年5月落地的是更狠的一条,稿子里要是混进了编造的引用,或者留下没清掉的模型指令,作者直接封一年。到10月,是限流。
每一条单拎出来都站得住,合起来看,是一条从谁都能进、慢慢滑向先看资历的轨迹。而arXiv能替一部分期刊把成果先亮出来,靠的恰恰就是那道谁都能进的门。
门一道一道加回来,它的身份也就跟着变了。
审核政策里还埋着一句,谁要是被拒过、被拖过,他后面的稿子会被盯得更紧,也更容易被卡在那儿。被卡住的稿子只要没走完,就一直算在三个在审名额里面。
被卡住一篇,后面每一篇都要多扛一层。
会议那边同样在承压,数字还更难看。
ICLR 2027的摘要登记破了6万,比它2013年到2026年14届加起来的投稿总量还多,上一届是19525。
有研究者看完这个数,说同行评审已经死了。
投稿那一端,也不是唯一被污染的地方。
ICLR 2026的75800条审稿意见里,有15899条、约21%被判定完全由AI生成,另有199篇论文被认为整篇出自AI之手。
守门的人自己也在被AI填进来,这件事比投稿量暴涨更让人心里没底。
PART 04
找不到平衡点的过渡

加规则这件事,也并不是没有人反对。
上一轮审核新规出来的时候,Nathan Lambert写过一篇明确的反对文。
他的判断是,arXiv的审核本来就因为人手不够而形同虚设,真遇上争议时更像个不透明的黑箱,让发表变得没法预期。
他主张的方向是反过来的,去做那个谁都能放东西的平台。这话和限流是两个方向,可它也未必就是错的。
arXiv把这一轮限流定位成过渡措施,等找到更合适的做法,也许会放宽,甚至取消。过渡这个词是有前提的,前提是有一个新的平衡点会被找到。
可那个点不会自己冒出来。生成的成本还能一降再降,核对的成本降不下来,这个缺口在每一次模型升级之后都会重新裂开一次。
真正让人心里发紧的,是这条曲线还看不到要拐弯的迹象,这一个月多出来的4万篇还在其次。工具的下一个版本会更便宜,也会写得更像。
限流拧的是水龙头,不是水管。
4万篇稿子背后站着的那300个人,才是这套系统真正的限速环节。要让系统撑得住,得有人先回答账怎么算,验证的成本,最后会记在谁的头上。

【声明】内容源于网络
0
0
AI驱动数字化转型
专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
内容 1100
粉丝 1
AI驱动数字化转型 专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
总阅读12.5k
粉丝1
内容1.1k