SciSlopBench 基准出炉:85.9% 识别 AI 生成科学垃圾论文
随着大语言模型开始批量产出学术论文,一个新问题浮出水面:单看每段都像模像样,但串起全文的科学推理却出现断裂。首尔大学与明尼苏达大学的研究团队将这种现象定义为科学垃圾(scientific slop),并在 arXiv 提交论文(编号 2610.00531),发布首个面向整篇论文的基准 SciSlopBench。

SciSlopBench 收录 390 篇 AI 生成的论文,每篇都配对一篇研究问题相同、贡献类型一致的人类论文,这些人类论文均曾被顶级会议录用,因此系统不能靠主题或文笔区分二者。团队从结构、论证、产物三个维度设计六项指标:结构面看跨节引用是否缺失、是否存在宏观冗余;论证面检测主张是否缺乏铺垫、引用是否只是罗列;产物面检查方法图是否塞入无关内容、结论是否缺少具体输入与案例。
在标准配对识别任务中,这套指标以 85.9% 的准确率分辨出 AI 论文,明显高于最强的词元级检测器 Binoculars 的 68.7%,也高于可读全文的 AI 审稿系统。更关键的是,研究发现科学垃圾程度越高,论文的 ICLR 评分越低,且在 2017 至 2025 年每年都能以超过随机的水平区分录用与拒稿,说明这种全文推理痕迹是真实可测的信号。团队还提出 SciSlopHarness 框架,以实验记录为依据引导模型只在有据可依处修订,将 AI 与人类论文的差距再缩小 63%。
这一基准的出现恰逢学术界应对 AI 代笔的关口。arXiv 9 月新增投稿达 40363 篇,较两年前接近翻倍,平台已于 10 月 1 日起限制每位作者每月最多提交两篇。SciSlopBench 给出的启示是:治本方向不应只是文字润色或单纯的 AI 指纹检测,而要把证据严谨性纳入投稿流水线,正如微软研究院近期推出的 Quine 生物学世界模型所展示的,AI 正在科研发现已承担越来越重的角色,相应的可信度校验也必须跟上。
对研究者、期刊与教育机构而言,评估一篇论文的论证是否真的站得住脚正变得和判断文字是否像 AI 写的一样重要。SciSlopBench 的价值不在于给某篇论文贴标签,而在于提供一套可复用的结构化方法:当机器能高速量产看似严谨的文稿,人类把关的重心,理应回到跨章节的逻辑一致性本身。
读者评论 (1)
想参与讨论?请 登录 后发表评论。
论文堆多了,审稿人眼睛都要瞎了