AI能参与审稿,但不能替你做研究

admin 2026-10-04 04:42:12 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 文档探讨AI在科研审稿中的能力边界与风险。AI可高效完成事实核验、代码复现等量化任务,但无法承担学术责任、判断长期价值,且易受对抗性操纵。主张AI全量前置审稿但仅限事实核验,人类终审并建立对抗自动化偏见的制度,量规制定需学术共同体参与。核心结论是AI能做科研中可计算验证的部分,但提出问题、定义价值等核心仍属人类。 综合评分: 85 文章分类: 其他


AI能参与审稿,但不能替你做研究

李林,ds&db 李林,ds&db

NUX战队

2026年10月3日 13:28 广西

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读


“科研真的能AI for吗?,可是大量科研人员都要吃饭啊。。。继续闲聊中”

第一作者评价:

这篇文章太细碎了。列了太多风险、太多边界、太多制度设计,好像非要设计一个完美方案才敢往前走。

但没有完美方案。也不需要完美方案。

核心判断其实只有一条:

AI能做好的事情,人类可以放弃。人类做AI做不了的。

可是就这篇文章探讨的主题来看,AI给的并不能让我满意,尽管我也参与了。可是我还是署名发出来了。


正文来了。


#

先说一个场景

你是一篇论文的作者。投稿后三个月,收到审稿意见。

意见很详细:指出了你方法描述中的三处模糊点,复现了你报告的两个关键实验但发现其中一个性能差距较大,还标记了三条参考文献可能不支撑你的主张。意见最后说:“建议作者补充实验细节,并核实引用。”

你不知道的是:这份意见的初稿,是AI写的。人类审稿人在它基础上做了修改和确认。

你也不知道的是:AI在生成这份意见时,引用了你论文里没有明确写出的一个假设,而这个假设恰好是你实验设计的一个隐含前提。AI没有发现这个假设有问题,人类审稿人也没有。

一致性不等于正确性。AI和人类可能基于同一套错误预设,达成一致误判。

这是AI审稿的第一个根本问题。


AI审稿能做什么

AI审稿最成熟的能力,是事实核验。

  • 查重、引用真实性、图像篡改、统计异常;
  • 代码执行、实验复现、性能对比;
  • 文献检索、新颖性比对、贡献重叠分析。

这些任务有明确的外部锚点,AI可以做得比人类更快、更全、更不知疲倦。

在计算类学科,AI复现已达到可用水平:AutoReproduce实现约94.87%代码执行率,性能差距约19.72%;REPRO-Bench下最优AI智能体端到端复现评估准确率约21.4%,优化后提升至约71%。

但注意:代码能跑通,不等于研究结论可靠。AI复现只能核验数值结果,无法识别选择性报告、p-hacking、因果推断谬误。它是诊断工具,不是判决工具。

人文社科、纯理论数学、质性研究,这套复现流水线基本不可用。理论数学可以用形式化工具校验证明,但人文社科只能做文献核验和文本一致性检查。

结论:AI审稿的适用范围是有代码、可量化、可复现的研究。其他学科只能选择性使用部分模块。


AI审稿不能做什么

第一,不能承担学术责任

最终录用/拒稿必须由人类编辑负责。AI可以建议,但不能承担错误、造假、伦理问题的责任。

第二,不能可靠判断长期价值

AI审稿奖励的是:符合已有量规、可复现、统计干净、不冒犯主流范式的论文。

它不擅长判断:提出真正新问题、挑战共识、进入 messy 的现实、处理伦理和政治、做长期才有结果的研究。

第三,不能避免被对抗

作者可能针对AI审稿优化论文:操纵关键词密度、调整段落结构、隐藏量规偏好。学术出版是开放生态,论文和审稿反馈持续流入训练集,防御是持续军备竞赛,不是一次性工程。

第四,不能替代研究本身

审稿是判别,研究是生成。

审稿有外部锚点:论文、代码、数据、文献。研究是开放任务:问题本身还没有答案,方法还没有被设计,证据还没有被生产。

AI擅长“检查、验证、比较、找缺陷”。科研核心是“提出问题、定义价值、设计新方法、解释意外、承担风险”。

裁判再懂规则,也不能替球员踢出比赛。


如果AI写、AI审、AI改、AI评,会发生什么

会形成一个自产自审闭环。这个闭环可以无限运转,但它的目标函数是“通过AI审稿”,而不是“发现真理”。

后果是:

  • 同质化:所有论文优化同一套AI审稿偏好;
  • 指标游戏:作者针对AI量规优化,而不是针对真实问题;
  • 回音室:AI生成内容进入训练数据,模型崩溃,知识退化;
  • 责任真空:AI不能承担学术责任;
  • 论文通胀:AI无限生成论文,人类注意力被淹没。

更根本的是:审稿判断“是否达到发表门槛”,研究判断“是否值得做”。后者没有统一量规。


谁来决定AI审稿的量规

这是文档之前没有触及的问题。

AI审稿不是技术中立。它背后是一套量规,而量规是人定的。

  • 谁决定“新颖性”怎么定义?
  • 谁决定“分析深度”怎么量化?
  • 谁决定哪些缺陷是“致命”的?
  • 谁训练和校准模型?
  • 谁承担模型偏见的后果?

这些问题不是“技术边界”能涵盖的,它们涉及学术出版中的权力分配。

如果AI审稿的量规由少数大型出版商或技术公司制定,那么学术评价的标准就会向这些机构的偏好倾斜。非英语研究、小众方向、批判性研究,可能被系统性地低估。

AI审稿的合法性,不能只靠技术性能来证明。它需要学术共同体的参与和问责。


人类终审到底怎么做

文档说人类审稿人“逐条核验证据”。但这在现实中意味着什么?

如果AI证据包有50页,人类审稿人只有2小时,他凭什么“逐条核验”?如果AI标记了10个问题,人类审稿人只深入看了3个,剩下7个默认采信,这算“终审”吗?

自动化偏见的风险是真实的。人类审稿人倾向于采信AI整理好的证据,尤其是当证据包看起来很专业、很全面的时候。

对抗自动化偏见,需要具体的制度设计:

  • 强制质疑点:AI证据包必须包含“本结论依赖的关键假设”,审稿人必须对这些假设逐一表态;
  • 随机复核:系统随机抽取AI标记的问题,要求审稿人独立复核,复核结果与AI不一致时触发进一步审查;
  • 分歧记录:审稿人不同意AI判断时,必须写明理由,理由进入审计日志;
  • 时间保障:如果AI证据包超过一定篇幅,审稿人审稿时间必须相应延长,否则系统拒绝接收审稿意见。

这些制度设计不是技术问题,而是学术治理问题。


很多研究害怕AI,不只是因为脱离现实

有一种流行观点:害怕AI的研究,本质是脱离现实的文本型工作。这个判断有部分道理,但不够完整。

学界对AI的警惕分为两类:

第一类:高度模板化、以发表为唯一目标的研究,确实容易被替代。

研究问题从文献缝隙中来,方法模板化,结论不进入现实检验,评价标准是期刊等级和引用数,写作有固定八股。这类工作的核心产出是文本,AI可以高效生成同类成果。

第二类:严肃研究者对学术系统风险的合理担忧。

  • 版权与训练数据风险;
  • 学术马太效应加剧,经费充足的团队使用更强AI工具;
  • 模型偏向主流范式、英文成果,低估小众方向;
  • 隐性造假难以识别,精巧的数据操纵隐藏在看似干净的实验结果内;
  • 评价过度量化,挤压思辨类、长期探索型研究。

这两类恐惧不能混为一谈。把第二类也归为“研究脱离现实”,是一种价值独断。


科研真的能AI for吗?

要回答这个问题,得把“AI for Science”拆成三层。

第一层:AI作为工具

这是最成熟、最没有争议的一层。

文献检索、数据分析、实验设计优化、模拟仿真、图像识别、代码生成,AI已经在这些环节大规模使用。AlphaFold、材料筛选、药物分子生成,都属于这一层。

这一层已经真实发生,而且不可逆。

第二层:AI作为合作者

AI开始参与假设生成、实验设计草案、论文初稿、内部评审、复现验证。

这一层部分可行,但必须有人类终审。AI可以提出候选假设,但无法判断哪个假设值得投入三年去验证。AI可以设计实验,但无法判断这个实验是否符合伦理、是否值得做。

第三层:AI作为自主科学家

这是“AI for Science”口号最激进的理解:AI自己提出问题、自己设计实验、自己解释结果、自己写论文、自己审稿,形成闭环。

这一层只在极窄的可形式化领域有部分可能,比如数学猜想搜索、算法优化、形式化证明、封闭规则下的博弈、有明确目标函数的分子筛选。

一旦进入开放世界、现实干预、伦理判断、因果解释,这一层就基本不成立。

所以,科研可以AI for,但不能AI替。

AI for的是科研中可计算、可验证、可规模化的部分。科学的核心——提出问题、解释意外、承担风险、赋予意义——仍然是人。


真正不可替代的研究,扎根于无法完全形式化的现实

现实世界包含复杂经验、人的处境、不可逆决策、意外异常、长期连锁后果。

这类研究要求研究者进入现场,承担风险,做出价值判断,并为错误承担责任。

AI可以辅助证据收集,但无法承担这份责任,也无法定义研究的意义。


结论

  1. AI审稿应全量前置,但仅限于事实核验环节:合规筛查、文献比对、代码复现、多智能体交叉质询。完整流水线仅适用于量化实验与形式化学科;人文社科仅可使用部分文本核验模块。
  2. AI输出结构化证据包,清晰区分事实、推断、不确定性;不输出单一录用/拒稿分数作为最终结论。
  3. 人类审稿人承担终审判断,从重复的事实核查中解放,聚焦价值判断、争议仲裁、伦理风险评估。同时建立对抗自动化偏见的具体制度。
  4. 编辑掌握最终裁决权,配套完整申诉与AI推理审计机制。
  5. AI不能替代原创科研:它可以辅助生成论文,但无法判断什么问题值得探索。
  6. AI审稿的量规制定权,必须由学术共同体参与,不能由少数技术公司或出版商垄断。

一句话:AI负责大规模检索、核验、复现与文稿打磨;人类负责定义问题、判断价值、承担学术责任、仲裁争议。

但还有一个问题没有回答:当AI审稿成为学术出版的基础设施,谁来决定这套基础设施的规则?

这个问题,不是技术能回答的。

注:ds为deep seek,db为豆包。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。

本文转载自:NUX战队 李林,ds&db 李林,ds&db《AI能参与审稿,但不能替你做研究》

安全工作的本质 网络安全文章

安全工作的本质

文章总结: 本文探讨安全工作的本质,指出管理本身就是服务的载体,服务是管理的目的。安全管理通过边界、漏洞、权限和应急管理提供确定性,将不确定风险转化为可控流程。
评论:0   参与:  0