同行评审与学术出版
同行评审与学术出版近二十年的变化,是把一个封闭的“接收/拒绝”决定拆成身份、评语、版本、市场、劳动和完整性网络。第一幕讨论双盲、开放试验、审稿训练、巨型期刊、发表偏差、掠夺性出版、发表后评议和审稿信用;第二幕把预印本、透明评审、操纵环、审稿负担、编辑多样性、可携带评审、钻石开放、转换协议、论文工厂、AI辅助审稿、大模型评语和版本化出版连接起来。
2006—2016年前后的共同动作,是让评审制度本身成为研究对象。身份是否可见、训练是否有效、结果是否选择、期刊是否真实评审、发表后谁能纠错,开始有可复核读数。
甲、双盲评审:隐藏身份能否减少声望与性别偏差Double-blind Peer Review
当时真正卡住研究的并非材料不足,而是单盲评审让审稿人看见作者,默认专业判断能隔离名望、机构和身份。实验与自然变化表明,标签可能影响接收与评语,从被忽略的边界回看,“被编辑初筛拒绝、身份被猜中及因匿名改写而损失的信息”是否有机会成为正式对象,若它们在入表前即被排除,后续平均与排名便无法说明整体。
把修辞删掉后,核心命题只剩本条声称,决定身份偏差的只有审稿时可见线索,而不是审稿人自报公正。双盲通过改变信息结构检验这一点,这项命题最需要承担的证伪风险是,先否定“评审测量不会改变作者写作与审稿人推断身份”并重算匿名条件下群体接收差异/单盲条件下群体接收差异,只有结果仍能由同一机制解释,原命题才没有借用未说明的前提。
原研究允许复算的地方在于WSDM 2017在500篇投稿上同时分配2名单盲与2名双盲评审,最终接收率15.6%。单盲审稿人给顶尖公司作者更高推荐的优势比为2.10,著名作者1.63,顶尖高校1.58;女性作者优势比0.78,但未达到统计显著,原始材料给出了一条可追踪的修订轨迹,首篇材料由Budden AE, Tregenza T, Aarssen LW, et al(2008)承担,反方向证据来自Tomkins A, Zhang M, Heavlin WD(2017),而Cox AR, Montgomerie R(2019)提供较新的对象或规则,因而不能只引用其中最有利的一笔。
真正的反例不是“效果较小”,而是题目、引用与方法可暴露身份,自我引用删除也会损害可读性;不同领域研究结果不完全一致。双盲不能处理选题与编辑邀请偏差,一旦把失败对象纳入,“当作者为隐藏身份删除必要背景时,匿名程度越高,评审质量反而可能下降”会把表面改进翻转为制度性损失,因而失效条件应进入摘要和决策表。双盲研究承认身份可被猜出;期刊政策却常把“double blind”当成偏差已消除。
本条把“谁来承担失败”从伦理问题变成了数据字段:期刊应记录匿名成功率、猜测身份、不同群体接收和评语差异,并与编辑初筛分开。是否采用应按领域可识别性与偏差证据决定,实践端最先需要改变的不是宣传语,应在规则公布前、实施初期和参与者完成适配后分别重算匿名条件下群体接收差异/单盲条件下群体接收差异,用时间断点区分真实改变与策略回应。
跨组引用在这里承担检验功能:它与第494号第13条的专业性偏差对撞:一个遮蔽身份线索,一个要求行为证据;若匿名后差异仍在,偏差可能来自选题规范或语言风格,沿着“实验设计称“盲法”,人事评价称“去标签审查”;另见第494号第13条”这条外部线索,应保留各自的分子、分母与对象边界,再判断匿名条件下群体接收差异/单盲条件下群体接收差异能否换算,名称接近本身不构成证据。
乙、开放评审试验:署名与公开是否改善评语Trials of Open Peer Review
早先的评价链把“有记录”当作“已解释”,于是封闭评审保护审稿人,却使质量与权力不可见。早期试验把身份、评语或公众评论逐项开放,把这段发生史展开,需要先查清“拒绝公开、退出试验、未获公众评论及被编辑删去的评语”被谁、依据什么规则排除,因为入口变化足以把同一制度写成完全不同的历史。若把本条带入高风险决策,至少要写明谁生成、解释、使用并纠正达到质量标准的公开评语数/全部公开评语数,若没有可追责主体,再精细的统计也不能支持制度判断。
在相同对象、同一窗口和相同边界下,它声称本条把决定性路径锁定为开放组件怎样改变审稿人的参与与文字,而不是“开放”二字。身份公开、评语公开和开放参与必须分开测,把隐藏假设放到台面后,先否定“公开试验不会改变审稿人构成与行为”并重算达到质量标准的公开评语数/全部公开评语数,只有结果仍能由同一机制解释,原命题才没有借用未说明的前提。
将材料放回发表年份,最稳妥的读法是BMJ试验把125篇稿件的审稿人随机为署名或匿名;编辑获得113篇的双评分,作者获得105篇评分。署名请求使拒审概率高12个百分点(95%置信区间0.2—24),但没有改善评审质量、建议力度或完成用时,从首篇工作到最近更新,首篇材料由Nature(2006)承担,反方向证据来自van Rooyen S, Godlee F, Evans S, Black N, Smith…(1999),而Ross-Hellauer T(2017)提供较新的对象或规则,因而不能只引用其中最有利的一笔。
本条最危险的误用发生在礼貌不等于有效,弱势审稿人更担心报复;公开评论可能吸引非专业攻击。不同组件与学科需独立比较,这条思想留下的自我约束表明,“当具名要求增加职业报复风险时,开放度越高,早期职业者接受邀请的比例反而可能下降”会把表面改进翻转为制度性损失,因而失效条件应进入摘要和决策表。早期试验并未证明公开身份提高质量;开放倡议仍需诚实面对零效应与参与成本。
在教学、评审或公共服务现场,本条要求期刊应报告邀请接受率、评语错误发现、礼貌、作者申诉和职业阶段差异。开放必须基于审稿人知情同意,为了避免只记录账内成功,应在规则公布前、实施初期和参与者完成适配后分别重算达到质量标准的公开评语数/全部公开评语数,用时间断点区分真实改变与策略回应。
接口判断不靠“都很重要”,而靠两个量纲是否能够互换:它与第496号第12条的开放同行评审对撞:诚信面板强调可审计,出版面板强调供给与激励;透明增加但拒审上升时需权衡,与邻近面板并读时,应保留各自的分子、分母与对象边界,再判断达到质量标准的公开评语数/全部公开评语数能否换算,名称接近本身不构成证据。
丙、审稿培训:经验不自动等于高质量Training Peer Reviewers
这条线索之所以在2007年前后立住,是因为它揭开了一个被当作背景的选择:编辑通常凭主题专家身份邀请,默认会研究就会审稿。评语却在结构、建设性和方法检查上差异巨大,沿着旧制度的入口追踪,需要先查清“拒绝训练、未被再次邀请及质量差但未获反馈的审稿人”被谁、依据什么规则排除,因为入口变化足以把同一制度写成完全不同的历史。
这条理论把解释义务交给本条声称,决定评审质量的只有针对任务的训练、反馈与校准条件,而不是职称。培训应让审稿人看见标准与实例,这一主张可以用一次直接反事实检验,用相同对象、时间窗与排除规则比较两种制度版本,若训练后达到预设质量且持续一年的审稿人数/全部完成训练者数方向不稳,就应把结论降为情境性判断。
主研究的贡献首先是一张可审计的账:BMJ先评估1,256名审稿人,609人(48%)同意参加。自学组审稿质量均值2.85,对照2.56,差0.29(95%置信区间0.14—0.44),低于编辑预设0.4门槛,6个月后优势消失;面对9个重大错误,培训组平均找出3.14/2.96个,对照2.13个(p<0.001),把摘要结论拆回来源,首篇材料由Callaham ML, Tercier J(2007)承担,反方向证据来自Schroter S, Black N, Evans S, et al(2004),而COPE(2017)提供较新的对象或规则,因而不能只引用其中最有利的一笔。在迁移到另一机构之前,至少要写明谁生成、解释、使用并纠正训练后达到预设质量且持续一年的审稿人数/全部完成训练者数,若没有可追责主体,再精细的统计也不能支持制度判断。
本条自己承认的弱点说明一次在线课程难改变领域知识,标准答案也会压制多样判断;质量评分由编辑给出,可能带主观性,从应用风险看,“当完成证书成为邀请条件时,培训覆盖越高,机械合规评语反而可能增加”会把表面改进翻转为制度性损失,因而失效条件应进入摘要和决策表。随机试验对短培训效果谨慎,说明培训不是魔法;平台却常以完成率证明能力。
截至2026年,最值得检查的落地读数是期刊应提供真实匿名案例、方法清单、编辑反馈和共审稿学习,按错误发现与建设性复测,而非只发证书,把结论转成治理动作时,应在规则公布前、实施初期和参与者完成适配后分别重算训练后达到预设质量且持续一年的审稿人数/全部完成训练者数,用时间断点区分真实改变与策略回应。
因此,本条的边界可借下列外部读数再次检验:它与第494号第19条的心理安全对撞:培训教会批评,编辑环境决定批评是否安全;没有不报复与有理由裁决,训练会退化为格式,同一动作换一套学科语言后,应保留各自的分子、分母与对象边界,再判断训练后达到预设质量且持续一年的审稿人数/全部完成训练者数能否换算,名称接近本身不构成证据。
丁、大型综合期刊:只审科学可靠性Mega-journals and Soundness-only Review
长期以来,制度把下列差异压成同一格:传统期刊把可靠性、新颖性和预期影响混在一次决定中,编辑会拒绝稳健但不够“兴奋”的结果。PLOS ONE分离可靠与重要,从对象如何被登记来看,需要先查清“初筛拒绝、发表后无人阅读和可靠但因费用未投稿的研究”被谁、依据什么规则排除,因为入口变化足以把同一制度写成完全不同的历史。
与旧解释相比,这项转向把立场明确为本条声称,决定准入的只有科学与伦理最低标准,而不是编辑对未来引用的预测。发表后使用、评论和引用再形成注意,判断它是否站得住,不必依靠赞成态度,用相同对象、时间窗与排除规则比较两种制度版本,若发表后无重大方法纠正的论文数/全部抽样发表论文数方向不稳,就应把结论降为情境性判断。
决定本条能否站住的,是原始材料中的读数而非口号:PLOS ONE在2013年发表约31,500篇文章,单刊即占当年Web of Science论文约3%;其筛选只判断方法与结论是否合格,不以编辑预估的“重要性”作门槛。随后发文量回落,说明规模仍受投稿流、处理能力与费用共同约束,把文献按时间排开,PLOS ONE(2006)给出可核对起点,Björk BC(2015)使原结论不再无条件成立,Spezi V, Wakeling S, Pinfield S, et al(2017)展示问题在新环境中的延伸,时间顺序本身就是证据。
研究共同体随后发现,方向会在以下条件下改变:“只审可靠”仍需判断分析与解释,标准并不低;高量提交增加审稿负担和质量差异。APC商业模式也可能诱发规模扩张,比效应大小更重要的是,“当APC与发表量直接关联时,规模越大,边缘稿件的质量控制反而可能下降”会把表面改进翻转为制度性损失,因而失效条件应进入摘要和决策表。巨型期刊标准明确不是“不审”,却常被误读为低门槛;出版者也可能利用模糊性追求量。
这项思想的价值还表现在它重写了期刊应公布拒稿原因、编辑负载、纠正与撤稿,并抽样复核可靠性。不可用接收量代替科学服务,机构真正需要新增的是,应在规则公布前、实施初期和参与者完成适配后分别重算发表后无重大方法纠正的论文数/全部抽样发表论文数,用时间断点区分真实改变与策略回应。从长期效应而非宣布时点看,至少要写明谁生成、解释、使用并纠正发表后无重大方法纠正的论文数/全部抽样发表论文数,若没有可追责主体,再精细的统计也不能支持制度判断。
这一比较给出清楚的分工判据:它与第493号第5条DORA对撞:DORA反对期刊声望代理,巨型期刊取消重要性门槛;若机构仍按刊名评价,模式优势无法兑现,为了判断两边是否真在谈同一件事,应保留各自的分子、分母与对象边界,再判断发表后无重大方法纠正的论文数/全部抽样发表论文数能否换算,名称接近本身不构成证据。
戊、发表偏差与结果选择:阴性研究为何消失Publication Bias and Result-dependent Selection
在2010年的争论里,最先暴露的漏洞来自期刊偏爱阳性、新奇和整齐故事,作者也选择性提交。未发表研究不在数据库,却改变所有已发表比例,若把早期样本重新分类,需要先查清“未提交、编辑拒绝、作者放弃和注册后未完成的合格研究”被谁、依据什么规则排除,因为入口变化足以把同一制度写成完全不同的历史。
本条的锋利处在于拒绝平均分担责任:本条把决定性路径锁定为结果是否影响提交、审稿和发表,而不是单篇统计是否正确。选择发生在多个闸门,把解释责任压到可观测结果上,用相同对象、时间窗与排除规则比较两种制度版本,若被发表的阴性或零结果数/全部完成且方法合格的阴性或零结果数方向不稳,就应把结论降为情境性判断。
本条的实证责任由以下观测承担:Fanelli汇总2,434篇检验假设的论文,其中2,045篇(84%)报告完全或部分支持。相对空间科学,心理学/精神病学及经济/商业论文报告阳性结果的优势约5倍;社会科学相对物理科学约2.3倍,人类行为研究相对非生物物理化学研究约3.4倍,从三笔材料的责任分工看,Fanelli D(2010)给出可核对起点,Nosek BA, Spies JR, Motyl M(2012)使原结论不再无条件成立,Chambers CD, Tzavella L(2022)展示问题在新环境中的延伸,时间顺序本身就是证据。
边界一旦触发,就不能继续用原名称汇总结果:灰色文献检索不完整,阳性比例也受真实效应与问题选择影响;并非所有阴性结果都值得发表。关键是方案质量而非机械对称,把限制写进主结论后,本条只在没有触发“当期刊只宣传阴性发表比例时,数量越高,低价值机械结果反而可能挤占重要的失败研究”时保留原方向。发表偏差文献承认未发表分母不可直接观测;期刊却常用已发表构成证明无偏。
组织一旦采用本条,必须同时处理期刊与资助者应追踪注册项目的提交、拒绝、未完成和发表,公开结果方向与决策。综述需检索注册表和数据,在审计或复盘中,应在规则公布前、实施初期和参与者完成适配后分别重算被发表的阴性或零结果数/全部完成且方法合格的阴性或零结果数,用时间断点区分真实改变与策略回应。
本条不是孤立命题,它与下列已发布面板形成方向相反的对照:它与第496号第6条注册报告对撞:注册报告改前置闸门,本条追踪全路径选择;若阶段一拒稿仍偏好时髦问题,偏差只是前移,本条的外部边界可由另一套账本检验,应保留各自的分子、分母与对象边界,再判断被发表的阴性或零结果数/全部完成且方法合格的阴性或零结果数能否换算,名称接近本身不构成证据。
己、掠夺性出版:形式像期刊却不履行评审Predatory and Pseudo-journals
本条进入第一线,是因为旧账本无法同时容纳开放获取扩张中出现大量伪期刊,模仿正规名称、隐藏费用、快速接收。作者尤其在评价压力和信息不足时受害,在第一次统计之前,需要先查清“被冒名、已变质、无长期保存及作者付费后才得知条件的期刊”被谁、依据什么规则排除,因为入口变化足以把同一制度写成完全不同的历史。
它给出的可反驳命题是:本条声称,决定期刊可信度的只有评审、编辑、费用、所有权、索引和保存可被核对的条件,而不是是否收APC,其排他性可以从一个替代口径开始检验,用相同对象、时间窗与排除规则比较两种制度版本,若经抽样证实履行真实评审和保存的期刊数/全部声称同行评审的抽样期刊数方向不稳,就应把结论降为情境性判断。
证据链中最有辨别力的并非显著性星号,而是Shen与Björk估计掠夺性期刊发文量由2010年的53,000篇增至2014年的420,000篇,分布在约8,000种活跃期刊;综合类约162,000篇、工程约97,000篇、生物医学约70,000篇。增长规模说明形式审查能够被工业化复制,证据链并非三次重复背书,Beall J(2012)给出可核对起点,Bohannon J(2013)使原结论不再无条件成立,Shen C, Björk BC(2015)展示问题在新环境中的延伸,时间顺序本身就是证据。对尾部群体单独复算时,至少要写明谁生成、解释、使用并纠正经抽样证实履行真实评审和保存的期刊数/全部声称同行评审的抽样期刊数,若没有可追责主体,再精细的统计也不能支持制度判断。
若删去失败样本,本条会显得比原证据稳定得多:单一黑名单有误伤、法律与更新问题;新兴地区期刊可能资源有限但诚信。白名单也会被冒用,反向情形不是附录里的免责声明,本条只在没有触发“当名单成为唯一合规依据时,入榜期刊越多,冒用与过期认证反而更难发现”时保留原方向。掠夺性研究承认定义与名单有边界;机构培训却常把复杂判断缩成“查名单”。
应用层不应只复制结论,而应保留机构应教作者核查编辑、同行评审、费用、DOI与保存,采购数据库需持续审计。评价制度降低“必须发表”压力,落实到组织程序,应把“被冒名、已变质、无长期保存及作者付费后才得知条件的期刊”与正式样本并列,并说明它们是否改变经抽样证实履行真实评审和保存的期刊数/全部声称同行评审的抽样期刊数,否则制度只能证明被保留下来的对象有所改善。
把本条与已发布近邻并读,可以看到它与第492号第18条的合格评定对撞:期刊认证像产品合格,但出版生态变化快;一次入库不能永久证明过程,把双方读数放在同一时间窗内,应保留各自的分子、分母与对象边界,再判断经抽样证实履行真实评审和保存的期刊数/全部声称同行评审的抽样期刊数能否换算,名称接近本身不构成证据。
庚、发表后评议:论文发表只是审查开始Post-publication Peer Review
此前的报告习惯让一个关键对象消失了:传统评审结束于接收,少数审稿人不可能发现全部问题。网络平台让更广共同体检查已发表材料,与其把差异归为偶然,需要先查清“无人关注、评论被删、作者未回应及期刊处理但未链接的论文问题”被谁、依据什么规则排除,因为入口变化足以把同一制度写成完全不同的历史。
只有把以下主张单独放上检验台,转向才有意义:本条把决定性结果锁定为具体可核验评论是否触发作者、期刊或机构回应,而不是评论数量。发表后评议是纠错路径,若要把它与一般倡议区分开,用相同对象、时间窗与排除规则比较两种制度版本,若在规定时限获实质回应的可核验评论数/全部可核验重大评论数方向不稳,就应把结论降为情境性判断。
这组结果之所以能改变领域,是因为PubPeer自2012年积累大量论文评论,图像侦查促成更正与撤稿。Bik等系统检查图像显示众包专业观察能发现跨论文模式,若把提出、异议与更新分别阅读,PubPeer Foundation(2012)给出可核对起点,Bik EM, Casadevall A, Fang FC(2016)使原结论不再无条件成立,COPE(2019)展示问题在新环境中的延伸,时间顺序本身就是证据。
这一思想最需要防止的,是把范围收窄误写成普遍法则:匿名评论可能不礼貌或误指,期刊回应缓慢;平台用户集中于可见学科。评论存在不等于结论已错,后续争论真正要求修改的是,本条只在没有触发“当评论数量被用作风险分时,关注越多的高影响论文反而越可能被误判为质量更差”时保留原方向。平台明确允许匿名与讨论,不把评论本身判为不端;外部数据库却可能机械标红。
制度层面的连带后果很具体:评论应指向具体图、数据与方法,平台提供作者回应和举报;期刊设公开处理时限并链接更正。评价不得把有评论等同不端,若将这项转向用于真实决策,应把“无人关注、评论被删、作者未回应及期刊处理但未链接的论文问题”与正式样本并列,并说明它们是否改变在规定时限获实质回应的可核验评论数/全部可核验重大评论数,否则制度只能证明被保留下来的对象有所改善。
真正有检验力的外部参照不是同义概念,而是它与第478号第11条的众包核验对撞:信息完整性强调快速验证,本块强调正式纠正责任;群众发现必须接入期刊和机构程序,把本条放到相邻领域中,需要先核对“参与发表后评议者可以自行判断评论的最终科学效果”是否在两边都成立,若一边把它当条件、另一边把它当结果,差异正是新的解释入口。
辛、审稿信用:把不可见劳动带入职业记录Reviewer Recognition and Credit
从发生史看,最要紧的改变是停止把下列现象视作例外:审稿长期匿名无报酬,机构评价几乎不见。Publons与ORCID让期刊验证审稿记录,提供职业信用,真正改变比较结果的起点是,需要先查清“被拒评语、未采用建议、保密期刊和无法验证的公共审稿劳动”被谁、依据什么规则排除,因为入口变化足以把同一制度写成完全不同的历史。将最新材料与早期证据并置,至少要写明谁生成、解释、使用并纠正获得期刊验证且有质量反馈的审稿数/全部登记审稿数,若没有可追责主体,再精细的统计也不能支持制度判断。
若必须只保留一个决定量,本条选择本条声称,决定审稿供给可持续性的只有劳动得到可信认可与工作量承认,而不是学者无偿奉献。记录需由期刊验证,真正的检验发生在保持对象不变时,用相同对象、时间窗与排除规则比较两种制度版本,若获得期刊验证且有质量反馈的审稿数/全部登记审稿数方向不稳,就应把结论降为情境性判断。
该文献最值得保存的不是摘要结论,而是以下结构读数:Publons《Global State of Peer Review 2018》汇总11,800余名研究者及跨平台数据:全球每年同行评审约耗6,850万小时,折合7,800个研究年;单份评审平均19.1天完成。成熟市场评语约528词,新兴市场约250词,这组来源最有价值的地方在于,Publons(2013)给出可核对起点,Allen L, Mehler DMA(2019)使原结论不再无条件成立,ORCID(2015)展示问题在新环境中的延伸,时间顺序本身就是证据。
在制度化过程中,最容易被遗忘的是一项反向结果:数量信用可能鼓励快速低质审稿,平台覆盖与隐私也不均;期刊验证不说明评语质量,在最不利条件下重读结果,本条只在没有触发“当机构按审稿数量奖励时,记录越多,平均投入时间与质量反而可能下降”时保留原方向。认可平台从不声称数量等于质量;简历与排行榜却容易把审稿数直接加总。
该转向对标准、指南与采购的影响是机构应把审稿时间、难度、质量反馈和编辑服务纳入工作量,而不设简单篇数奖金。审稿人可选择公开粒度,从表单、系统与责任人三个层面看,应把“被拒评语、未采用建议、保密期刊和无法验证的公共审稿劳动”与正式样本并列,并说明它们是否改变获得期刊验证且有质量反馈的审稿数/全部登记审稿数,否则制度只能证明被保留下来的对象有所改善。
相邻领域使用不同词汇记录了同一个动作:它与第493号第20条CRediT对撞:CRediT记录论文内贡献,审稿信用记录论文外公共劳动;两者共同挑战“只有署名产出才算贡献”,跨领域比较的关键不是术语相似,需要先核对“审稿效果可由参与出版的平台和期刊自行评定”是否在两边都成立,若一边把它当条件、另一边把它当结果,差异正是新的解释入口。
2016—2026年,出版从单刊流程扩展为跨平台生态。预印本分离传播与认证,透明与可携带评审重组劳动,开放商业模式与论文工厂改变市场,AI又迫使保密、核验和人类责任重新划界。
一、预印本平台:传播与认证分离Preprints Separate Dissemination from Certification
本条的历史起点不是新名词,而是一次账本重写:传统出版把传播与认证捆绑,审稿等待期间结果不可见。预印本用时间戳和开放访问分离两者,从被忽略的边界回看,需要先查清“未发表、被撤回、旧版本继续流通和状态标签丢失的预印本”被谁、依据什么规则排除,因为入口变化足以把同一制度写成完全不同的历史。
可证伪性来自一个明确承诺:本条把决定性条件锁定为版本、审查状态和后续发表连接是否清楚,而不是上传速度。快速传播必须保留未认证标识,这项命题最需要承担的证伪风险是,用相同对象、时间窗与排除规则比较两种制度版本,若二次页面正确继承版本和审查状态的链接数/全部可追踪二次链接数方向不稳,就应把结论降为情境性判断。
需要保存的关键事实是bioRxiv从2013后快速增长,2016进展报告描述筛查与使用;COVID-19时期预印本大增。平台通过DOI、版本和期刊链接形成记录,原始材料给出了一条可追踪的修订轨迹,Inglis JR, Sever R(2016)给出可核对起点,Fraser N, Brierley L, Dey G, et al(2021)使原结论不再无条件成立,ASAPbio(2024)展示问题在新环境中的延伸,时间顺序本身就是证据。若要区分结构改变与名称改变,至少要写明谁生成、解释、使用并纠正二次页面正确继承版本和审查状态的链接数/全部可追踪二次链接数,若没有可追责主体,再精细的统计也不能支持制度判断。
反号条件使本条保留了真正的可证伪性:未审查结果可被媒体误用,筛查标准有限;期刊政策和优先权规则不同。撤回与修订通知不一定跟随二次传播,一旦把失败对象纳入,本条只在没有触发“当抢先传播奖励增强时,上传量越高,未认证状态在外部平台中反而越易丢失”时保留原方向。预印本平台明确区分筛查与同行评审;媒体和简历却常只显示标题与DOI。
实践端最先需要改写的不是口号,而是表单与责任链:平台应机器可读标记状态、版本和撤回,链接公开评审;期刊与新闻平台继承标识。作者需说明哪些分析改变,实践端最先需要改变的不是宣传语,应把“未发表、被撤回、旧版本继续流通和状态标签丢失的预印本”与正式样本并列,并说明它们是否改变二次页面正确继承版本和审查状态的链接数/全部可追踪二次链接数,否则制度只能证明被保留下来的对象有所改善。
它与邻近领域共享一条未说出的前提:它与第495号第16条的预印本沟通对撞:出版平台负责状态,传播链负责受众理解;任何一边断裂都会造成“已发表”错觉,沿着“软件工程称“预发布版本”,传播学称“未认证知识”;另见第495号第16条”这条外部线索,需要先核对“平台参与者可自行评定预印本传播效果”是否在两边都成立,若一边把它当条件、另一边把它当结果,差异正是新的解释入口。
二、透明同行评审:评语、作者回复与编辑决定同屏Transparent Peer Review Files
这项思想首先击中的,是一条长期未被写进方法部分的旧默认:传统文章只展示终稿,读者无法知道关键限制由谁提出、作者如何回应。透明评审把评语、回复和版本作为出版对象,把这段发生史展开,旧说法之所以显得稳定,往往是“选择退出、编辑间讨论、被删除语句及未改变稿件但重要的异议”没有进入观察,补回这些对象后才看得见真正的选择效应。
它真正要求接受的不是态度,而是一个方向性判断:本条声称,决定透明价值的只有评语—回复—编辑理由能否连到具体版本,而不是PDF数量。链条应解释变化,把隐藏假设放到台面后,用相同对象、时间窗与排除规则比较两种制度版本,若可定位到版本改变且有编辑处理理由的意见数/全部重大审稿意见数方向不稳,就应把结论降为情境性判断。
这里的硬证据来自样本、比例与时间窗的同时固定:Ross-Hellauer从文献中收集122个“开放同行评审”定义,编码为7项特征和22种组合;公开身份、公开评语、开放参与和开放平台因而不能互相替代。透明政策必须逐项说明开放的是谁、哪份材料与哪个阶段,从首篇工作到最近更新,Nature Communications(2016)给出可核对起点,Polka JK, Kiley R, Konforti B, Stern B, Vale RD(2018)使原结论不再无条件成立,Wolfram D, et al(2020)展示问题在新环境中的延伸,时间顺序本身就是证据。
后续争论把决定性问题集中到作者或审稿人可选择退出,公开会提高自我审查;编辑仍可选择哪些文件发布。文件量大也不等于读者会看,这条思想留下的自我约束表明,本条只在没有触发“当透明文件成为声誉展示时,公开越完整,编辑选择性隐藏尴尬过程的动力反而可能增加”时保留原方向。透明政策通常允许选择退出,承认开放并非无代价;评价却可能把退出解释为低透明。
由此形成的制度问题是期刊应机器链接评论到段落或版本,公开编辑如何处理冲突,报告选择退出率与群体差异。保留匿名选项,为了避免只记录账内成功,应把“选择退出、编辑间讨论、被删除语句及未改变稿件但重要的异议”与正式样本并列,并说明它们是否改变可定位到版本改变且有编辑处理理由的意见数/全部重大审稿意见数,否则制度只能证明被保留下来的对象有所改善。
本条与外部近邻的共同点不是主题,而是隐藏假设:它与第496号第12条开放评审对撞:开放科学关心诚信审计,本块关心出版叙事与供给;透明不能牺牲弱势评审者,与邻近面板并读时,需要先核对“通过透明文件清单即可证明评审实质合规”是否在两边都成立,若一边把它当条件、另一边把它当结果,差异正是新的解释入口。
三、审稿操纵环:伪造评审者与互惠网络Peer-review Rings and Manipulation
旧做法的困难集中在一个可复算的问题上:在线投稿提高速度,也允许作者建议评审。系统若不验证身份,论文工厂可创建审稿人账户并提交快速正面评语,沿着旧制度的入口追踪,旧说法之所以显得稳定,往往是“被拒稿后迁移、未公开调查、真实身份被冒用和编辑未记录的异常邀请”没有进入观察,补回这些对象后才看得见真正的选择效应。
本条要求研究者先承认本条把决定性路径锁定为评审者身份、邮箱、关系和时间网络是否独立,而不是评语格式像不像专家,这一主张可以用一次直接反事实检验,同时设置一个理论上不受该机制影响的负对照,若它与经独立身份验证的评审数/全部高风险评审数同向移动,共同趋势仍未被排除。把本条写入标准或指南时,至少要写明谁生成、解释、使用并纠正经独立身份验证的评审数/全部高风险评审数,若没有可追责主体,再精细的统计也不能支持制度判断。
本条的测量骨架可从下列结果看清:BioMed Central在系统调查后一次撤回43篇基于伪造评审者的论文,并关闭作者直接录入推荐审稿人的功能;对其2000—2015年190,514篇论文的复盘找到134份撤稿通知,其中44篇(33%)涉及受损同行评审,把摘要结论拆回来源,Haug CJ(2015)给出可核对起点,COPE(2017)使原结论不再无条件成立,STM Integrity Hub(2024)展示问题在新环境中的延伸,时间顺序本身就是证据。
反对意见真正击中的,是边界条件而不是主题本身:真实小领域也有密集合作,自动网络检测可能误伤;编辑工作量大,身份验证有隐私成本。操纵者会迁移平台,从应用风险看,本条只在没有触发“当系统只加强邮箱规则时,合规检查越严,操纵网络转向真实被盗身份的风险反而可能上升”时保留原方向。COPE称其为“系统性操纵”,说明不是个别坏审稿;期刊通报却常只撤回单篇。
治理意义来自它迫使组织为下列对象单设字段:投稿系统应验证机构与ORCID、限制单一推荐来源、分析时间与互惠网络,跨刊共享确认信号。所有处置给作者回应,把结论转成治理动作时,应把“被拒稿后迁移、未公开调查、真实身份被冒用和编辑未记录的异常邀请”与正式样本并列,并说明它们是否改变经独立身份验证的评审数/全部高风险评审数,否则制度只能证明被保留下来的对象有所改善。
若两边都成立,就必须承认还有一个未入账的变量:它与第493号第11条的引用联盟对撞:评审环控制准入,引用联盟控制发表后声誉;两者叠加可制造完整虚假信用链,同一动作换一套学科语言后,需要先核对“通过投稿系统形式审查即可证明评审实质独立”是否在两边都成立,若一边把它当条件、另一边把它当结果,差异正是新的解释入口。
四、审稿负担集中:少数人承担多数评审Concentration of Peer-review Workload
早期讨论常把问题化约为一个易于汇总的表面读数:投稿量增长时,编辑继续向熟悉专家发送邀请,拒审和延迟增加。审稿劳动不进入正式工作量,形成公共品透支,从对象如何被登记来看,旧说法之所以显得稳定,往往是“未接受邀请、重复评审同稿、无偿编辑协调和因疲劳退出的专家”没有进入观察,补回这些对象后才看得见真正的选择效应。
在同一分母与时间窗内,本条坚持本条声称,决定评审可持续性的只有工作量在合格共同体中的分布与认可,而不是总邀请数。集中度是系统风险,判断它是否站得住,不必依靠赞成态度,同时设置一个理论上不受该机制影响的负对照,若它与由负担不过度群体完成的合格审稿数/全部合格审稿数同向移动,共同趋势仍未被排除。
证据并没有消除争议,但它把争议压缩到可测范围:Kovanis等估算2015年全球生物医学审稿时间,并显示约20%的审稿人承担69%—94%的评审。Publons 2018记录地区供需和审稿时长,把文献按时间排开,“审稿供给并非无限,少数活跃研究者承担高度不均的全球劳动”须同时接受Kovanis M, Porcher R, Ravaud P, Trinquart L(2016)的支持、Publons(2018)的限制与Cambridge University Press & Assessment(2025)的更新,任何一笔被省略都会把转向重新写成口号。
其不确定性来自分母、窗口与对象边界同时可能漂移:数据库只覆盖部分期刊,时间估计依赖自报;高贡献者也可能更高效。平均分摊不能忽略专业匹配,比效应大小更重要的是,本条只在没有触发“当投稿持续增长而奖励不变时,邀请数量越高,最可靠审稿人的拒绝与疲劳反而越严重”时保留原方向。负担研究公开显示高度集中;出版社仍常把审稿延迟描述为个人不响应。
如果只把它写进宣言而不改流程,最先消失的仍会是出版者应报告邀请、接受、完成、时长和集中度,机构正式承认服务时间。跨期刊共享可避免重复评审,机构真正需要新增的是,应把“未接受邀请、重复评审同稿、无偿编辑协调和因疲劳退出的专家”与正式样本并列,并说明它们是否改变由负担不过度群体完成的合格审稿数/全部合格审稿数,否则制度只能证明被保留下来的对象有所改善。
同一个对象在另一块面板里被量成了不同的比率:它与第493号第20条的贡献角色对撞:论文内角色有标准,审稿公共劳动仍无统一责任分配;未计价劳动最终表现为质量下降,为了判断两边是否真在谈同一件事,需要先核对“审稿系统通过流程审查即可证明供给实质可持续”是否在两边都成立,若一边把它当条件、另一边把它当结果,差异正是新的解释入口。
五、编辑委员会多样性:谁定义重要与可发表Editorial Board Diversity
这一转向把一项看似外围的条件拉回核心:期刊常把编辑席位视为荣誉,依赖既有网络,女性、全球南方和早期职业者不足。单一构成会缩窄审稿人和问题范围,若把早期样本重新分类,旧说法之所以显得稳定,往往是“未被邀请、无薪顾问、身份未披露及有名无权的编辑席位”没有进入观察,补回这些对象后才看得见真正的选择效应。
它不是一般倡议,而是一项排他的解释:本条声称,决定入口公平性的只有编辑权力在相关知识共同体中的代表与分布,而不是期刊声明支持多样性,把解释责任压到可观测结果上,同时设置一个理论上不受该机制影响的负对照,若它与拥有实质决策权的多样编辑数/全部编辑决策席位数同向移动,共同趋势仍未被排除。
主证据留下了可以重算的数字:Liu等解析173,000余个编辑页面,得到1,167种期刊和103,000名编辑,覆盖15个学科。可高置信分类的80,776名编辑中女性占14%,主编仅8%,而作者基线为26%;约20,000名可匹配出版记录的编辑中,12%至少每5篇就有1篇发在本人所编期刊,6%达到每3篇1篇,从三笔材料的责任分工看,“编辑构成会影响选题、审稿网络和“重要性”判断,多样性是知识入口问题”须同时接受Liu F, Holme P, Chiesa M, AlShebli B, Rahwan T(2023)的支持、Cho AH, Johnson SA, Schuman CE, et al(2014)的限制与PLOS(2025)的更新,任何一笔被省略都会把转向重新写成口号。
这项思想也留下了自己的反证入口:人口代表不自动带来观点多样,身份数据不完整且不能强迫披露;小领域候选池有限。名额增加但权力集中也无效,把限制写进主结论后,当多样性只增加顾问席位时,名单越多元,核心决定权的集中反而越难被看见,这意味着边界触发时应重新命名结论,而不能用同一标签把相反方向汇总在一起。出版者常报告人数而少报告处理稿件与否决权,说明代表与权力可能分离。
把它落实到程序,至少会出现三项变化:期刊应公开编辑构成、任期、职责、邀请来源和决策分布,审计不同群体稿件的初筛与评审。多样成员需有真实编辑权,在审计或复盘中,应把“未被邀请、无薪顾问、身份未披露及有名无权的编辑席位”与正式样本并列,并说明它们是否改变拥有实质决策权的多样编辑数/全部编辑决策席位数,否则制度只能证明被保留下来的对象有所改善。
在跨领域比较中,最合适的对手是:它与第494号第13条的专业性门槛对撞:编辑决定什么“像本刊”,专业性决定谁“像专业人”;两者均需把含糊判断转成行为证据,本条的外部边界可由另一套账本检验,需要先核对“未进入编辑网络的知识与候选不含出版信息”是否在两边都成立,若一边把它当条件、另一边把它当结果,差异正是新的解释入口。
六、可携带评审:同一稿件不必从零再审Portable Peer Review
旧框架能够给出整齐结果,却没有回答作者换期刊时通常重启评审,同一方法被多轮审查,审稿资源浪费。可携带评审把评语与作者回复作为可转用对象,在第一次统计之前,旧说法之所以显得稳定,往往是“作者不愿转移、版本变化过大及新刊追加完整评审的稿件”没有进入观察,补回这些对象后才看得见真正的选择效应。
其可检验版本不是“值得关注”,而是本条把决定性路径锁定为评审材料能否在作者同意下跨期刊被接受,而不是编辑口头支持合作,其排他性可以从一个替代口径开始检验,同时设置一个理论上不受该机制影响的负对照,若它与被新期刊采用而无需完整重审的评审包数/全部可转移评审包数同向移动,共同趋势仍未被排除。
若把数字从文字中抽出,可以看到神经科学联盟探索转移评审;Review Commons自2020提供期刊独立评审和refereed preprint,再由合作期刊决定范围与适配,证据链并非三次重复背书,“独立评审可随稿件转移,减少连续拒稿中的重复劳动和时间”须同时接受Review Commons(2020)的支持、Neuroscience Peer Review Consortium(2008)的限制与EMBO Press and participating journals(2021)的更新,任何一笔被省略都会把转向重新写成口号。在一次独立复评中,至少要写明谁生成、解释、使用并纠正被新期刊采用而无需完整重审的评审包数/全部可转移评审包数,若没有可追责主体,再精细的统计也不能支持制度判断。
当评价者改变行为时,原先的方向未必保存:新期刊有不同读者与标准,旧评审可能不够;编辑可能仍加审稿人。作者担心负面评语跟随,选择性转移会影响数据,反向情形不是附录里的免责声明,当期刊为维护品牌仍全面重审时,转移平台越普及,额外流程反而可能增加总负担,这意味着边界触发时应重新命名结论,而不能用同一标签把相反方向汇总在一起。可携带评审项目承认编辑保留决定权;宣传却容易把它承诺为一次评审通行所有期刊。
这项转向还改变了培训与问责的边界:平台应报告转移接受、追加评审、总时长和作者选择退出,明确哪些判断可复用、哪些需重做,落实到组织程序,需要记录谁生成被新期刊采用而无需完整重审的评审包数/全部可转移评审包数、谁解释它、谁因该读数受益或受损,以及谁有权纠正错误,责任链不能停在技术部门。
与相邻面板的接口可以精确定位:它与第194号第11条的可重演证据链对撞:评审可携带依赖版本与评论对应;没有稳定标识,转移会失去上下文,把双方读数放在同一时间窗内,需要先核对“未被转移或作者退出的评审不含系统效率信息”是否在两边都成立,若一边把它当条件、另一边把它当结果,差异正是新的解释入口。
七、钻石开放获取:读者与作者都不付费Diamond Open Access
问题并不是旧制度完全无效,而是它在以下情形中失去辨别力:金色开放常以APC替代订阅,作者端不平等上升。大量地方与学会期刊实际无费,却基础设施脆弱、可见性低,与其把差异归为偶然,旧说法之所以显得稳定,往往是“无偿编辑、技术维护、地方语言服务和停刊后无人接管的档案”没有进入观察,补回这些对象后才看得见真正的选择效应。
这条路径的判决句是本条声称,决定出版公共性的只有治理与持续融资能否让双侧免费成立,而不是网页标注开放。钻石模式把费用社会化,若要把它与一般倡议区分开,同时设置一个理论上不受该机制影响的负对照,若它与连续五年维持双侧免费且完成保存的期刊数/全部声称钻石开放的期刊数同向移动,共同趋势仍未被排除。
把结论拆回数据,最关键的一组量是:OA Diamond研究分析多种书目数据库,并调查1,619种期刊,收集7,019条开放回答和94道题;估计全球至少17,000、可能达29,000种钻石期刊,每年约发表356,000篇文章。多数期刊规模很小,中位数约23篇/年,若把提出、异议与更新分别阅读,“学术出版可由机构、学会和公共基础设施支持,不向读者或作者收费”须同时接受Bosman J, Frantsvåg JE, Kramer B, Langlais PC, …(2021)的支持、Fuchs C, Sandoval M(2013)的限制与Action Plan for Diamond Open Access(2022)的更新,任何一笔被省略都会把转向重新写成口号。
限制部分比结论部分更能说明它的责任边界:无费不等于无成本,志愿劳动、短期补贴和技术不足会威胁持续;小期刊也需质量与保存。公共资助可能受政策变动,后续争论真正要求修改的是,当无费被当作低成本时,期刊数量越多,志愿劳动透支和突然停刊风险反而越高,这意味着边界触发时应重新命名结论,而不能用同一标签把相反方向汇总在一起。钻石研究明确展示其规模与脆弱性;政策口号却容易把“无APC”误写为“无成本”。
真正昂贵的部分不是新增一个指标,而是应报告真实成本、劳动、治理、保存和服务质量,建立共享平台而不夺取期刊自治。资助以多年公共服务而非篇数结算,若将这项转向用于真实决策,需要记录谁生成连续五年维持双侧免费且完成保存的期刊数/全部声称钻石开放的期刊数、谁解释它、谁因该读数受益或受损,以及谁有权纠正错误,责任链不能停在技术部门。
两条命题看似相邻,实则把因果责任放在不同环节:它与第300号第18条的公益基础设施对撞:钻石期刊是知识公共品,公益管理解释持续融资与共同治理;免费表面下的劳动必须入账,把本条放到相邻领域中,若外部领域在相同对象上得到相反方向,就应寻找未记录的选择、反馈或制度成本,而不是把一方判为例外。
八、转换协议:从订阅支出换成开放发表Transformative Agreements
这个领域原本把下列安排视为中性的技术细节:逐篇APC管理复杂,订阅支出又未减少。转换协议把机构支付与作者开放权合并,试图将既有预算重定向,真正改变比较结果的起点是,旧说法之所以显得稳定,往往是“无协议作者、非期刊产出、独立期刊和合同外费用”没有进入观察,补回这些对象后才看得见真正的选择效应。
作者把判断压缩为本条声称,决定市场转换的只有合同能否把订阅支出实质换为开放服务并透明成本,而不是协议名称,真正的检验发生在保持对象不变时,同时设置一个理论上不受该机制影响的负对照,若它与新增开放论文与服务价值/协议总成本同向移动,共同趋势仍未被排除。从最小可审计单元出发,至少要写明谁生成、解释、使用并纠正新增开放论文与服务价值/协议总成本,若没有可追责主体,再精细的统计也不能支持制度判断。
研究者没有只报告中心趋势,而是同时给出ESAC登记全球协议;PeerJ 2018估计开放获取占比持续增长。2021综述分析协议类型、覆盖和挑战,指出主要集中于富裕国家与大型出版商,这组来源最有价值的地方在于,“图书馆可把订阅合同改为阅读与开放发表组合,以大规模转换市场”须同时接受Efficiency and Standards for Article Charges(2018)的支持、Piwowar H, Priem J, Larivière V, et al(2018)的限制与Borrego Á, Anglada L, Abadal E(2021)的更新,任何一笔被省略都会把转向重新写成口号。
争议文献要求把下列失败形态与成功形态并列:协议可能锁定价格、排除无协议机构和独立作者,加剧市场集中;阅读与发表数量波动使成本难比,在最不利条件下重读结果,当合同按发表量扩张时,开放篇数越高,总成本和大出版商锁定反而可能上升,这意味着边界触发时应重新命名结论,而不能用同一标签把相反方向汇总在一起。转换协议研究承认其过渡性与地域集中;机构宣传却常把签约即等同完成开放转型。
从治理视角看,真正的新对象是图书馆应公开总成本、篇均成本、未覆盖作者、出版商集中度和退出条款,比较无协议与钻石路径,从表单、系统与责任人三个层面看,需要记录谁生成新增开放论文与服务价值/协议总成本、谁解释它、谁因该读数受益或受损,以及谁有权纠正错误,责任链不能停在技术部门。
把它与站内近邻放在同一时间窗,冲突才真正显出来:它与第493号第3条的排名反身性对撞:合同指标会被出版者适配;若按开放篇数结算,数量增长可能压过质量与成本控制,跨领域比较的关键不是术语相似,若外部领域在相同对象上得到相反方向,就应寻找未记录的选择、反馈或制度成本,而不是把一方判为例外。
九、论文工厂防御:编辑部需要跨平台完整性情报Editorial Defence against Paper Mills
在该概念被明确提出之前,常见处理是单个编辑看到的只是一个稿件,工厂在多个期刊测试漏洞。扭曲短语、模板图和异常作者网络是跨文档信号,从被忽略的边界回看,旧说法之所以显得稳定,往往是“被拒后迁移、未发表关联稿、无机构回应及误报后无纠正记录的作者”没有进入观察,补回这些对象后才看得见真正的选择效应。
本条拒绝把解释退回“多因素并列”,而把预测责任集中在一句话上:本条把决定性路径锁定为编辑系统能否跨出版者连接异常并快速升级,而不是每刊各自查重,这项命题最需要承担的证伪风险是,同时设置一个理论上不受该机制影响的负对照,若它与经人工确认并完成跨刊处置的高风险稿件数/全部高风险稿件数同向移动,共同趋势仍未被排除。
2020年的研究把争论落到具体分母上:Problematic Paper Screener以“扭曲短语”等检测器标出12,000余篇可疑文章;Cabanac 2024年评论所引数据库在2022年记录近14,000条撤稿通知。撤稿标记通常停在源文,引用链中的下游论文不会自动重算,跨平台情报必须追踪传播路径,原始材料给出了一条可追踪的修订轨迹,“论文工厂用批量文本、图像、作者和评审操纵攻击出版流程,需要共享情报”须同时接受Byrne JA, Christopher J(2020)的支持、Cabanac G, Labbé C, Magazinov A(2021)的限制与Cabanac G(2024)的更新,任何一笔被省略都会把转向重新写成口号。
可检查的失效句应写成自动工具会误伤非母语写作和合法复用,商业合作的数据治理需透明。拒稿不等于调查确认,一旦把失败对象纳入,当拦截量成为绩效时,工具越敏感,非母语作者误报与无理由拒稿反而可能上升,这意味着边界触发时应重新命名结论,而不能用同一标签把相反方向汇总在一起。Integrity Hub以合作工具而非自动定罪定位,说明人类程序不可省;编辑压力却可能推动黑箱拦截。
从组织设计看,本条把一项隐性成本显性化:出版者应共享最小必要风险信号、保留程序和人工复核,向机构反馈确认案件;公开误报与纠正,实践端最先需要改变的不是宣传语,需要记录谁生成经人工确认并完成跨刊处置的高风险稿件数/全部高风险稿件数、谁解释它、谁因该读数受益或受损,以及谁有权纠正错误,责任链不能停在技术部门。
两边真正分歧在于它与第496号第14条对撞:开放诚信面板建立证据,出版面板决定编辑行动;若工具只拒稿不纠正已发表网络,攻击继续,沿着“网络安全称“威胁情报共享”,出版称“完整性筛查”;另见第496号第14条”这条外部线索,若外部领域在相同对象上得到相反方向,就应寻找未记录的选择、反馈或制度成本,而不是把一方判为例外。
十、AI辅助审稿:保密、偏差与人类责任AI-assisted Peer Review
若只读当年的排行榜、守则或治理报告,很容易误以为审稿人面对时间压力,生成工具能摘要与起草评语。商业模型可能保存稿件,且无法承担利益冲突与保密义务,把这段发生史展开,关键不是多收一列数据,而是承认“未披露使用、供应商日志、模型训练去向和编辑删除的AI建议”也属于研究对象,否则所谓改进可能只是把困难移到账外。
它与旧说法的分界可以用一句否定式命题写出:本条把决定性条件锁定为期刊授权、数据保护、用途披露和人类逐项核验,而不是最终评语看起来专业,把隐藏假设放到台面后,同时设置一个理论上不受该机制影响的负对照,若它与经人工证实且未泄密的AI辅助意见数/全部AI辅助意见数同向移动,共同趋势仍未被排除。
可通约读数在原文中表现为Liang等估计4场AI会议的评审文本有6.5%—16.9%被大模型实质改写。对ICLR 2024的后续研究给出15.8%的AI辅助下限;配对比较中53.4%的AI辅助评语分数更高(p=0.002),边缘稿件接收率高4.9个百分点(p=0.024),从首篇工作到最近更新,“AI可辅助语言、清单和检索,但未经许可上传稿件会泄露保密内容,输出也会出错”须同时接受World Association of Medical Editors(2023)的支持、Liang W, Izzo Z, Zhang Y, et al(2024)的限制与Russo G, Horta Ribeiro M, Davidson TR, Veselovs…(2025)的更新,任何一笔被省略都会把转向重新写成口号。
公开争论仍未收敛,因为完全禁止可能阻碍无障碍和语言辅助,允许又难核验实际使用。模型幻觉、偏见和版本变化可被人类语气掩盖,这条思想留下的自我约束表明,当期刊用AI缩短审稿时长时,自动化比例越高,人类实质阅读反而可能越少,这意味着边界触发时应重新命名结论,而不能用同一标签把相反方向汇总在一起。ICMJE强调编辑最终负责且评审保密,说明AI效率不能替代责任;“人类在环”仍需测量。
另一处常被略过的是期刊应给允许用途、批准工具、数据条款和披露字段,要求审稿人核对引用与方法;编辑抽样比较AI辅助与非辅助质量,为了避免只记录账内成功,需要记录谁生成经人工证实且未泄密的AI辅助意见数/全部AI辅助意见数、谁解释它、谁因该读数受益或受损,以及谁有权纠正错误,责任链不能停在技术部门。
跨领域比较应先固定对象与边界,再观察两边把决定性放在哪里:它与第500号第19条的AI采购保证对撞:期刊选择工具也是采购,高风险不只准确,还包括保密与知识产权,与邻近面板并读时,若外部领域在相同对象上得到相反方向,就应寻找未记录的选择、反馈或制度成本,而不是把一方判为例外。若把本条带入高风险决策,Russo G, Horta Ribeiro M, Davidson TR, Veselovs…(2025)若只增加报告字段而没有改变实际选择、资源配置或申诉结果,就不能视为改革已经完成。
十一、大模型评语的表面质量与事实错误Limits of LLM-generated Reviews
在这一转向出现以前,领域里的惯例是评语语言流畅让编辑难区分真正阅读与模板生成。模型善于报告清晰性问题,未必能核对数据、推导和新颖性,沿着旧制度的入口追踪,关键不是多收一列数据,而是承认“无金标准、未公开稿、版本更新和模型训练中可能见过的论文”也属于研究对象,否则所谓改进可能只是把困难移到账外。
这项主张把决定性判断写成:本条声称,决定模型价值的只有其发现真实、可验证缺陷的增量,而不是与人类评语文本相似。评审是错误发现任务,这一主张可以用一次直接反事实检验,把分子、分母与阈值分别改变一次,只有方向对合理口径保持稳健,“决定价值的只有可验证缺陷发现增量”才具有可迁移意义。
从结果表倒读,本条至少交出了三类可核对信息:2021综述讨论AI匹配、质量预测与风险;2024后多项预印本比较模型和人类评语,常见结果是高可读、部分重叠,但具体性、引用和领域可靠性不稳,把摘要结论拆回来源,“大模型能生成结构清楚的通用建议,却容易漏掉领域错误、编造引用和趋向礼貌共识”须同时接受Liang W, Zhang Y, Cao H, et al(2024)的支持、Checco A, Bracciale L, Loreti P, et al(2021)的限制与International publishers(2025)的更新,任何一笔被省略都会把转向重新写成口号。
这一命题不是无条件真理;它在下列情形中让位:评价数据本身由已发表评语构成,可能奖励保守建议;模型训练污染也会使熟悉论文表现虚高。不同版本难复现,从应用风险看,当模型优化语言与结构时,表面质量越高,编辑对事实性错误的警觉反而可能下降,这意味着边界触发时应重新命名结论,而不能用同一标签把相反方向汇总在一起。现有研究多为预印本、特定领域或公开稿,自己承认证据有限;部署宣传却常直接称“提高审稿质量”。
它在实践中留下了一条不能省略的记录规则:实验应锁定未公开稿件、金标准缺陷与模型版本,盲法评价真阳性、假阳性和遗漏。模型只能辅助检查,不应给最终接收概率,把结论转成治理动作时,需要记录谁生成模型新增且经专家确认的实质缺陷数/全部模型新增缺陷建议数、谁解释它、谁因该读数受益或受损,以及谁有权纠正错误,责任链不能停在技术部门。
若只在本学科内部比较,最关键的分母变化会被共同术语遮住:它与第493号第18条AI评价对撞:科研评价和审稿都可能被流畅解释迷惑;共同判据应是可由原材料证实的判断比例,同一动作换一套学科语言后,若外部领域在相同对象上得到相反方向,就应寻找未记录的选择、反馈或制度成本,而不是把一方判为例外。
十二、版本化出版:从最终论文转向持续评议记录Versioned and Reviewed Publishing
在主证据发表前,同行通常默认传统版本把接收作为终点,纠错需另发通知。新模式把传播、评审和评估拆开,读者可看各版本,从对象如何被登记来看,关键不是多收一列数据,而是承认“旧版被引用、数据库未更新、撤回后缓存及无清楚推荐版本的论文”也属于研究对象,否则所谓改进可能只是把困难移到账外。
这项思想把其他解释暂时固定,只问本条把决定性路径锁定为版本、评语和作者响应的时间序列,而不是“已发表”二元状态。知识结论可随证据更新,判断它是否站得住,不必依靠赞成态度,把分子、分母与阈值分别改变一次,只有方向对合理口径保持稳健,“决定可信度的只有版本评议响应序列”才具有可迁移意义。
证据的力度来自比较组和分母被同时写明:eLife 2023采用Reviewed Preprints与公开评估,不再以传统接收拒绝定义全部价值;Review Commons等提供期刊独立评审。版本标识支持持续更新,把文献按时间排开,eLife(2023)建立基线,Stern BM, O’Shea EK(2019)暴露边界,ASAPbio(2024)补充新条件,三者共同指向“出版可记录预印本、公开评审、作者修订与编辑评价,不再假装只有一个终稿”而不是彼此替代。
争议没有被更多案例自动消除:读者可能困惑哪个版本应引用,评价系统仍偏好最终标签;出版费用与编辑权力仍存在。持续版本也可能让错误长期可见,比效应大小更重要的是,当评价仍只奖励“最终发表”时,版本越开放,早期稿错误被截取和污名化的风险反而越高,这意味着边界触发时应重新命名结论,而不能用同一标签把相反方向汇总在一起。新模式公开承认论文评价会演化;传统索引与简历却仍要求一个确定出版状态。
这一转向进入机构之后,改变了平台应给推荐引用版本、变化摘要、状态和永久历史,数据库需继承更新与撤回。机构评价不得只认单一“正式版本”,机构真正需要新增的是,需要记录谁生成具有完整版本差异与评审响应的论文数/全部版本化论文数、谁解释它、谁因该读数受益或受损,以及谁有权纠正错误,责任链不能停在技术部门。
本条最有价值的外部反例来自它与第194号第11条的版本保存对撞:出版制度产生动态版本,档案治理保证历史不丢;若数据库只索引首版或末版,证据链断裂,为了判断两边是否真在谈同一件事,若外部领域在相同对象上得到相反方向,就应寻找未记录的选择、反馈或制度成本,而不是把一方判为例外。从长期效应而非宣布时点看,ASAPbio(2024)若只增加报告字段而没有改变实际选择、资源配置或申诉结果,就不能视为改革已经完成。
◎ 二十年连起来看
二十年连起来看,同行评审不再被当作一个黑箱标签。 盲法、开放评审、透明文件、可携带评审和版本化出版把信息结构拆开,使“谁看见什么、何时给理由、如何修改”成为可研究路径。
第二条线是评审供给与出版市场共同决定质量。 负担高度集中、审稿信用不足、APC与转换协议的商业激励,都说明再好的伦理指南也无法脱离劳动与合同。
第三条线是完整性攻击从单篇造假升级为网络操纵。 伪评审、论文工厂、引用联盟和AI生成稿跨期刊迁移,防御必须共享信号,同时保留人工核验、申诉与误报纠正。
◎ 三个常见误解
误解一是“同行评审证明论文正确”。评审是有限专家在有限时间的筛查,发表后仍需数据重用、复制和纠错。
误解二是“开放评审一定更好”。开放组件可能提高责任,也可能降低弱势审稿人参与。应分别测身份、评语、版本和参与,而非使用单一标签。
误解三是“开放获取等于作者付费”。钻石模式、仓库和公共平台说明双侧免费可以存在;APC只是一个商业路径。
◎ 与相邻领域的接口
与第496号“开放科学与科研诚信”的分工是:第496号提出数据、注册、开放与诚信控制,本块检验期刊和平台怎样把它们执行、奖励或绕开。
与第197号“出版与阅读”的接口是市场与读者。第197号看阅读生态,本块聚焦学术认证、评审劳动和纠错。
与第493号“度量、指标与排名”的接口是出版品牌进入评价。DORA若未改变机构激励,双盲、巨型期刊和开放模式的改革都会被刊名等级重新吸收。
◎ 争议现场
第一场争论是双盲是否减少偏差。收敛需在多领域随机化,记录身份猜测、编辑初筛和群体差异,而不是只比较总接收率。
第二场争论是开放评审对质量和供给的净效应。应同时测具体错误发现、礼貌、拒审、职业阶段和报复担忧,并允许组件组合。
第三场争论是AI能否缓解审稿负担。决定性试验需用未公开稿与金标准缺陷,比较人、AI、人机组合的真阳性、假阳性、时长和保密成本。
◎ 往下五年看什么
看评审劳动是否正式进入机构工作量:读数是获得时间或职业认可的合格审稿数/全部验证审稿数,以及负担集中度。
看论文工厂跨刊协作是否降低迁移:读数是共享信号后被多平台一致识别并完成程序处置的案件比例与误报率。
看版本化出版是否被索引和评价接受:读数是数据库正确继承推荐版本、修订、撤回与公开评审的比例。
◎ 可与哪些领域对撞
第5条“发表偏差”可与第496号第6条“注册报告”对撞。共享前提是聚合次序不影响结论;一个揭示结果选择,一个前移评审。若阶段一仍按时髦问题选择,偏差只改变位置。
第12条“审稿负担集中”可与第493号第20条“CRediT”对撞。共享前提是形式合规等于实质贡献;论文内劳动被分类,论文外审稿仍未计价。第三变量是机构工作量与奖励。
第18条“AI辅助审稿”可与第500号第19条“AI采购保证”对撞。共享前提是记录存在即可核对;期刊若无法审计供应商数据与版本,披露使用也不能保证保密。
◎ 十条可做的研究命题
1. 命题:双盲在身份可猜率低于30%的领域更能减少机构偏差。做法:跨刊随机试验;若效果与猜率无关,则证伪。
2. 命题:短审稿培训不提高一年后的错误发现。做法:长期随机复测;若持续提高,则证伪。
3. 命题:巨型期刊可靠性评审不降低方法纠正率。做法:匹配传统期刊;若纠正显著更高,则证伪。
4. 命题:发表后评论只有进入期刊处理时才提高纠错。做法:比较平台评论与正式响应;若无差,则证伪。
5. 命题:审稿信用按数量奖励会降低平均评语质量。做法:政策前后比较;若质量不降,则证伪。
6. 命题:可携带评审降低总时长但只有在新期刊采用率高于50%时减少劳动。做法:队列追踪;若低采用仍节省,则证伪。
7. 命题:钻石期刊的主要风险是持续融资而非评审质量。做法:五年跟踪;若质量更先失败,则证伪。
8. 命题:转换协议提高开放率但加剧出版商集中。做法:合同与市场份额分析;若集中不升,则证伪。
9. 命题:跨出版者情报显著提高论文工厂确认率。做法:分期接入;若无增益,则证伪。
10. 命题:大模型评语可读性与真实缺陷发现弱相关。做法:盲法专家评分;若强相关,则证伪。
◎ 资料核验
- Budden AE, et al. Double-blind review. Trends in Ecology & Evolution, 2008, 23:4–6.
- Nature. Open peer review trial, 2006.
- Callaham ML, Tercier J. Reviewer training and quality. Annals of Emergency Medicine, 2007, 49:126–132.
- PLOS ONE. Editorial criteria, launched 2006.
- Fanelli D. Positive results. PLOS ONE, 2010, 5:e10068.
- Beall J. Predatory publishers. Nature, 2012, 489:179.
- PubPeer Foundation. PubPeer, launched 2012.
- Kovanis M, et al. Global burden of peer review. PLOS ONE, 2016, 11:e0166387.
- Inglis JR, Sever R. bioRxiv. PLOS Biology, 2016, 14:e2001007.
- Polka JK, et al. Publish peer reviews. Nature, 2018, 560:545–547.
- Haug CJ. Peer-review fraud. NEJM, 2015, 373:2393–2395.
- COPE. Ethical Guidelines for Peer Reviewers, 2017–2024.
- Bosman J, et al. OA Diamond Journals Study. 2021.
- Borrego Á, et al. Transformative agreements. Learned Publishing, 2021, 34:216–232.
- Byrne JA, Christopher J. Paper mills. FEBS Letters, 2020, 594:583–589.
- Cabanac G, et al. Tortured phrases. Learned Publishing, 2021, 34:739–750.
- ICMJE. Responsibilities in peer review, updated 2025.
- eLife. Reviewed Preprints publishing model, 2023.
- Review Commons. Refereed preprints, 2020–2025.
- STM Integrity Hub. Integrity services, 2024–2025.
- Publons. Global State of Peer Review 2018.
- Piwowar H, et al. The state of OA. PeerJ, 2018, 6:e4375.
- Ross-Hellauer T. Open peer review. F1000Research, 2017, 6:588.
- COPE/WAME. AI and scholarly publishing guidance, 2023–2025.
- Tomkins A, Zhang M, Heavlin WD. Reviewer bias in single- versus double-blind peer review. Proceedings of the National Academy of Sciences, 2017, 114:12708–12713.
- van Rooyen S, Godlee F, Evans S, et al. Effect of open peer review on quality of reviews and reviewers’ recommendations. BMJ, 1999, 318:23–27.
- Schroter S, Black N, Evans S, et al. Effects of training on quality of peer review. BMJ, 2004, 328:673.
- Fanelli D. “Positive” results increase down the hierarchy of the sciences. PLOS ONE, 2010, 5:e10068. DOI: 10.1371/journal.pone.0010068.
- Shen C, Björk BC. Predatory open access: a longitudinal study of article volumes and market characteristics. BMC Medicine, 2015, 13:230.
- Ross-Hellauer T. What is open peer review? F1000Research, 2017, 6:588.
- Liu F, Holme P, Chiesa M, AlShebli B, Rahwan T. Gender inequality and self-publication are common among academic editors. Nature Human Behaviour, 2023, 7:353–364. DOI: 10.1038/s41562-022-01498-1.
- Bosman J, Frantsvåg JE, Kramer B, Langlais PC, Proudman V. OA Diamond Journals Study. cOAlition S, 2021.
- Cabanac G. Chain retraction: how to stop bad science propagating through the literature. Nature, 2024, 632:977–979. DOI: 10.1038/d41586-024-02747-1.
- Liang W, Izzo Z, Zhang Y, et al. Monitoring AI-Modified Content at Scale. ICML, 2024; arXiv:2403.07183.
- Russo G, Horta Ribeiro M, Davidson TR, Veselovsky V, West R. The AI Review Lottery. PACMHCI, 2025, 9(7). DOI: 10.1145/3757667.