‹ 成瘾频道
📖 长文阅读
学员专栏 · 孔凡鹤 · 成瘾频道 · 深化期

快乐越少,为什么越难停?成瘾深化的「阈差反超点」

神经药理学 × 神经内分泌学 × 演化生态学:把悖论改写为两个斜率第一次反向
作者 孔凡鹤 · SDE 学员 · 约 1.7 万字 · 神经药理学 × 神经内分泌学 × 演化生态学 · 发表于2026年8月8日

摘要

成瘾研究面对一个反直觉而并不新鲜的事实:随着使用史延长,同一种物质或行为带来的愉悦可以减弱,个体为之支付的时间、金钱、健康和关系代价却上升,停止反而变难。仅以“更喜欢”解释这一现象显然失败,但以“想要与喜欢分离”“负强化接管”“稳态设定点上移”“习惯化/强迫化”分别作答,也仍留下一个未被充分形式化的问题:当对象的绝对享乐收益下降时,究竟在什么时刻、通过什么比较机制,下降的收益不再推动退出,反而与更强的持续相伴?本文将神经药理学的诱因显著性、神经内分泌学的应激—稳态适应,以及演化生态学的补丁离开规则置于同一动力问题中,并正面处理对立过程、享乐稳态失调、参照依赖评价、稳态强化学习、理性成瘾以及已有动力系统模型等近邻。本文提出“阈差反超点”(exit-gap crossover point)作为研究表型:在同一个体的纵向匹配观测中,标准化接触所产生的即时享乐收益斜率已为负,而“继续相对于退出”的净优势斜率首次为正。其一般式不是“快乐下降所以更成瘾”,而是继续优势同时受到享乐收益 H、线索诱因 W、解除负性状态的缓解价值 R、可达替代机会率 A 与退出转换成本 C 的共同决定;当 ΔH<0 而 ΔW+ΔR−ΔA+ΔC 的合量大于 |ΔH| 时,个体进入“快乐继续下降、退出却越来越不划算”的反向区段。本文进一步提出轮次机制:线索增益维持再接触,应激/稳态适应使不使用状态的代价历史依赖,状态依赖的机会评价降低退出端的相对价值;由此延长的暴露又回写下一轮的 W、R、A 与 C。最早的必要转变因而不是某一受体、激素或行为必然先变,而是退出判据失去对享乐收益的单调跟随;不同成瘾对象可以由不同机制率先完成这次反超。预注册的公开聚合数据校准使用 Kenny 等(2003)四个可卡因自给药剂量组。剂量与 2 h 后持续奖赏缺损代理的 Spearman ρ=0.894,p=0.106:方向一致但统计证据不足,而且该数据没有退出选择字段,不能验证本文的完整阈差机制。这个不利结果迫使本文把主张限定为待检验的纵向动力表型,而不是新诊断标准。本文最后给出能与诱因敏化、负强化、参照依赖、习惯和单纯机会成本相互裁决的实验设计与跨对象边界。

关键词

关键词:成瘾;享乐递减;诱因显著性;负强化;应激;边际价值定理;机会成本;阈差反超点

一、真正需要解释的不是“为什么还会用”,而是“为什么下降的快乐没有触发退出”

“越快乐,越想重复;越不快乐,越应该停止”是一条非常强的日常直觉。它把行为持续理解为当前奖赏的函数:一个对象如果曾经带来 10 单位快乐,后来只能带来 4 单位,而且同时需要更多金钱、时间、健康和关系成本,那么停止应该比从前更容易。成瘾现象最刺眼的地方恰恰在于,这个推理经常失效。

失效本身并不是新发现。Ahmed、Kenny、Koob 与 Markou 在 2002 年讨论可卡因自给药时,几乎以同样的悖论开场:随着成瘾转变,人会投入更多时间和努力去获得不断减弱的享乐效应;他们在长时程自给药大鼠中又观察到奖赏阈值持续升高与摄入升级相关[1]。因此,一篇今天仍把“快乐变少但行为变强”本身写成新发现的论文,起点就已经落后了二十多年。

真正悬而未决的是一个更窄的问题。已有理论大多告诉我们“还有别的变量在增加”:线索触发的 wanting 可以增加,withdrawal 的不适可以增加,习惯控制可以增加,过去消费对当前消费的互补性可以增加。但用户真正经历的并不是五个变量的并排列表,而是一道具体的退出题:在这一轮,继续还是停?如果继续获得的快乐已经下降,为什么这个退出题的答案会比从前更偏向“继续”?

换言之,本研究不把“快乐”与“成瘾强度”作简单相关,而把停止理解为一个比较事件。继续与退出不是分别被绝对评分后再独立发生;退出意味着放弃当前对象、承受一段转换期,并进入某个现实可达的替代状态。于是,当前对象的收益是否下降,只决定比较的一边。另一边——不使用时的机体状态、替代奖励的可达价值、从当前行为切走所需的延迟和努力——如果也在变化,甚至变化得更快,那么“快乐下降”完全可能与“更难停”同时成立。

这一步看似朴素,却有两个必须防止的误读。第一,它不能退化成“成瘾是多因素共同作用”。多因素是事实陈述,不是动力解释;本文必须说明哪一项先改变、改变后如何回写下一轮,以及什么观测会使这套说法失败。第二,它不能把“参照点会移动”重新命名。Rigoli 与 Pezzulo 已经提出参照依赖的成瘾模型,并明确把 craving 写成使用与戒断主观价值之差[18];Keramati 等也已经用快速稳态纠偏与缓慢设定点漂移解释可卡因摄入升级[19]。因此,本文若只说“基准下沉”“反事实变差”或“快慢过程交替”,都只是既有理论的改写。

本文选择的承重点是“第一次发生方向反转的时刻”:当享乐收益仍在下降时,继续相对于退出的净优势何时第一次开始上升?这个时刻要求同时观测对象内回报和对象外退出条件,任何单一现有理论都只覆盖其中一部分。它不是临床诊断,也不是人格标签,而是一种可以被纵向数据清点、被实验操纵推翻的研究表型。

二、三门学科其实在争夺三个不同的“第一推动”

(一)神经药理学:先变的不是快乐,而是线索获得了独立的动机增益

诱因敏化理论最直接地击破“喜欢才会想要”的直觉。Robinson 与 Berridge 提出,反复药物暴露可以使赋予诱因显著性的神经系统发生敏化,使药物及其线索获得过度的 wanting;这个过程可以独立于主观 liking,也可以独立于戒断系统[2]。Wyvell 与 Berridge 的动物实验进一步显示,伏隔核安非他明能够增强奖励线索触发的工具性反应,却不增强蔗糖的享乐反应[3]。这里最重要的不是多巴胺等于“快乐”——恰恰相反,证据迫使我们把接近动机与享乐冲击拆开。

2026 年 Ramborger 等在异质大鼠的纵向可卡因自给药中提供了更尖锐的时序材料:短时程阶段、杠杆出现之前的活动和靠近有效杠杆的行为指标能够预测随后长时程阶段的摄入;心理运动敏化或耐受本身却不能解释摄入升级[4]。这并不能证明“诱因显著性永远最先”,但它至少说明:在摄入量明显升级之前,某些对象相关的接近增益已经可以读到。

神经药理学因此给出一种非常强的单因答案:难停不是因为对象越来越好,而是因为“去拿它”的触发权重越来越大。它的优势是能够解释无快乐、无明显戒断时仍然出现的强烈线索性渴求;它的缺口也同样明确:一个人在没有线索的时段为什么会觉得“不用它更糟”,以及为什么改变替代奖励的即时可得性有时能迅速扭转药物选择,并不能仅靠 cue wanting 结算。

(二)神经内分泌学:先变的是“不使用”不再是中性背景

对立过程与享乐稳态理论把问题转到另一侧。Solomon 与 Corbit 在 1970 年代已经提出,初始的情感 a 过程受到方向相反的 b 过程抵消;重复暴露后,初始过程可以减弱,反向过程则增强[10,11]。Koob 与 Le Moal 随后把成瘾推进到稳态/异稳态框架:反复使用不仅带来急性正强化,还逐步招募脑奖赏下降和脑应激系统,使负性情感状态成为继续使用的重要动力[5]。Ahmed 与 Koob 的长时程自给药模型、Ahmed 等的 ICSS 工作以及 Kenny 等的剂量研究都给出同一类证据:随着暴露延长,奖赏功能可以恶化,而摄入升级[1,6,7]。

把“神经内分泌”仅仅写成 HPA 轴和皮质醇会过度简化。与依赖相关的负性状态既涉及 HPA 反应,也涉及延伸杏仁核中的 CRF 等脑应激系统以及 dynorphin/κ-opioid 等调节。Funk 等在酒精依赖大鼠中发现,戒断期中央杏仁核 CRF 系统的干预能够选择性降低依赖动物增加的酒精自给药,而对非依赖动物影响不明显[8]。在人类可卡因依赖研究中,较高近期使用频率也与应激/线索诱发的 craving、心血管和 ACTH/皮质醇反应增强相关[9]。这些发现不支持一句粗暴的“压力激素导致成瘾”,却支持一个更窄的判断:过去使用史会改变后来“不使用”这一状态的生理与情感价格。

这一学科因此给出第二种第一推动:真正使持续升级的,不是去拿对象的线索权重,而是对象一旦缺席,机体离开原有调节带的代价变大;再使用获得的相当一部分价值,从“增加快乐”转为“解除自己先前使用史所参与制造的不适”。这就是负强化的核心力量。

但它也有自己的边界。诱因敏化理论明确允许在 withdrawal 很弱甚至消失后仍有强 wanting[2];2026 年的纵向可卡因材料也提示诱因指标可在长时程升级之前出现[4]。如果把所有晚期持续都归于应激缓解,便解释不了无明显戒断、却被线索突然重新点燃的复发风险。

(三)演化生态学:决定离开与否的从来不是当前补丁“好不好”,而是它相对于外部机会还值不值得留

演化生态学提供的不是一条成瘾生物学,而是一条对“什么时候该离开”的规范性约束。Charnov 的边际价值定理处理一个收益递减的补丁:随着觅食者停留,当前补丁的边际收益下降;最优离开时刻由当前边际收益与环境平均收益率的比较决定[12]。这条理论最重要的贡献,是把“绝对收益下降”与“应该离开”拆开。只要外部补丁也很差、旅行时间很长、切换成本很高,继续停留在一个已经变差的补丁仍可能是相对合理的。

后来的实验把这一点从纸面变成行为。Le Heron 等在人的动态觅食任务中同时操纵前景与背景奖励率,并用 D2 受体激动剂 cabergoline 操纵多巴胺状态;结果显示,离开决策取决于前景与背景奖励的动态比较,多巴胺干预尤其改变了背景机会率对离开决策的影响[13]。Cash-Padgett 与 Hayden 在猕猴中发现,行为自身的变异性也会改变最优离开阈值并导致“多留一会儿”[14]。Gancarz 等在近 1800 只异质大鼠的顺序补丁任务中进一步显示,改变离开后的旅行延迟会系统改变停留选择[15]。

这门学科对成瘾研究提出一个尖锐反问:如果快乐就是当前补丁的收益,那么快乐下降为什么一定应该触发退出?只有当外部机会率不变、转换成本不变时,这个推理才成立。若机体状态、替代奖励价值或切换成本随使用史改变,退出阈值也在移动。

然而,经典边际价值定理通常把环境平均收益率当作当前补丁之外的背景条件;成瘾恰恰可能破坏这个外生性。药物不仅改变当前补丁的收益,还可能改变评估其他补丁的机体。Tan 等对可卡因和吗啡的研究显示,药物可扰乱伏隔核中与食物、水等自然奖励重叠的神经群体反应并压制自然奖励消费[27]。这意味着“外部环境没变”不等于“外部机会的主观/生理价值没变”。演化生态学的一条前提,正被神经生物学自己的材料从内部推翻:补丁可以通过改变觅食者,反过来改变觅食者眼里的背景环境。

三、最危险的近邻已经把“容易想到的新解释”占得差不多了

如果不先承认占位者,任何跨学科新词都很容易只是把经典理论重新包装。本文至少要面对九组邻居。

第一,Solomon—Corbit 对立过程已经拥有“初始快乐弱化、反向不适增强”的时间结构[10,11]。因此“先甜后苦”“快乐少、戒断多”不是本文的原创。

第二,Robinson—Berridge 已经拥有 wanting 与 liking 分离[2],而且 2000 年后的实验与 2026 年异质大鼠研究继续支持诱因显著性能够独立预测摄入升级[3,4]。因此“越不喜欢越想要”不是原创。

第三,Koob—Le Moal 及 Ahmed 系列已经拥有奖赏设定点恶化、负强化和暴露升级[1,5–7]。因此“用药从寻乐转向止苦”不是原创。

第四,Everitt—Robbins 的行动—习惯—强迫转换和相关实验已经拥有控制从目标导向逐步向习惯/强迫组织迁移的解释[23–26]。因此“后来变自动”不是原创。

第五,Becker—Murphy 的理性成瘾模型早已把过去消费对当前消费的强互补性、稳定点与不稳定点写进动态选择[21]。因此“过去消费改变今天的需求”不是原创。

第六,Keramati 等的稳态强化学习模型已经把药物的快速稳态纠偏与慢性设定点漂移放进统一计算框架,并生成摄入升级、复发等预测[19,20]。因此“快过程叠加慢过程”不是原创。

第七,Rigoli—Pezzulo 直接把成瘾写成参照依赖评价,并以使用与戒断之间的主观价值差定义 craving[18]。因此“成瘾通过移动参照点让不使用变差”不是原创。

第八,Chou—D’Orsogna 已用动力系统把正向 a 过程、负向 b 过程、诱因显著性与反复使用的正反馈放在一套方程里[22]。因此“有自我强化反馈”本身也不是原创。

第九,演化生态学从 Charnov 到现代补丁离开实验已经拥有“收益递减并不自动意味着离开;离开取决于外部平均机会和旅行成本”的结构[12–15]。因此“机会成本决定是否停”也不是原创。

这些近邻把空间压缩得很小,反而使本文的落点更清楚:已有理论分别记录了快乐曲线、想要曲线、应激曲线、参照点、习惯权重或补丁离开阈值,却很少把“对象内享乐斜率”与“继续—退出净优势斜率”放在同一个个体、同一轮次上寻找第一次符号分离。本文要造的不是另一个“成瘾原因”,而是一个能让上述理论在同一纵向记录中竞争的时间事件。

四、“阈差反超点”:把悖论改写为两个斜率第一次反向

令 t 表示同一对象的一次标准化决策/使用轮次。为避免把神经递质直接当主观效用,本文只在行为层定义五个量:

<w:tcPr><w:tcW w:type="dxa" w:w="1300"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/><w:shd w:fill="F4F6F9"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:b/><w:i w:val="0"/><w:color w:val="1F4D78"/><w:sz w:val="18"/></w:rPr><w:t>符号<w:tcPr><w:tcW w:type="dxa" w:w="2700"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/><w:shd w:fill="F4F6F9"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:b/><w:i w:val="0"/><w:color w:val="1F4D78"/><w:sz w:val="18"/></w:rPr><w:t>含义<w:tcPr><w:tcW w:type="dxa" w:w="5360"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/><w:shd w:fill="F4F6F9"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:b/><w:i w:val="0"/><w:color w:val="1F4D78"/><w:sz w:val="18"/></w:rPr><w:t>最小可观测代理
<w:tcPr><w:tcW w:type="dxa" w:w="1300"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>H_t<w:tcPr><w:tcW w:type="dxa" w:w="2700"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>本轮接触对象产生的即时享乐收益<w:tcPr><w:tcW w:type="dxa" w:w="5360"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>同剂量/同时长后的个体内 liking 评分,或预先规定的享乐代理
<w:tcPr><w:tcW w:type="dxa" w:w="1300"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>W_t<w:tcPr><w:tcW w:type="dxa" w:w="2700"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>对象及线索触发的诱因性接近增益<w:tcPr><w:tcW w:type="dxa" w:w="5360"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>线索呈现后的接近、启动、愿付努力或 progressive-ratio 变化
<w:tcPr><w:tcW w:type="dxa" w:w="1300"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>R_t<w:tcPr><w:tcW w:type="dxa" w:w="2700"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>使用解除当前负性状态的预期缓解价值<w:tcPr><w:tcW w:type="dxa" w:w="5360"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>使用前后负性情感/戒断负荷的变化;生理应激指标仅作辅助
<w:tcPr><w:tcW w:type="dxa" w:w="1300"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>A_t<w:tcPr><w:tcW w:type="dxa" w:w="2700"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>当前状态下最优可达替代选项的机会率<w:tcPr><w:tcW w:type="dxa" w:w="5360"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>匹配延迟和努力后的非对象奖励选择/收益率
<w:tcPr><w:tcW w:type="dxa" w:w="1300"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>C_t<w:tcPr><w:tcW w:type="dxa" w:w="2700"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>从当前对象切换到替代状态的转换成本<w:tcPr><w:tcW w:type="dxa" w:w="5360"/><w:tcMar><w:top w:w="80" w:type="dxa"/><w:start w:w="120" w:type="dxa"/><w:bottom w:w="80" w:type="dxa"/><w:end w:w="120" w:type="dxa"/></w:tcMar><w:vAlign w:val="center"/></w:tcPr><w:p><w:pPr><w:spacing w:after="40" w:line="269" w:lineRule="auto"/><w:jc w:val="left"/></w:pPr><w:r><w:rPr><w:rFonts w:ascii="Calibri" w:hAnsi="Calibri" w:eastAsia="Noto Serif CJK SC"/><w:i w:val="0"/><w:sz w:val="18"/></w:rPr><w:t>实验固定或可清点的延迟、努力、金钱与转换步骤

定义继续相对于退出的净优势:

G_t = H_t + W_t + R_t − A_t + C_t。

这里的式子不是说五个量具有同一神经单位,而是给出一个行为比较的可通约框架:所有量最后都必须通过同一个选择标尺(例如最大愿付努力、延迟折返点或二选一无差异点)映射,才允许进入 G。任何研究若把皮质醇数值、lever press 次数和主观快乐分直接相加,都属于量纲错误。

传统享乐直觉隐含的是 ΔG_t 与 ΔH_t 同号:对象变得更不快乐,继续优势也应下降。本文定义“阈差反超点” t* 为同一个体的纵向轨迹中第一次满足并在预注册相邻窗口重复的事件:

ΔH_t < 0,且 ΔG_t > 0。

将 G 展开,可得反超条件:

ΔW_t + ΔR_t − ΔA_t + ΔC_t > |ΔH_t|。

这条不等式给出了“快乐越少却越难停”最小的动力解释。不是快乐下降导致难停;恰恰相反,快乐下降是一股推动退出的力。只有当线索诱因的增长、止苦价值的增长、替代机会率的下降和/或转换成本的上升,其合量超过享乐损失时,继续优势才会逆着快乐曲线上升。这个表述把一句反常现象改成了可被分解、可被干预、也可被判错的竞速关系。

为什么称为“点”而不是一种人格或阶段?因为同一个人在不同情境、不同对象上可能有不同 t,也可能永远没有 t。为什么称“阈差”而不是 craving?因为 G 包含退出端的 A 与 C;即使 craving 不变,只要替代奖励更近、更好或切换成本降低,G 就可能下降。反过来,即使 liking 与 craving 都不变,外部机会恶化也能推高继续优势。这个区分使其与 Rigoli—Pezzulo 的“使用—戒断主观价值差”形成可检验边界[18]。

最关键的一点是:t* 不是“成瘾发生时刻”的新诊断。它只标记一种纵向反向区段的入口。有人可以出现短暂的 ΔH<0、ΔG>0 而从未形成临床障碍;有人也可能在没有明显 H 下降时因强烈 W 或高 C 出现持续使用。因此它是机制研究的定位点,而不是病例判定门槛。

(一)这个“点”真正新增的是一个方向关系,而不是第五种成瘾力量

如果把 H 放在横轴、G 放在纵轴,一个人的连续使用史至少会出现四种局部运动。第一象限式的“同升”是最直观的早期强化:对象更好,继续也更占优势。第二种是 H 与 G 同降:对象变差,继续优势也变小,这是普通耐受、厌倦或饱足后退出最容易出现的轨迹。第三种是 H 上升而 G 下降:对象本身仍可带来快乐,但更好的外部选项、更低的转换成本或不再需要止苦,使离开反而更容易。第四种才是本文关心的反向区:H 下降、G 上升。

这四种运动不能用一次测量的高低替代。同一个人在 t 时刻可以同时具有较高 H 与较高 G,也可以同时较低;真正有判别力的是连续窗口的方向。如果只比较“重度使用者比轻度使用者快乐更低、渴求更高”,组间差异仍可能来自人群组成、剂量选择或基线差异。只有看到同一个人的 H 在向下走而 G 在向上走,才抓住了悖论的动力版本。

因此,“阈差反超点”不是把 W、R、A、C 再加总成一个更大的 latent factor。它新增的是一个约束:任何声称解释“快乐下降却更难停”的机制,都必须同时解释两个方向相反的斜率,以及它们第一次分叉的时刻。一个理论即使极好地预测 craving,如果不能预测这个分叉,也只解释了问题的一半;一个生态模型即使极好地预测离开,如果对使用史造成的 W/R 变化没有刻画,也同样只解释一半。

(二)反超还必须区分“瞬时交叉”与“自维持交叉”

现实选择中存在噪声。一次坏心情可以瞬间提高 R,一次朋友来访可以瞬间提高 A,一次平台推送也可以瞬间提高 W。若任意一次 ΔH<0、ΔG>0 都算 t*,理论会把普通波动误判为结构变化。因此本文把“下一预注册非重叠窗口再次满足”写进定义。这不是为了追求统计好看,而是为了区分偶发扰动与能够跨轮次回写的改变。

更强的版本还应增加扰动检验。假定在第一次候选 t* 后短暂移除线索、缓解戒断,或把一个高价值替代选项立即送到面前;若 G 随扰动下降,并在扰动撤除后重新回到上升轨迹,说明反超依赖某个可逆驱动。若 G 对这些操纵均不敏感,则反超可能已经进入结果价值去敏化阶段,或研究者的五项分解漏掉了关键变量。换言之,稳定不是“曲线连续三次同方向”这么简单,而是需要知道这条曲线对什么扰动仍然敏感。

(三)为什么不是把成本全部塞进 G 就万事大吉

任何效用模型都可以事后写出一个“总价值”,然后宣称个体选择了总价值更高的一边。这样的模型永远正确,也永远没有内容。本文避免这一危险的办法,是在数据出现前把 W、R、A、C 的操作化、操纵方式和可删除条件分别锁定。W 必须对对象/线索具有选择性;R 必须表现为非使用负性状态与再接触缓解之间的时间锁定;A 必须来自现实可达的替代选项,而不是研究者想象中的“人生价值”;C 必须是从当前选项切换出去实际要支付的时间、努力或步骤。

如果一个量不满足其操作定义,就不能为了拟合 G 而临时塞入其他项。例如失业既可能降低 A,也可能提高一般压力并影响 R;研究设计必须通过独立操纵或时间先后来拆分,而不能把同一事件重复计入两项。类似地,睡眠不足既可能降低自然奖励反应,也可能提升线索反应;没有独立测量时,应把它标为未识别共同原因,而不是让公式替研究者完成因果归属。

五、用户追问的“最先发生什么”,必须区分分子时间与逻辑时间

如果把“最先”理解为所有物质、赌博、游戏和短视频都共享的第一种分子变化,答案应当是否定的。可卡因、酒精、阿片、尼古丁以及非物质行为的直接药理入口不同;甚至同一种药物在不同给药时程、个体和环境中,耐受、诱因敏化、应激适应的相对速度都不同。把某一条受体或激素序列宣布为跨对象普遍第一步,会超出证据。

但如果“最先”问的是这个悖论何时真正成立,则存在一个逻辑上更硬的回答:最先发生的必要转变,是“退出判据开始不再单调跟随享乐收益”。在 t 之前,快乐下降仍使继续优势下降;在 t 之后,快乐继续下降却不再把行为推向退出,因为 W、R、A、C 的合成变化已经跑得更快。

这个逻辑时间又可以拆成三个经验次序假设。

假设一是“线索先行”。Ramborger 等的 2026 年研究显示,短时程阶段的 pre-lever 诱因指标可预测后续长时程摄入[4]。若该路径占主导,W 的增长应早于明显的 H 下降和 R 增强;早期移除或去价值化线索,会使 G 的上升显著减弱,即使戒断状态未改变。

假设二是“负性基线先行”。Ahmed 等报告奖赏阈值升高在长时程自给药动物中可在摄入升级前出现[1];Funk 等又给出依赖状态下 CRF 干预选择性降低过量自给药的因果证据[8]。若该路径占主导,R 的增长与不使用期的奖赏/负性状态恶化应早于明显的持续升级;缓解戒断而不改变药物线索时,G 会明显回落。

假设三是“退出端先行”。现实环境中,替代奖励可能突然变远、变慢或代价更高。Venniro 等表明,当社会互动成为立即可得的强替代奖励时,多类药物自给药可以被显著压低,而给社会奖励增加延迟或惩罚会削弱这种保护[16]。若这一路径占主导,A 或 C 的变化可以在 H、W、R 都相对稳定时先推动 G 上升。

三种顺序不是“都对”的温暖综合。它们对同一个体的 t 给出互斥预测:谁在 t 之前率先出现稳定斜率变化,谁才是这一条轨迹的主导驱动。某一条轨迹只允许一个“最先读到的变化”,其余机制只能解释后续回写。跨对象比较的任务不是强行找同一种分子第一步,而是比较哪类轨迹更常由 W、R 或 A/C 先发起。

六、为什么一轮会强化下一轮:三条动力不是并排相加,而是互相回写

第一轮:对象仍以正享乐为主,退出端近似外生

在早期使用中,H 较高,W 主要来自普通学习,R 较小,不使用并不造成明显额外负荷;A 与 C 更多由现实环境决定。此时继续主要因为“它好”,退出判据近似跟随 H。若 H 因新奇消退或耐受轻度下降,退出倾向通常应该增加。

第二轮:线索开始替代对象本身的一部分驱动力

反复配对使环境、时段、设备、地点、人物和内部感受成为对象线索。诱因显著性系统可以使这些线索在对象尚未到手时就提高启动和接近。于是 W 上升并不要求 H 上升。这个变化的功能意义是延长暴露链:即使对象本身的即时快乐开始递减,足够大的 W 仍能把个体带到下一次接触门口。

第三轮:使用史开始给“不使用”标价

重复暴露与重复撤除使奖赏和应激调节发生适应。对某些物质,非使用期出现的负性状态不再只是外源压力,而部分由前一轮暴露史制造。R 因此从接近零变成有方向的止苦价值。这里出现一个重要因果倒转:早期是“因为难受而使用”,晚期的一部分情形变成“过去的使用使现在更难受,于是再次使用显得更有价值”。Koob 系列的负强化框架拥有这部分解释[5–8],本文不重新命名它。

第四轮:机体改变后,外部机会率即使客观不变也会被重新估值

演化生态学要求比较当前补丁与背景环境;神经生物学却提示,药物可以改变处理自然奖励和稳态需要的神经群体反应[27]。于是 A 不必因为社会生活真的消失才下降。一个同样的饭局、运动、工作成就或睡眠,在不同机体状态下可以给出不同的即时价值。Le Heron 等也提示多巴胺状态会改变人对背景机会率的利用[13]。因此,退出端的变化可以同时包含“世界变差”和“评估世界的状态变了”。

第五轮:退出阈值后退,使低收益对象获得更长停留时间

一旦 A 下降或 C 上升,即使 H 继续下降,个体也可能仍留在当前对象上。更长停留意味着更多对象暴露、更密集的线索配对和更多使用—撤除循环。于是 W 与 R 获得新一轮增量;自然奖励处理的失衡也可能进一步压低 A。这里才形成闭环:不是“成瘾让人继续,所以继续让人成瘾”的同义反复,而是每一轮改变下一轮用于做退出比较的参数。

第六轮:反向区段稳定后,快乐不再具有退出信号的充分性

进入 ΔH<0、ΔG>0 的区段后,“我已经不快乐了”仍然是真实自我观察,却不再足以预测停止。因为这句话只报告 H,没有报告 W、R、A、C。此时一个人可以非常准确地知道对象已不如从前愉快,同时也非常准确地体验到“不用更难受”“别的事情没意思”“现在切走太费力”或“线索一来就想启动”。看似自相矛盾的主观报告,其实是不同项在同一比较式中的同时变化。

回写使下一轮由谁先动成为经验问题。如果一次高价值替代体验突然把 A 拉高,下一轮可能由退出端先动,G 下行;如果戒断症状被治疗而 W 仍高,下一轮可能由 cue 先动;如果远离线索而应激系统仍高,R 可能成为主导。这个模型因此要求逐轮追踪,而不是用一次横断面总分给“成瘾严重度”排序。

第七轮并非必然存在:反馈有三处可以被截断

“一轮强化下一轮”最容易被写成宿命论,好像只要进入反馈就一定越陷越深。三门学科合在一起反而给出三个明确断点。第一个断点位于 W:如果线索不再稳定预测对象、或者线索触发的接近反应被去价值化,下一轮暴露就不一定发生。第二个断点位于 R:如果非使用状态能够在不重新接触对象的情况下恢复,缓解价值就不再专属于对象。第三个断点位于 A/C:如果替代选项足够即时、价值足够高、切换步骤足够少,即使 W 与 R 尚未完全恢复,离开也可能重新成为优势选择。

这三个断点对理论特别重要,因为它们说明闭环不是同一机制的自我复制,而是跨层接力。药理学习提高 W,内稳态/应激适应提高 R,生态比较改变 A/C;只有当其中至少一条继续把暴露送回下一轮,才有机会继续更新其他项。若任何一处被稳定截断,系统都可能出现“机制尚在,但行为已经不再持续”的状态。这样一来,脑内敏化的持续存在与现实中的停止并不矛盾,戒断负荷的存在与不复吸也不矛盾;关键是它们是否还能越过当轮的退出比较。

这也给“为什么代价越来越大仍继续”一个更精确的位置。健康和关系代价可能很大,却往往是延迟的、概率性的或需要复杂行动才能转化为即时替代收益。若这些代价不能在当前选择窗口中有效抬高 A 或降低 C,它们就不会自动抵消高 W 或 R。这里不是说人“看不见长期代价”,而是说看见代价与代价进入当下退出判据是两件不同的事。只有当代价被转化为近端、可执行且可到达的退出路径时,它才真正改变 G。

七、演化生态学真正改变了问题:不是“还值不值得”,而是“什么时候值得走”

把成瘾对象类比为补丁有风险,因为酒精、可卡因、赌博或短视频不是食物斑块,人的目标也不等于最大化单位时间热量收益。本文使用的不是表面比喻,而是离开规则的形式结构:当前收益递减时,是否离开取决于外部机会率与转换成本。

经典 MVT 的关键预测是:旅行时间越长,最优补丁停留越久;环境平均收益越低,个体越能容忍当前补丁的低边际回报[12]。Gancarz 等的大样本大鼠实验直接观察到离开延迟改变停留行为[15]。这给成瘾研究一个可以实验操纵、而不是心理解释的杠杆:保持药物剂量、线索和不使用状态不变,仅改变替代奖励的延迟/努力成本。如果继续选择随替代延迟系统变化,说明“难停”至少部分属于退出机会率问题,而不是对象内部价值的固定属性。

这也解释为什么 Venniro 等的社会奖励结果如此重要[16]。如果“成瘾”意味着对象价值已经绝对压倒一切,那么一个即时社会奖励不应大幅改变选择;但当社会选项即时、可达、代价低时,多种药物的自给药可以被抑制。反过来,给社会奖励加延迟或惩罚会削弱其保护。这不是说“关系好就不会成瘾”,而是说明退出端有可操纵的因果地位。

Vandaele 等的可卡因—非药物奖励选择研究又增加一条反向约束:结果不支持把所有看似僵化的选择都读成药物习惯;在一些条件下,僵化决策反而可以偏向非药物选项[17]。因此,本文不能把 G 的上升等同于“习惯形成”。若行为对 A 与 C 的大幅操纵完全不敏感,真正的 outcome-insensitive habit/compulsion 解释将比阈差模型更有力。

八、公开数据校准:方向一致,但没有资格声称“已经验证”

为避免把一个漂亮方程留在纸上,本文在统计运行前锁定了一个最低成本的公开聚合检验。数据来自 Kenny、Polis、Koob 与 Markou 2003 年的可卡因自给药研究公开摘要[7]。四个预设暴露组的平均总剂量分别为 4.94、9.88、19.64、39.53 mg/kg;研究报告 10 和 20 次注射组在 2 h 后无持续 ICSS 奖赏阈值升高,40 和 80 次注射组在 2 h 后出现显著阈值升高。本文在分析前把“2 h 后显著阈值升高”编码为 1,“未升高/无效应”编码为 0,得到 0、0、1、1;唯一预注册检验为剂量与该二元持续奖赏缺损代理的 Spearman 单调相关,双侧 α=.05。

结果为 ρ=0.894,p=0.106。方向与“暴露越高,随后非使用期奖赏功能越可能恶化”一致,但四个聚合剂量组远不足以提供统计显著证据。更重要的是,这个数据集公开摘要没有个体级退出选择、替代奖励、转换成本或 cue wanting 字段,因此它根本不能检验 ΔG,更不能定位 t*。

这项不利结果改变了本文两处主张。第一,不能把“2 h 奖赏缺损”当作“退出更难”的替代指标;奖赏缺损只对应 R/A 侧的可能变化,不等于继续优势。第二,未来公开数据若只记录剂量、摄入量和戒断症状,即使样本再大,也不能区分 allostasis、参照依赖与本文的阈差反超,因为真正承重的字段是“同一轮的退出无差异点”。

因此,本研究没有用 Kenny 数据给新理论“背书”。相反,它暴露出当前记录体系的缺项:大量经典自给药实验能同时告诉我们“摄入更多”和“奖赏功能更差”,却不能告诉我们在同一轮中,个体为了避免退出愿意多付多少努力,以及这个愿付努力的斜率何时与享乐斜率反向。本文把这个缺项当作研究议程,而不是把缺失字段用推断填满。

九、一个最小实验怎样真正抓到 t*:必须同时记录对象内与退出端

要检验“阈差反超点”,最小设计不是再做一次严重度问卷,而是个体内重复选择实验。每个对象至少要有四类重复测量,并在分析前固定粒度。

第一类是 H。每次使用/接触的剂量、时长或奖励密度尽量匹配,立即记录享乐冲击。人类研究可用连续量表;动物研究不能把多巴胺直接当 liking,应选择事先说明的行为或 ICSS 代理并承认其边界。

第二类是退出无差异点,用一个统一单位给 G 定标。例如在每轮前后调节“继续对象所需努力”或“替代奖励延迟”,直到个体在继续与退出之间达到近似无差异。这个点比单纯 craving 更接近研究问题,因为它真正包含替代选项与转换成本。

第三类是机制分解量。W 通过线索呈现后的接近/启动和 progressive-ratio 等读数估计;R 通过使用前负性状态与使用后缓解幅度估计;A/C 通过替代奖励大小、延迟、努力和可达性实验操纵。神经内分泌指标用于识别 R 的机制来源,不能直接与行为价值相加。

第四类是时序。至少要能比较连续匹配窗口的斜率,而不是只比较“成瘾组 vs 对照组”。本文建议把 t* 作为预注册事件:在同一预设窗口长度下,H 的个体内斜率为负,而退出无差异点所对应的继续优势斜率为正,并在下一个非重叠窗口再次满足。窗口长度可由对象的使用频率预先确定;不能看到结果后再把三天改成三周。

这套设计产生五种互不相同的判决。

其一,H↓、G↓:单纯耐受/享乐消退,不构成阈差反超。其二,H↓、G↑,但去线索后 G 恢复:诱因显著性主导。其三,H↓、G↑,而缓解戒断/负性状态后 G 恢复:负强化主导。其四,H 与负性状态近似不变,仅缩短替代延迟就使 G 大幅下降:机会率/转换成本主导。其五,无论提高 A、降低 C、缓解 R 或移除 cue,G 都对结果价值不敏感:本文模型应让位于更强的习惯/强迫控制解释。

这五种结果的价值在于,它们不靠“程度更严重”来区分理论。每一种都能告诉我们哪条解释失败。

(一)最强的实验不是相关矩阵,而是三类正交扰动

仅仅同时测到 W、R、A/C 与 G 相关,仍不足以说明谁推动了反超,因为同一段使用史可以把所有变量一起带动。更有判别力的方案是把三门学科各自最擅长的操纵做成近似正交的实验轴。第一轴操纵对象线索而尽量不改变生理戒断与替代收益;第二轴缓解或加重非使用负性状态而尽量保持线索密度与外部机会不变;第三轴只改替代奖励的即时性、收益率或切换延迟,而不改变对象本身剂量。

真正的竞争预测因此不是“三个干预都有效”。如果候选 t* 由 W 首发,那么在其附近对 cue 的操纵应比等量的 R 或 A/C 操纵更早改变 G 的斜率;如果由 R 首发,缓解非使用负性状态应首先破坏 ΔG>0;如果由退出端首发,A/C 的变化应在 W、R 未显著移动之前改变 G。后续阶段三个轴都可能有效,但首发顺序只能由时间锁定的干预敏感性决定。

这种设计还有一个经常被忽略的对照:同一干预既要测“是否改变继续”,也要测“是否改变 H”。假如一个药理干预让 G 下降,同时也显著降低 H,那么它只是削弱对象总价值,并没有证明 W 或 R 的特异作用;假如增加社会替代奖励使 G 下降,却也通过情绪改善提高了 H,就必须重新解释 A 的独立效应。阈差模型要求的不是最大治疗效应,而是变量之间可识别的方向关系。

(二)一个更严格的预注册判据

未来研究可以把检验写成事件级协议。第一,预先规定标准化暴露和 H 的测量窗口;第二,预先规定用何种无差异点把继续与退出映射到共同选择单位;第三,固定 W、R、A、C 各自的代理与操纵,不允许在分析后改名;第四,预先规定斜率窗口 k,以及候选 t 必须在相邻非重叠窗口重复一次;第五,只有先出现 ΔH<0 且 ΔG>0,才进入首发机制比较;第六,首发机制必须在 t 之前出现,并且相应的靶向操纵能够使 ΔG 不再为正。

这个协议故意苛刻。它会让很多“很像”的病例被排除:只有快乐下降但继续优势未升,不算;只有 craving 升但 H 未下降,不算;只有组间重度者 H 更低、G 更高而个体内没有反超,不算;一次偶发交叉后立即恢复,也不算。宁可让存在率变低,也不能把一个反常动力表型扩大成无所不包的成瘾定义。

(三)统计模型应服务于事件,而不能替代事件

在样本足够时,可用分层状态空间模型同时估计个体的 H 与 G 潜在轨迹,并把测量误差与真实状态变化分开;也可用 change-point 模型估计符号分离最可能发生的时间。但无论算法多复杂,都应输出一个可以回到原始行为的判据:这个人在什么窗口第一次满足 H 向下而 G 向上?该窗口前哪一项先改变?靶向该项后反超是否消失?

尤其要防止一个统计陷阱:用全程数据先寻找最漂亮的变化点,再在同一数据上宣布它预测后续持续,这会把选择偏差伪装成机制。更稳妥的做法是把发现样本用于确定窗口与阈值,在独立验证样本中按锁定规则定位 t*;或者在同一长序列中严格划分发现段与验证段。本文因此坚持“先锁规则、再跑数据”:反超点必须能被下一批数据找到,而不是只能被上一批数据解释。

十、为什么“同一个体”是不可让步的分析单位

阈差反超是两个斜率的符号关系,群体均值很容易制造假象。一个群体可能由“高快乐低持续”和“低快乐高持续”两类人组成,横断面平均后看似 H 与 G 反向,却没有任何一个个体真正跨过 t。反过来,如果每个人的 t 时间不同,群体平均曲线又可能把真实的个体反超抹平。

因此,本文反对用一次“轻度/重度成瘾”分组去检验这一模型。正确粒度是事件嵌套于个体,个体嵌套于对象/情境;统计上可以采用分层模型、状态空间模型或个体内变化点分析,但核心不是某个算法,而是先保住时间次序。尤其需要把暴露、非使用状态、线索、替代机会与退出选择放在同一时间轴上。

这也使所谓“最先发生”不再是一句事后故事。假如 W 在 t 前两周已稳定上升、R 直到 t 后才出现,那么应激不能被写成那个人的首发驱动;假如 R 先升而 cue 指标平坦,就不能用诱因敏化占领第一步;假如两者都平坦而 A/C 被现实事件先改动,则外部机会率是首发项。谁先动,是记录出来的,不是理论作者挑出来的。

十一、从酒精、毒品到赌博、游戏、短视频:共享的是比较结构,不是同一分子机制

本文的跨对象外推必须收得很紧。神经药理和神经内分泌证据主要来自物质使用,尤其可卡因、酒精、尼古丁与阿片模型。把中央杏仁核 CRF、药物受体耐受或药代动力学直接搬到赌博、游戏或短视频,是类别错误。

能够跨对象保留的只有行为层结构:H 是否下降;W 是否因线索/预测而上升;R 是否出现“停止后负性状态—再接触缓解”的可重复环;A/C 是否使退出相对价值变化;G 是否出现与 H 相反的斜率。非物质行为如果没有可测的生理戒断,也仍可能由 W 或 A/C 路径出现 t*;但那不允许研究者宣称其“神经内分泌机制与酒精相同”。

酒精与镇静类物质可能更容易出现显著的 withdrawal/relief 项;兴奋剂可能在诱因显著性与奖赏功能变化上更突出;阿片具有强烈的生理依赖与负性强化通路;赌博、游戏和短视频则更需要把线索、可变比率强化、会话结构、替代奖励与睡眠/应激状态分开测量。上述差异不是同一模型的麻烦,而是模型可被比较的对象:不同对象可以通过不同的 W/R/A/C 组合跨过同一种斜率判据。

因此,t* 不能成为“万物皆成瘾”的通行证。只有当一个对象在个体内出现预注册的 H 与 G 反向轨迹时,才有资格讨论该机制表型;反复、沉浸、花钱多、使用时间长、停止后不舒服中的任意一项,都不是充分条件。

(一)物质与行为对象的共同层,只到选择几何为止

跨对象理论常见两种相反错误。一种把分子机制泛化得过头:因为物质成瘾涉及多巴胺、CRF 或 KOR,就推定赌博、游戏和短视频也必然沿同一序列发展。另一种则因为分子入口不同,拒绝任何跨对象结构。阈差模型选择中间但更严格的位置:共同性只存在于“继续—退出比较”的行为几何,机制来源仍必须逐对象验证。

例如,酒精长期大量使用后出现明显戒断时,R 有相对清楚的生理锚点;可卡因轨迹中 W 与奖赏功能下降都可能突出;赌博没有药物受体占位和药代清除,却可以形成高度特异的情境线索、损失追逐与即时解除负性情绪的行为循环;游戏和短视频则具有极低的启动/切换摩擦、密集线索和高频小奖励。它们可以产生相似的 G 轨迹,却不要求相同的 H、W、R 来源。

这一区分直接改变研究比较。跨对象研究不应问“哪个对象的多巴胺更像药物”,而应问:在标准化接触下,H 的下降率如何?候选 t 更常由 W、R 还是 A/C 首发?改变替代奖励的延迟能把 t 推后多少?停止后的负性状态是对象特异还是一般压力?这些问题允许共享一套坐标,却保留每个对象自己的生物学。

(二)短视频是一个尤其严格的反例测试

短视频常被轻率称为“多巴胺成瘾”,这恰好适合检验本文是否会犯同样错误。若研究者观察到观看时长增加、主观快乐下降,仍不能推出 t*:可能只是无聊、任务回避、算法供给变化或测量反应偏差。必须另外测出继续相对于一个真实替代选项的优势是否上升,并查清上升来自线索启动、停止后的负性状态、替代机会下降还是近乎为零的切换成本。

如果一个短视频用户 H 下降、观看时长增加,但只要手机被放到另一房间就立刻恢复正常选择,最简解释可能只是高密度 cue 与低启动摩擦,而不需要强神经内分泌故事。如果另一人移除 cue 后仍在停止期出现对象特异的负性状态,而短暂再接触稳定缓解,才有资格进一步检验 R。这个反例迫使模型保持克制:形式相似不能替代机制证据。

(三)跨对象的强预测不是“都会发生反超”,而是“反超后对扰动的敏感谱不同”

真正有价值的比较不是统计多少人跨过 t*,而是画出反超后的扰动敏感谱。物质依赖中,缓解生理戒断可能显著压低 R,却对 cue 诱发的 W 作用有限;赌博中,改变可用资金、场所摩擦和即时替代活动可能显著改变 C/A;游戏与短视频中,通知、自动播放、登录步骤等界面因素可能主要改变 W/C。相同的 ΔH<0、ΔG>0 可以因此对应完全不同的可逆路径。

如果未来数据反而显示,各类对象在 t* 后都对同一种操纵以几乎相同比例响应,那才有理由寻找更底层的共同机制。当前证据不足以先假定这种统一性。本文的跨学科价值恰恰在于允许“共同形式、不同实现”,而不是用一个神经名词抹平对象差异。

十二、与六类最近邻的裁决,不靠“更综合”,只靠谁会在什么观测上输

1. 对诱因敏化理论

诱因敏化预期 cue-triggered wanting 可在 liking 不升甚至下降时增强[2–4]。本文与其最关键的分界是退出端操纵:若在 W 保持不变时,仅提高立即可达的 A 或降低 C 就能显著降低 G,则纯诱因解释不足;若 A/C 大幅改变而 G 完全不动、cue 操纵却决定一切,则本文的生态项没有必要。

2. 对享乐稳态/负强化理论

allostasis 预期不使用期奖赏缺损与负性状态加深,并通过缓解推动再次使用[5–8]。本文增加的是“相对于退出的比较斜率”。若两个人具有相同的负性状态与缓解幅度,但替代奖励延迟不同而 G 系统不同,则单纯 allostatic load 不能结算选择;若在严格控制 A/C 后 R 已完整预测 G,则生态比较层可以删去。

3. 对参照依赖成瘾模型

Rigoli—Pezzulo 已明确提出,过高参照点会降低药物与自然刺激的主观价值,并扩大药物相对于戒断的主观价值差[18]。本文不能声称“比较基准移动”。分界在于动态观测:RDMA 可以在给定参照点上同时生成 tolerance、withdrawal 与 craving;阈差模型则要求找出 H 与退出无差异点的第一次斜率反向,并允许反超由 C 的外部变化在参照点不变时发生。若 C/A 操纵没有任何独立效应,且一个参照点参数即可解释全部个体内轨迹,本文新增层失去必要性。

4. 对稳态强化学习

Keramati 等已经拥有快速纠偏、慢速设定点漂移和摄入升级[19,20]。本文不能声称“两个时间尺度”。分界仍在外部机会:保持稳态变量相近而系统改变替代奖励的旅行延迟/努力成本,如果 t 随之移动,则只建模 homeostatic setpoint 不够;若 t 完全由 homeostatic distance 决定而与背景机会率无关,本文的 MVT 迁移失败。

5. 对习惯/强迫理论

习惯理论允许行为对结果价值去敏化[23–26]。阈差模型相反地预期,在相当一段发展区间内,继续仍对 A/C/R 的因果操纵敏感,只是比较条件已经改变。因此,真正的 outcome-insensitivity 是本文的边界,而不是本文想吸收的现象。

6. 对理性成瘾与一般动态正反馈

Becker—Murphy 已经允许过去消费提高当前需求[21],Chou—D’Orsogna 已经允许生理变化与使用互相正反馈[22]。本文不能把“历史依赖”或“正反馈”当新意。分界是具体的反向事件:若模型能够在不产生 ΔH<0、ΔG>0 的个体内区段时同样解释全部升级,那么 t 不是必要变量;反之,若临床上最困难的停止阶段系统集中在 t 之后,而控制总摄入量后该关系仍存在,才说明这一区段有独立信息。

十三、两个反向约束:三学科的材料也会削弱本文自己

第一条约束来自神经药理学。Robinson—Berridge 明确允许强烈 wanting 在 withdrawal 很弱时持续[2]。因此本文不能把 R>0 写成阈差反超的必要条件。有人可以主要依赖 W 上升跨过 t*;如果研究强行要求出现皮质醇、CRF 或明显戒断才承认“难停”,会漏掉一类真实轨迹。

第二条约束来自演化生态和替代奖励研究。Venniro 等发现强、即时的社会替代奖励可以压低药物选择[16]。因此本文不能把 t* 写成不可逆的脑状态。A 与 C 足够大幅的改变可能把 G 再拉回下降区,即使 H、W、R 没有立即复原。也就是说,阈差反超描述的是当前动力几何,不是命运宣判。

再加一条来自神经内分泌的自限:应激系统并非单一标尺。HPA 轴、延伸杏仁核 CRF、dynorphin/KOR 与主观负性情感可以出现不同时间过程;甚至实验中“使用后心情改善”可能短于常规采样窗口。任何研究若用一个早晨的 cortisol 值代替 R,都可能把机制写错。本文因此要求生理指标只解释 R 的来源,不直接定义 R。

这些约束使模型比最初设想更窄:它不解释所有成瘾、不保证所有人都有同一 t、不要求所有路径都经过应激,也不宣称 t 之后不可逆。它只解释一种最值得单独记录的反常动力区段。

三门学科互相削掉的,恰恰是各自最容易过度扩张的那一部分

神经药理学最容易过度扩张之处,是把“对象线索获得异常动机权重”进一步说成“所以外部环境不重要”。演化生态学对此构成直接限制:任何停留策略都嵌在可达替代选项和切换成本中;Venniro 等的社会选择结果说明,即便药物具有强强化史,立即且有竞争力的替代奖励仍能重排选择[16]。因此 W 可以很强,却不能先验地宣布 A/C 为零。

神经内分泌学最容易过度扩张之处,是把不使用期的负性状态当成所有持续行为的最终公共通路。诱因敏化材料反过来说明,wanting 可以在明显 withdrawal 很弱时仍被线索触发[2,3];某些轨迹中 W 足以把人送回下一轮,而无需一个占主导的 R。于是“止苦”不是“寻乐”失败后的必经第二阶段,而是若干可竞争路径之一。

演化生态学最容易过度扩张之处,则是把当前补丁与背景环境当成外生给定的价值表。神经药理与稳态研究迫使它承认,反复接触能够改变评估器本身:对象不仅占用时间,还可能改变线索的动机增益、非使用时的机体状态以及自然奖励的处理[1,5,27]。当觅食者被补丁改变后,“环境平均收益率”不再只是环境参数,而成为使用史的部分函数。

三次相互削减之后,剩下的不是三学科取长补短,而是一条更苛刻的动力陈述:继续—退出比较既不能被当前享乐 H 独占,也不能被脑内状态 W/R 独占,也不能被外部 A/C 独占;更关键的是,这些量会以不同速度变化,而且部分量会通过继续使用回写另一些量。悖论真正需要解释的,正是这些速度第一次出现符号分离,而不是哪一个静态总分最高。

一个不能被“严重度”替代的经验预测

如果阈差反超有独立信息,那么在总摄入量、传统症状数或总问题严重度相近的人之间,是否已经跨过 t 应产生不同的干预敏感性。两个摄入同样多的人,一个仍处于 H↓、G↓ 区段,另一个处于 H↓、G↑ 区段;前者增加对象成本或让自然饱足继续发展,就可能足以推动退出,后者却更依赖针对 W、R 或 A/C 的干预。反过来,如果传统严重度在控制后已经完全吸收这种差异,t 就没有必要保留。

第二个预测涉及“突然改善”。因为 A/C 是 G 的组成部分,环境中一个足够强、足够近的替代机会可以在 W/R 尚未生物学恢复时先把 G 拉低。这意味着行为停止可以领先于部分脑内风险机制的归一化。若之后替代机会消失,而 W/R 仍高,G 又可能回升。这个预测与“停止证明机制已经消失”不同,也与“脑变化存在所以停止不可能稳定”不同;它要求分别记录行为状态和潜在驱动状态。

第三个预测涉及“高快乐但仍容易停”。如果一个对象的 H 很高,但 A 更高、C 很低、R 接近零,G 仍可以不高。这种人可能非常喜欢一种活动,却能在需要时离开。模型因此把 liking 的绝对高度与失控风险明确拆开:高快乐既不是 t* 的必要条件,也不是充分条件。若未来数据发现 H 的绝对水平在控制 A/C/W/R 后仍完全决定退出,则本文的比较框架也应被修正。

十四、对治疗与预防的含义:先判断是哪一项跑赢了快乐下降

本文不是治疗指南,但它改变了干预问题的排序。面对“已经没那么快乐却停不下来”的人,第一问不应是“为什么还这么喜欢”,也不应默认“意志力不足”,而是查 ΔG 的来源。

若 W 主导,线索暴露、情境重构和 cue-response 的干预应比单纯提高自然快乐更接近病因;若 R 主导,应先处理戒断、睡眠、焦虑/负性状态和相关生理失衡,因为只有把不使用状态从“昂贵”拉回中性,继续的缓解价值才会下降;若 A/C 主导,增加立即可达、真正有竞争力的替代奖励、降低切换延迟和启动步骤可能比遥远的价值劝说更有效;若对这些操纵均不敏感,则需要考虑更强的习惯/强迫控制机制。

同样的逻辑也解释为什么“让他看到危害”常常有限。健康、金钱、关系代价属于长时程负结果,它们未必在当前 G 的比较窗口里拥有足够权重。一个人完全可能相信长期危害,同时在当前 20 分钟里仍面对高 W、高 R、低 A 或高 C。增加危害知识并没有自动改变这些项。

预防上更有意思的窗口反而在 t 之前。若能在 H 开始下降而 G 尚未转正时识别 W、R 或 A/C 中哪个量正在加速,干预所需的改变量较小。t 因而不是“严重以后才有用”的指标,而可以成为纵向监测的早期转折候选。但在证据成熟前,这一用途只能用于研究,不能直接转为个体风险处分、保险定价或就业筛选。

十五、对研究记录体系的要求:以后不能只记“用了多少”和“有多想”

现有很多成瘾数据集有摄入量、有症状量表、有 craving,却缺少“退出端”。Kenny 数据校准暴露的正是这个问题:即使能看见剂量上升与奖赏阈值恶化,也无法判断个体是不是在越来越难退出[7]。

如果未来要真正裁决这一问题,最少应在同一时间戳下记录五类字段:标准化接触的 H;对象线索下的 W;非使用状态及再接触缓解的 R;最优可达替代奖励 A;切换延迟/努力 C。随后再记录真正的退出无差异点或二选一选择。没有这个最后字段,前五项仍只是一堆解释变量。

记录还要避免三个常见错误。第一,不能拿摄入量直接代表 G,因为摄入受到供应、剂量、规则和身体上限影响。第二,不能拿 craving 直接代表 W,因为 craving 可能混入戒断缓解与参照比较。第三,不能把“替代活动存在”当 A;一个需要两小时后才能到达的社交活动,与现在一秒可开的短视频在机会率上不是同一件事。

更重要的是,记录必须允许不利结果。如果某个个体 H 明显下降但 G 同时下降,这说明耐受没有转成“更难停”;如果 W 很高但提高即时替代奖励就完全扭转选择,说明“强迫”标签过头;如果 CRF/皮质醇变化与 G 无关,神经内分泌路径就应在该轨迹里退场。模型若不能容纳这些失败,就只是一个永远正确的故事。

十六、局限:这篇论文目前能押到哪里,不能押到哪里

第一,本文提出的是理论整合后的新动态表型,不是已经完成多队列验证的事实。公开聚合校准只有四个剂量组,p=0.106,且缺少 G 的关键字段;它只能说明暴露—奖赏缺损方向值得追踪,不能给 t* 提供经验存在率。

第二,五项式是行为层的分解,不是神经量纲。H、W、R、A、C 必须通过共同选择标尺映射;不同实验若采用不同代理,不能直接比较绝对值。未来需要在同一对象上比较多种标尺的收敛效度。

第三,因果方向仍可能复杂。例如 A 下降既可能是药物改变自然奖励处理,也可能是社会、经济或生活机会先恶化;C 上升既可能来自行为惯性,也可能来自环境政策和资源限制。本文不允许因为最终都进入 G 就抹掉这些不同因果来源。

第四,跨非物质行为的外推尤其需要谨慎。赌博、游戏、短视频可以检验 H/W/A/C 的行为结构,但 R 的生理机制不能从物质使用直接类推。只有出现对象特异、时间锁定、可重复的停止负性状态及再接触缓解,才有资格讨论相应的负强化项。

第五,享乐测量本身困难。主观 liking 受记忆、期待、社会评价影响;动物 ICSS 是奖赏功能指标而非等同于“快乐”。本文把 H 定义为研究者预先指定的享乐代理,就是为了让不同研究能够争论代理是否合适,而不是假装有一个无争议的快乐计量器。

第六,模型有明确失败条件。若高质量纵向研究发现,停止困难的增加普遍发生在 ΔH 与 ΔG 同向的时期,而 t* 与后续持续/复发没有增量预测;若 A/C 的因果操纵在控制 W、R 后对 G 没有系统效应;或若一个现有的单一模型在不引入退出端变量时已经同样准确地预测这些轮次变化,那么“阈差反超点”应被降级为描述性读数,而不是独立机制单位。

十七、结论:成瘾不是把快乐越做越大,而可能把“离开”的比较条件改得更快

“快乐越少,为什么越难停?”最容易得到三个正确但不够的答案:因为 wanting 可以不依赖 liking;因为使用从寻乐转向止苦;因为行为可以习惯化、强迫化。它们各自都有坚实文献,也正因为如此,不应再被当作新的综合结论。

神经药理学、神经内分泌学与演化生态学真正相撞后,问题发生了改变。前两者告诉我们,反复使用会改变“去拿它”的增益和“没有它”的机体状态;第三者提醒我们,离开从来是相对选择,不由当前收益绝对值单独决定。把三者放到同一时间轴上,便出现一个现有单项理论不必单独记录的事件:对象内享乐收益仍在下降,而继续相对于退出的净优势第一次开始上升。

本文把这一事件称为“阈差反超点”。它的核心不是名字,而是不等式:ΔH<0,同时 ΔW+ΔR−ΔA+ΔC>|ΔH|。如果这个关系在个体内纵向数据中不存在,理论就失败;如果它存在,还必须继续用 cue 操纵、负性状态干预、替代机会与转换成本操纵去判定是谁先推动了反超。

所以,用户问题中“最先发生的改变”不应被回答成一种跨所有成瘾对象都相同的分子事件。更可靠的答案是:最先必须发生的是退出判据对快乐曲线的单调跟随被打破;完成这一反超的第一推动,在不同轨迹上可以分别是诱因增益、负性状态或退出机会率。随后,继续使用又回写这些变量,使下一轮的退出条件进一步移动。

这也给“越来越难停”一个不靠道德化、也不靠神经宿命论的解释:人未必越来越喜欢对象;相反,快乐可能正在下降。真正升级的,是对象对下一轮比较条件的影响力。只要这份影响力跑赢快乐的衰减,低快乐就不会自动变成退出。成瘾最反常的一幕,因而不再需要假定“对象越来越值钱”,而是继续侧与退出侧的比较条件移动得比享乐衰减更快。

参考文献

Ahmed SH, Kenny PJ, Koob GF, Markou A. Neurobiological evidence for hedonic allostasis associated with escalating cocaine use. Nature Neuroscience. 2002;5(7):625–626. doi:10.1038/nn872.

Robinson TE, Berridge KC. The neural basis of drug craving: an incentive-sensitization theory of addiction. Brain Research Reviews. 1993;18(3):247–291. doi:10.1016/0165-0173(93)90013-P.

Wyvell CL, Berridge KC. Intra-accumbens amphetamine increases the conditioned incentive salience of sucrose reward: enhancement of reward “wanting” without enhanced “liking” or response reinforcement. Journal of Neuroscience. 2000;20(21):8122–8130. doi:10.1523/JNEUROSCI.20-21-08122.2000.

Ramborger J, Mosquera J, Brennan M, et al. Incentive salience, not psychomotor sensitization or tolerance, drives escalation of cocaine self-administration in heterogeneous stock rats. Neuropsychopharmacology. 2026;51:1176–1187. doi:10.1038/s41386-026-02350-0.

Koob GF, Le Moal M. Drug abuse: hedonic homeostatic dysregulation. Science. 1997;278(5335):52–58. doi:10.1126/science.278.5335.52.

Ahmed SH, Koob GF. Transition from moderate to excessive drug intake: change in hedonic set point. Science. 1998;282(5387):298–300. doi:10.1126/science.282.5387.298.

Kenny PJ, Polis I, Koob GF, Markou A. Low dose cocaine self-administration transiently increases but high dose cocaine persistently decreases brain reward function in rats. European Journal of Neuroscience. 2003;17(1):191–195. doi:10.1046/j.1460-9568.2003.02443.x.

Funk CK, O'Dell LE, Crawford EF, Koob GF. Corticotropin-releasing factor within the central nucleus of the amygdala mediates enhanced ethanol self-administration in withdrawn, ethanol-dependent rats. Journal of Neuroscience. 2006;26(44):11324–11332. doi:10.1523/JNEUROSCI.3096-06.2006.

Fox HC, Talih M, Malison R, Anderson GM, Kreek MJ, Sinha R. Frequency of recent cocaine and alcohol use affects drug craving and associated responses to stress and drug-related cues. Psychoneuroendocrinology. 2005;30(9):880–891. doi:10.1016/j.psyneuen.2005.05.002.

Solomon RL, Corbit JD. An opponent-process theory of motivation. II. Cigarette addiction. Journal of Abnormal Psychology. 1973;81(2):158–171. doi:10.1037/h0034534.

Solomon RL, Corbit JD. An opponent-process theory of motivation. I. Temporal dynamics of affect. Psychological Review. 1974;81(2):119–145. doi:10.1037/h0036128.

Charnov EL. Optimal foraging, the marginal value theorem. Theoretical Population Biology. 1976;9(2):129–136. doi:10.1016/0040-5809(76)90040-X.

Le Heron C, Kolling N, Plant O, et al. Dopamine modulates dynamic decision-making during foraging. Journal of Neuroscience. 2020;40(27):5273–5282. doi:10.1523/JNEUROSCI.2586-19.2020.

Cash-Padgett T, Hayden BY. Behavioural variability contributes to over-staying in patchy foraging. Biology Letters. 2020;16:20190915. doi:10.1098/rsbl.2019.0915.

Gancarz AM, Mitchell SH, George AM, et al. Reward maximization assessed using a sequential patch depletion task in a large sample of heterogeneous stock rats. Scientific Reports. 2023;13:7027. doi:10.1038/s41598-023-34179-8.

Venniro M, Zhang M, Caprioli D, et al. Volitional social interaction prevents drug addiction in rat models. Nature Neuroscience. 2018;21:1520–1529. doi:10.1038/s41593-018-0246-6.

Vandaele Y, Vouillac-Mendoza C, Ahmed SH. Inflexible habitual decision-making during choice between cocaine and a nondrug alternative. Translational Psychiatry. 2019;9:109. doi:10.1038/s41398-019-0445-2.

Rigoli F, Pezzulo G. The traps of adaptation: Addiction as maladaptive referent-dependent evaluation. Cognitive, Affective, & Behavioral Neuroscience. 2023;23:973–985. doi:10.3758/s13415-023-01086-4.

Keramati M, Durand A, Girardeau P, Gutkin B, Ahmed SH. Cocaine addiction as a homeostatic reinforcement learning disorder. Psychological Review. 2017;124(2):130–153. doi:10.1037/rev0000046.

Keramati M, Gutkin B. Homeostatic reinforcement learning for integrating reward collection and physiological stability. eLife. 2014;3:e04811. doi:10.7554/eLife.04811.

Becker GS, Murphy KM. A theory of rational addiction. Journal of Political Economy. 1988;96(4):675–700. doi:10.1086/261558.

Chou T, D'Orsogna MR. A mathematical model of reward-mediated learning in drug addiction. Chaos. 2022;32(2):021102. doi:10.1063/5.0082997.

Everitt BJ, Robbins TW. Neural systems of reinforcement for drug addiction: from actions to habits to compulsion. Nature Neuroscience. 2005;8:1481–1489. doi:10.1038/nn1579.

Deroche-Gamonet V, Belin D, Piazza PV. Evidence for addiction-like behavior in the rat. Science. 2004;305(5686):1014–1017. doi:10.1126/science.1099020.

Vanderschuren LJMJ, Everitt BJ. Drug seeking becomes compulsive after prolonged cocaine self-administration. Science. 2004;305(5686):1017–1019. doi:10.1126/science.1098975.

Pascoli V, Hiver A, Van Zessen R, et al. Stochastic synaptic plasticity underlying compulsion in a model of addiction. Nature. 2018;564:366–371. doi:10.1038/s41586-018-0789-4.

Tan B, Browne CJ, Nöbauer T, Vaziri A, Friedman JM, Nestler EJ. Drugs of abuse hijack a mesolimbic pathway that processes homeostatic need. Science. 2024;384(6693):eadk6742. doi:10.1126/science.adk6742.

附论零 · 本组六篇的分工,以及另外三篇为什么不发

本组出自同一份投稿。作者就「成瘾」这个原初问题做了九次跨学科碰撞,每次换三门与成瘾研究无关的成熟学问,撞出一个新对象与一条可清点的读数。九篇独立盲评的结果是 131.65–137.85,本站发表其中六篇。下面先说这六篇各管什么、彼此在哪里分开,再说另外三篇为什么不发。

零.1 六个位置:一条从「算不算」到「怎么算稳住了」的链

九篇不是九个并列的观点,六篇也不是同一件事的六种说法。最省事的读法是看每一篇把镜头架在成瘾过程的哪一段——它们各自撤销的是一条不同的先验,因而观察位置也不同

六篇合起来是一条链:先划线,再看分岔,再看深化,再决定何时动手,然后决定怎么结算,最后决定凭什么算稳住了。每一篇都可以单独读,但链条的位置决定了它们不会互相顶替。

零.2 两对最容易混起来的,以及它们的合并条件

第一对:优先权可撤回性 × 证据—负担双钥门控。两篇都在做同一件事——抬高举证责任。前者抬的是「算不算成瘾」的举证门槛(在下调边界已现、改道可行时,优先权仍反复不能被重新配置),后者抬的是「可不可以加码干预」的举证门槛(状态证据与行动负担两把钥匙必须同时成立)。二者可以分离:一个人可以满足可撤回性失配而第二把钥匙不成立;也可以两把钥匙都成立而尚未满足可撤回性失配。若在同一批个案上两者的判定时点系统性重合,两篇之一是多余的。

第二对:判定内生性 × 恢复次序约束。两篇都落在恢复这一段,但问的不是同一件事:前者问判定这个动作本身做了什么(判定改变了资格、供应、监管,因而改变了被判定者的轨迹),后者问凭什么说已经稳住(三次转变必须依次完成,时长不是判据)。分离点很干净:恢复次序约束的三个关口可以在完全没有任何正式判定发生的情况下逐一达成——无人给出过「他恢复了」这句话,而可行域、转移核与回返轨迹已经换了。若在实证上三关的达成总是伴随一次正式判定,两篇应当合并。

零.3 另外三篇为什么不发

本站的做法是:择优的结果要印在页面上,不能只烂在后台。读者有权知道同一位作者就同一个原初问题写过九稿,而编辑部只发其中六稿,以及凭什么。

三篇都是可修的,本站不退稿。

零.4 这六篇共同的强项与共同的短板,说在前面

强项在可证伪性(本组六篇 143–148,是作者历次最高)。六篇的公开数据检验都是同一个做法:先冻结规则,再算数,结果不利照登——用 RTI 评估报告 119 所学校的效应方向做先注册的二项检验,把自己草案里「低阶介入天然无害」那条打掉;用双生子相关矩阵复算,发现遗传信号并逐阶段单调上升;预注册的 Spearman 得到 ρ=0.894 但 p=0.106,自陈「方向一致,但没有资格声称已经验证」;写作前拿公开补充材料检验一个更漂亮的候选定义,因参数不可分别识别而当场把它删掉;用常数危险外推做十年与二十年两个方向的推算,两个方向的结果都报。多篇还写死了认错日期。

短板集中在不可还原性。六篇的新对象都是「给成瘾的账本补上一个此前不记录的字段或次序」,压缩到五十字之后,多数还能落回某个成熟概念的射程之内。文末「附论一」就是针对这一处做的补切——每篇找出一位原稿未曾正面交手、而离它最近的占位者,并给出一条两者预测相反的可判决点。这部分是本站编辑所加并署名,作者原稿的论证、数据与结论一字未改。

附论一 · 最近邻加固:与局部改善,与时间延展的行为模式

一.1 原稿已经交手的,和漏掉的那一位

本文对最近邻的处理是本组九篇里最厚的:对立过程理论、稳态应变与奖赏阈值抬高、激励敏化、习惯—强迫转换,全部在正文里被逐一裁决,而且不是「侧重不同」式的和稀泥,是逐家给出「谁会在什么观测上输」。但有一位没有出现,而它离本文的核心量最近——局部改善(melioration)。

赫恩斯坦与普雷莱克提出的这一理论主张:个体按局部平均回报率而非总体回报率分配行为,因而会稳定地落入总体次优的均衡;这条理论从一开始就被明确用来解释成瘾。它与本文共享同一个结构(继续与退出之间的比较发生了系统性偏移),却把原因放在分配规则上,而不放在比较量本身的变号上。

一.2 分离线:分配规则,还是比较量变号

局部改善不要求享乐收益下降。在赫恩斯坦的框架里,即使 H 恒定,只要个体按局部平均率分配,就会持续偏向那个短期回报更高的选项并落入次优。本文的定义性条件恰恰相反:反超点必须由 ΔH<0 定义——即时享乐收益的斜率已经为负,而「继续相对于退出」的净优势斜率首次为正。若没有 ΔH<0,本文所说的那个点根本不存在。

可判决点。构造 H 保持不变、而可达替代机会率 A 被外生降低的条件(例如实验性地移走替代活动,或利用替代机会骤减的自然实验)。局部改善预测继续率随局部平均率的变化而变化,与 H 的斜率无关;本文预测在 H 不变的条件下不应出现反超点,因为反超点是被 ΔH<0 定义的。若在 H 完全不变的条件下也观察到同样的「越不快乐越难停」曲线,本文的定义性条件失败,应当并入局部改善。

一.3 第二位:把成瘾看作时间延展的行为模式

拉克林一系的目的论行为主义主张:成瘾不是一连串错误的单次选择,而是一个时间延展的行为模式,评价单位应当是模式而不是轮次。这对本文构成一个真实威胁——本文把 t 定义为「同一对象的一次标准化决策/使用轮次」,如果正确的单位本来就是模式,那么「两个斜率在某一轮次首次反向」这个说法就是把单位切错了之后产生的假象。

分离线是单位,而这条分歧可以被裁决。本文预测反超点是一个可定位的轮次,且个体内前后两侧的行为参数存在不连续;模式理论预测不存在这样的不连续点,观察到的只是分段平均值的平滑漂移。可判决点:在密集纵向数据上做变点检测。若检出的变点位置在不同的分段方式下不稳定,或者置信区间宽到覆盖整段观察期,本文的 t* 是一个统计假象,应退回模式描述。

附论二 · 可裁决预测

1. H 不变时不应出现反超点 在享乐收益斜率被固定的条件下(外生降低替代机会率而不改变对象本身),本文预测不出现反超点。若同样的「越不快乐越难停」曲线照常出现,本文的定义性条件失败,应并入局部改善。

2. t* 必须是一个稳定的变点 在密集纵向数据上做变点检测。若检出位置在不同分段方式下不稳定,或置信区间覆盖整段观察期,则 t* 是统计假象,本文应退回时间延展模式的描述。

3. 五个量必须过同一把标尺 正文要求 H、W、R、A、C 最终都通过同一个选择标尺(最大愿付努力或延迟折返点)通约。若在同一批被试上,五个量的标尺化结果彼此不可比(例如 R 无法用愿付努力表达),则 G_t 这个和式没有意义,公式应降级为定性框架。

补充参考文献

以下为文末三节附论所引,均经核验为真实可查出版物。

Herrnstein, R. J., & Prelec, D. (1991). Melioration: A theory of distributed choice. Journal of Economic Perspectives, 5(3), 137–156.

Herrnstein, R. J., & Prelec, D. (1992). A theory of addiction. In G. Loewenstein & J. Elster (Eds.), Choice over time (pp. 331–360). Russell Sage Foundation.

Rachlin, H. (1997). Four teleological theories of addiction. Psychonomic Bulletin & Review, 4(4), 462–473.

编辑修订说明
  1. 文末新增附论零、附论一、附论二三节。本篇正文的近邻裁决已经很厚(对立过程、稳态应变、激励敏化、习惯—强迫转换均逐家给出相反预测),附论一只补一处漏:赫恩斯坦与普雷莱克的局部改善理论——它与本文共享同一个比较结构,却把原因放在分配规则而非比较量的变号上,是本篇最近的一位未交手占位者;另补拉克林的时间延展模式,针对本文「以轮次为单位」这一选择。
  2. 参考文献相应补入三条,均经核验为真实可查出版物。
  3. 正文按站内长文体例重排层级,论证、数据与结论一字未改;原稿自标的栏目行改为本站「成瘾频道」。
本次修订仅涉及上述事项,作者原有的论证结构、核心判断与自设的证伪条件均未改动。(编辑:Claude · 2026年8月8日)
关于本文的创新智商标注 本文在未经任何编辑改动的原稿状态下接受过一次盲评,五维(S 结构精确度/D 差异锐度/E 纠缠深度/I 不可还原性/F 可证伪性)分别为 S 141/D 138/E 136/I 128/F 145,按固定权重计算的综合分为 137.25。该分数对应的是投稿原稿,不含文末三节附论。本次编辑加固的设计目标是 140,但按本站评分规程,任何人不得为自己参与撰写的文本打分,故这个目标只是修改方向,不是分数,不计入上述读数;如需认证分,须由独立评分者重新盲评并署名。创新智商衡量的是「一个此前不存在的认知物在发生意义上走得多深」,不衡量该判断的真伪——真伪交给现实与时间。(评分:Claude · 盲评于 2026年8月8日 · 参照语料=成瘾研究/临床诊断学/学习心理学/行动哲学/公共卫生伦理/动力系统与早期预警信号公开文献,截至 2026 年 8 月)
专家点评EXPERT COMMENTARY
创新点在哪里/ WHAT IS NEW

「快乐越少越难停」是成瘾研究里被引用最多、也最容易被含糊带过的一个悖论。既有的处理办法通常是换一个动力来源(不是喜欢是想要、不是奖赏是缓解),本文的做法不同:它不换动力,而是把悖论改写成两个斜率的先后关系——即时享乐收益的斜率已经为负,而继续相对于退出的净优势斜率首次为正,这两件事发生在同一个体、同一时间线上的某一轮次。这一步把一个定性悖论变成了一个可定位的事件。

第四节给出的 G_t = H + W + R − A + C 是全篇的承重处,作者对它的自我限权也做得对:明确声明这不是说五个量有同一神经单位,而是要求它们最终通过同一把选择标尺通约。第七节引入演化生态学之后,问题从「还值不值得」变成「什么时候值得走」——这是三门学科里唯一真正改变了问题形状的一门,也是本文纠缠深度的主要来源。

应用展望/ WHERE IT CAN BE USED
  • 治疗的分诊 先判断是哪一项跑赢了快乐下降——是线索诱因 W、缓解价值 R,还是替代机会率 A 的塌缩、转换成本 C 的堆高。四种情况对应四种不同的干预,而现有做法往往只做其中一种。
  • 研究记录体系 正文第十五节的要求值得单独执行:以后不能只记「用了多少」和「有多想」,必须同时记录退出端的量(替代机会、转换成本)。缺了退出端,反超点在原则上就测不到。
  • 跨对象比较 酒精、赌博、游戏、短视频共享的是比较结构而不是同一分子机制——这一条对「行为成瘾算不算成瘾」的争论有直接含义。
  • 个体化随访 正文坚持「同一个体」是不可让步的分析单位;组间设计在原则上测不到 t*,这一点对现有随访设计是个硬约束。
边界与下一步。本文的限度有两处,作者自己都点到了。其一是公开数据校准只做到了方向一致(预注册 Spearman ρ=0.894,p=0.106),四个聚合剂量组远不足以提供统计证据,而且该数据集根本没有个体级的退出选择、替代奖励与转换成本字段——也就是说,它连原则上都无法检验 ΔG。作者把这一点写在标题里(「方向一致,但没有资格声称已经验证」),是本组九篇里最克制的一处表述。其二是附论一补的那条:若在 H 完全不变的条件下也能观察到同样的曲线,本文的定义性条件就失败了——这条检验并不昂贵,应当优先做。
点评人 Claude · 依王德生《SDE 本体论》 · 2026年8月8日