心理学的复制危机:教科书里被修正的六个经典结论,以及 IPsyO 为什么不能只背结论(2026)

2026 年 8 月 13 日
阅读约 8 分钟
4,195 阅读

心理学近十几年经历了一轮大规模的「重复实验检验」,结果是一批写进教科书的经典结论被修正甚至推翻。这件事对备赛的直接含义是:只背结论的学生,在考判断力的题目上会系统性失分

2015 年那次大规模重复,发现了什么

2015 年,一个由数百名研究者组成的国际协作团队(Open Science Collaboration)在《Science》发表了一项工作:他们挑选了 100 项发表在心理学主流期刊上的研究,按原始方法重新做一遍,然后比较结果。

2015 年 Open Science Collaboration 重复实验结果对比:100 项原始研究中约 97% 报告统计显著结果,重复实验中约 36% 得到显著结果,平均效应量约为原研究的一半
2015 年大规模重复实验的核心发现 · 数据引自 Open Science Collaboration (2015),具体数值以原论文为准 · 制图:IPsyO 国际心理学奥赛编辑部

这里必须说清楚一件事,否则容易误读:重复失败不等于原研究造假,也不等于结论一定是错的。它更常见的含义是——原始研究的样本太小、条件太特殊,导致证据强度被高估了。心理学并没有因此「破产」,恰恰相反,能够系统地发现并公开自身问题,本身就是一门科学成熟的标志。

六个被修正的经典结论

下面这几个例子,几乎都出现在面向高中生的心理学入门材料里。它们不是「被证伪的谣言」,而是证据地位发生了变化的结论——写作和答题时的说法应该跟着调整。

经典结论 入门材料里的常见印象 后续重复实验 / 再分析 现在更稳妥的说法
自我损耗(ego depletion) 意志力像肌肉,用过会累,先做自控任务会让后续自控变差 2016 年一项跨多个实验室的注册重复研究未能复现该效应,估计效应接近零 存在实质争议,不宜当作既定结论直接引用
表情反馈(咬笔实验) 用嘴摆出类似微笑的动作,会让人觉得漫画更好笑 2016 年由十余个实验室组成的注册重复未复现原始结果;后续对边界条件仍有讨论 效应即便存在也远弱于原始报告,且高度依赖具体条件
高能量姿势(power posing) 摆两分钟「强势姿势」会改变激素水平与冒险倾向 2015 年一项更大样本的重复未复现激素与风险偏好上的效应;原作者之一后来公开表示不再相信该效应 生理与行为层面的主张证据薄弱;主观感受层面仍有讨论空间
棉花糖实验 四岁能否延迟满足,强力预测多年后的学业成就 2018 年一项样本更大、更具代表性的重复发现关联小得多,且在控制家庭背景与早期认知能力后大幅减弱 关联存在,但相当一部分可由家庭条件与早期能力解释
斯坦福监狱实验 情境力量强大到能让普通人迅速变成施虐者 并非重复失败,而是方法与档案证据受到质疑(对「狱警」的引导、需求特征等);2019 年基于档案资料的分析引发广泛讨论 可作为讨论情境力量的历史案例,但不宜当作严谨实验证据
成长型思维干预 告诉学生能力可以增长,学业成绩就会明显提升 多项元分析显示平均效应较小,且在不同人群与实施条件下差异明显 方向可能有益,但平均效应小,需说明对谁、在什么条件下有效

以上均为学术文献中的公开讨论,具体结论、数值与后续进展以各原始论文及最新文献为准。

为什么会这样:三个结构性原因

  • 样本太小、统计功效不足。过去大量研究用几十人的样本去检验本身就很微弱的效应,这种设计即使效应真实存在也经常测不到;而一旦「测到了」,估计值往往被放大。
  • 发表偏倚。期刊长期更青睐「发现了显著效应」的论文,做了但没结果的研究常常进不了文献。于是公开文献看起来比真实情况乐观得多。
  • 研究者自由度。数据收集到多少停、剔除哪些被试、报告哪个指标——这些看似技术性的选择如果在看到数据之后再定,会显著抬高假阳性率。预注册(提前公开假设与分析方案)正是针对这一点的制度性补丁。

怎么判断一个结论稳不稳:五级证据阶梯

这是比记住任何一个案例都更有用的工具。看到一个心理学结论,先定位它在下面这条阶梯的哪一级。

心理学结论的五级证据阶梯:单个小样本实验、大样本单次重复、预注册研究、多实验室注册重复、高质量元分析,证据强度依次递增
心理学结论的证据强度阶梯与四问自查 · 制图:IPsyO 国际心理学奥赛编辑部

这件事对 IPsyO 备赛的三条含义

第一,材料题考的往往不是教科书版本。材料客观题以具体研究材料为基础出题,考的是在材料给定范围内做判断;具体题型与问法以主办方发布的官方说明为准。只背结论的学生会答出教科书里那句话,而正确答案要求你在这份材料给定的样本、设计与数据范围内作判断——两者经常不一致。这也是为什么方法与统计训练的收益远高于扩充知识面,具体训练思路可参考 资格赛冲刺指南

第二,「重复 + 延伸」是被严重低估的提案选题类型。很多学生在写研究提案时以为必须发明一个全新理论,结果做出一个既不可行也说不清的设计。而选择一个证据地位有争议的经典效应、在自己能触达的样本上做一次有明确假设的检验,是一个成熟、可执行、也容易讲清楚意义的选题方向。

第三,被追问时能不能答出「我的研究可能测不到」,是分水岭。「如果结果不显著说明什么」是任何研究设计都绕不开的一问。答「说明假设错了」的学生,和能区分「效应不存在」与「样本量不足以检出这个效应」的学生,展现的方法素养完全不同。想了解这类能力在赛事整体评价中的位置,可参考 IPsyO 是什么

常见问题

Q:既然这些经典结论都被推翻了,心理学还值得学吗?
正好相反。能大规模检查自己的既有结论、公开承认哪些站不住,是一门学科自我纠错能力的体现——很多领域并没有做过这样的清理。对学生而言,这反而是最好的入门时机:现在的心理学训练把研究方法、效应量与预注册放在核心位置,学到的是一套可迁移到任何实证领域的判断力。

Q:备赛时还能不能用棉花糖实验、斯坦福监狱实验这些例子?
可以用,但要改说法。不要写成「研究证明延迟满足决定未来成就」,而写成「早期研究报告了这一关联,后续更大样本的重复发现关联小得多,且部分可由家庭背景解释」。这种写法在任何评分体系里都不会吃亏,反而体现了对文献的了解。斯坦福监狱实验同理,作为历史案例讨论没问题,作为严谨证据引用则要谨慎。

Q:高中生怎么判断手上的资料是不是过时的?
三个简单信号:一看结论的表述是否绝对(「研究证明 X 导致 Y」通常比「有证据显示 X 与 Y 相关」更可疑);二看有没有提样本量与被试来源;三看资料本身的年份,尤其 2015 年之前编写、之后没有修订的入门读物,容易保留已被修正的结论。遇到关键结论时,用效应量与重复研究这两个关键词再检索一次通常就能看出端倪。

Q:这些内容会直接出现在 IPsyO 题目里吗?
题目的具体覆盖范围与命题风格以主办方发布的考纲与官方说明为准,我们不预设某一届会考什么。可以确定的是,赛事结构本身重视基于材料的判断与研究设计能力,而复制危机所训练的正是这套判断力——它更像是一种底层能力,而不是一个需要单独背诵的考点。

本文由 IPsyO 国际心理学奥赛编辑部发布,由翰林教育(Hanlin Education)为中国国际学校学生及家长运营。文中涉及的研究发现均为学术文献中的公开讨论,具体数值、结论与后续进展以各原始论文及最新文献为准。赛事的正式规则由主办方制定并逐年调整,报名、资格、赛程、评分与奖项等具体信息请以 IPsyO 官方页面 / APA 官方文本为准。文中若有错漏,我们将在 7 个工作日内更正。任何备考安排均不构成录取或获奖承诺。

延伸阅读

查看更多