D 块 · 收束 · 第 43 课

研究效度

一个震撼的社会心理学故事,究竟能证明到哪一层?

📍 第 42 课把 515 项宽证据和 27 项严格证据放在一起读。本课收束整个 D 块:遇到一句“研究证明”,怎样判断它测到了什么、能否归因、能否再现,又能外推多远?
🎯 用构念效度、内部效度、可重复性和外部效度逐层核验,在证据止步处停止结论。不要把研究压成“真/假”:测到一个结果,不等于证明了目标机制;一次实验成立,也不等于现实政策有效。
这课只回答一个问题:一个震撼的社会心理学故事,究竟能证明到哪一层?主线是“测量对象 → 因果解释 → 再现预测 → 现实外推”。这四步是本课的检查顺序,不是某位学者提出的单一正式模型。

同一个经典,两种相反的总判决

贯穿全课的生活教学假设

你看到一段短视频:“斯坦福监狱实验已经证明,只要穿上制服,普通人几天内就会自然变残酷。”评论区另一方只回一句:“这个实验翻车了,所以情境和制度根本不影响人。”

两边都在要一个总判决:全真,或全假。但真正需要问的是,哪一层结论出了问题,哪一层仍要另找证据。

这是证据判断练习,不是重新教授该实验为稳定效应。

研究效度(research validity)不是一个总分,而是一组“证据是否支持目标结论”的判断。构念效度问测量和操控是否对应声称的概念;内部效度问结果能否归因于目标变量;外部效度问结论能否跨人群、时间和场景。本课再把可重复性单独加入:同一精确预测能否在透明、改进的程序中再次出现。

“真还是假”把四个问题压成了一个

顺手但不够的解释

常见说法:原实验有问题,所以效应全假;或者原实验观察到结果,所以现实机制和政策都被证明。

解释困难:它混淆了测量、因果、复制和外推。一个起源故事失实,独立证据链仍可能支持相邻现象;一个结果出现,也可能有替代解释。

本课的解释

核心判断:构念、内部、重复和外部是四个不同问题;上一层通过,不会自动替下一层背书。

方向条件:“证据不足”不等于“已经证伪”;精确预测失败,也不能自动否定所有更宽概念。

先把“现象、原实验、机制和现实外推”分开。这四个词是课程的行动链,不是新的正式心理学理论。每出现一句“研究证明”,都把它改写成:哪项研究、测了什么、比较了什么、排除了什么,又要外推到哪里?

四项检查:每一层都要单独过关

构念效度
操控和测量真对应声称的概念吗?
内部效度
结果真能归因于目标变量吗?
可重复性
精确预测能在改进程序中再次出现吗?
外部效度:能跨人群、时间、场景和政策层级到哪里?

四项不是流水线通关章。构念很清楚,因果仍可能有混淆;直接复制成功,现实外推仍可能过远;原实验失败,相邻现象仍可由独立证据支持。

最实用的改变,是把“这个研究靠谱吗”改成四句可回答的问题。你不必给整篇论文一个神秘总分,只要写清哪一项较强、哪一项有限、哪一项不足,并让结论停在证据止步处。

案例一:斯坦福监狱先卡在内部效度

观察到残酷行为,不等于证明“随机角色自动使人残酷”。后来的档案审计发现,研究团队向“狱警”传达了制造压迫与无力感的目标,研究者还同时兼任管理者。需求特征(参与者揣测研究目的后的配合反应)、引导和角色标签纠缠在一起,单靠这次观察分不开。

最窄结论是:这项研究不能把行为变化单独归因于“角色本身”。它没有证明制度、领导或群体身份从不影响行为;这些更宽命题需要各自的证据。

内部效度不足,不等于现实制度没有影响。否定一个实验的单一因果解释,和否定整个研究问题,是两件事。

案例二:老年启动卡在精确预测的可重复性

“接触老年词会在无意识中让人走慢”,这条精确预测没有在改进测量的直接复制中再现。后来的复制改用客观计时,没有得到原预测;它还发现,主试的预期会影响结果和人工计时。

最窄结论只打击这条精确链:老年词 → 未察觉概念 → 自动走慢。它不能自动推出“所有启动、所有自动加工或所有无意识影响都是假的”。

复制失败的打击面必须与预测一样窄。先写清复制了哪个程序、测了哪个指标,再决定哪句话应降级。

案例三:破窗卡在从实验到政策的外部效度

短时失序线索、社区长期因果和警务政策是三条不同命题。局部线索有时会影响一次守规行为,但后来的方法审计和综述不能支持从它直接跳到“失序造成严重犯罪,再用零容忍治理”。

最窄结论允许“环境线索在某些场景影响即时行为”,却拒绝两次自动跨越:从一次行为到社区犯罪,再从社区因果到强硬政策。

外推不是把实验结论放大字号。人群、时间、结局指标、制度与副作用变了,就需要新的证据链。

行动:四问写清证据止步处

遇到任何震撼结论,先把要证明的句子原样写下,再逐层回答。若某项信息缺失,就写“目前不足”,不要补成“已经证伪”或“肯定成立”。

1
构念效度:到底测了什么?

操控、量表和行为指标是否对应声称的概念?“穿制服”不自动等于“角色内化”。

2
内部效度:真能归因吗?

随机化、对照、盲法和程序有没有排除研究者引导、选择与其他替代解释?

3
可重复性:精确预测再现了吗?

更透明、测量更好或预先注册的研究,是否再次得到同方向、同指标的结果?

4
外部效度:能外推到哪里?

样本、时间、真实行为、文化、制度和政策副作用是否与原研究相同?不相同就需要新证据。

ByteDance 日本 · 抽象教学假设

想象一个虚构的产品评审:一次小型用户实验发现按钮颜色改变了当日点击,汇报直接说“该颜色会长期提高留存,应该全量推广”。

四问会把它拆开:点击是否测到想要的产品价值?随机化和埋点能否排除其他变化?相同预测能否在新样本再现?一次当日点击能否外推长期留存与全量策略?

这是通用证据审计场景,不描述 ByteDance 或任何真实实验;真正决策还需要业务、伦理和成本证据。

和相邻概念的边界

证据不足

意思:当前设计或资料无法支持目标结论。

下一步:补测量、对照、复制或外推证据。

已经证伪

意思:明确预测受到有针对性的反证。

下一步:写清被否定的精确命题,不扩大打击面。

原实验有问题

问法:这项程序能否支持原作者的因果解释?

结论:只直接约束这项实验和对应推理箭头。

相邻现象是否存在

问法:是否还有独立实验、元分析或现场证据?

结论:不能只靠起源故事的成败一并判决。

不要用“可重复性”替所有质量问题背书。一个程序可以稳定复现,却持续测错构念;也可以在实验室稳定出现,却无法外推现实行为。
↔ 与前后课程怎样接上

⚠ 判词:四项检查各管一层,结论停在证据止步处

1. “研究证明”要拆成四层:测了什么、能否归因、能否再现、能外推到哪里;上一层通过,不替下一层背书。

2. 三个经典各卡在不同层:归因、直接复制、政策外推;每层的问题只打击对应的推理箭头。

3. “证据不足”不等于“已经证伪”,起源故事失实也不等于相邻现象全假。完整证据分级见 D 块总结

课后练习

找一句最近看到的“研究证明 X”。原样抄下 X,然后写四行:构念效度——实际操控和测量是什么;内部效度——最强替代解释是什么;可重复性——有没有同预测、同指标的透明复核;外部效度——它正被外推到哪个新人群、时间或政策。

最后只写一句最窄结论,并标记“较强/有限/不足”。不要用“翻车”或“实锤”代替推理。

🎭 跟我练(回到对话里)

发给我一句让你觉得震撼的心理学或用户研究结论。我会陪你逐层拆解它到底能证明到哪里。

想开始就发:“帮我审计这句‘研究证明’。

🧠 本课核心概念速记

四个正式检查词负责检索,分层动作负责迁移。

构念效度 操控和测量是否真的对应研究声称的概念。
内部效度 观察到的结果能否归因于目标变量,而不是混淆、选择或研究者引导。
可重复性 同一精确预测能否在透明、改进的程序中再次出现。
外部效度 结论能否跨人群、时间、场景和政策层级;外推越远,越需要新证据。

🧠 背诵区 · 记住这 3 件事

点卡片翻面。每张卡只记一个判断。

⏳ 间隔复习:明天翻一遍,3 天后再翻。任选 D32、D35 或 D42 的一条证据,用四项检查重新审一次。

🗣 复述区 · 讲给别人听

能讲清机制、数字边界和行动,才算真正理解。

讲不顺的地方就是还没真懂的地方——发给我,我帮你补上。