你每天都会遇到这句话:"研究表明……"——研究表明咖啡防癌、研究表明咖啡致癌、研究表明每天走一万步有益健康。同一件事,不同的"研究"能得出相反的结论。怎么判断一个心理学结论到底可不可信?这一课给你一套工具箱:科学方法是怎样循环自检的、实验和相关到底差在哪、"信度效度""双盲""随机分配"这些词到底在防什么坑、以及——最重要的——为什么"相关不等于因果"是你看穿伪心理学的第一道闸门。
心理学不靠拍脑袋,靠的是一个反复打磨的循环——它最厉害的地方不是"一次就能找到真相",而是错了能被发现、能被修正。
循环长这样:先观察现象(比如"好像睡不够的人第二天更烦躁"),从中提炼出一个理论(一套用来解释一类现象的成熟想法)。理论太宏大、没法一次全测,于是你把它拆成一个假设——一个能被数据检验的具体预测("如果昨晚睡眠少于 6 小时,那么第二天困倦评分会更高")。然后去收集真实数据检验它。结果支持假设,理论暂时站住;结果不支持,回去修正理论再提新假设。OpenStax 把它画成一个圈:理论→假设→收集数据→分析→总结→确认或修正理论→再提假设。来源:OpenStax 2.1 Why Is Research Important
这里有一个关键门槛:一个说法必须"有可能被证明是错的",才算科学假设。这叫可证伪性(falsifiability)——伪心理学的头号特征就是不可证伪:不管发生什么它都能自圆其说。"水星逆行会让人诸事不顺"——顺了说"因为你化解得好",不顺说"看吧逆行",怎么都对,永远不能被推翻,这就不是科学。
如果你想知道"A 是否导致了 B",只有一种方法能回答——做实验。OpenStax 说得斩钉截铁:"唯一能宣称变量之间是因果关系的方法,就是做实验。"因为只有实验能主动操纵一个变量、同时控制其他一切。
实验里有两个主角:你主动操纵的那个叫自变量(independent variable, IV),就像你动手拨的开关("听不听音乐");你盯着看它变没变的那个叫因变量(dependent variable, DV)("记住的词有多少")。被试被随机分成两组——实验组接受你操纵的处理(边听音乐边背词),对照组不接受、但其他一切条件一模一样(安静背词)。因为分组是随机的,两组在智力、性格、习惯等各方面平均下来大致相当——所以实验后两组唯一的关键差别,就是你拨的那个开关。此时如果因变量出现了差异,你才有底气说:是这个开关造成的。
注意区分两个容易搞混的词:随机分配(random assignment)管的是"进来后分到哪组"——这是实验能谈因果的核心机关;随机抽样(random sampling)管的是"从总体里选谁进研究"——这关系到你的结论能不能推广到更大的人群。两者各管一摊,不是一回事。来源:OpenStax 2.2、2.3
实验虽强大,但很多你想知道的事没法做实验——你不能随机把婴儿分配给不同父母、不能命令一群人"你从现在开始每天抽一包烟"。这时候科学家用相关法:只测量两个变量,看它们是不是一起变,研究者不去操纵任何东西。
结果用一个叫相关系数 r 的数来报告。r 在 -1 到 +1 之间:正号表示同增同减(身高和体重,越高越重),负号表示一个升一个降(睡眠越少,第二天越困)。绝对值越接近 1,关系越强;0 表示没关系。举例:一项真实研究发现少睡的天数与学生 GPA 呈弱负相关,r = -0.29。来源:OpenStax 2.3
但——这是本课最重要的"但"——r 再高也不等于因果。至少有两个原因让相关不能推因果:① 方向性问题——就算 X 和 Y 真有因果,光看相关也分不清是 X 导致 Y 还是 Y 导致 X(是暴力电视让孩子更凶,还是本来更凶的孩子更爱看暴力节目?)。② 第三变量(混淆变量)——一个藏在背后的因素同时影响 X 和 Y,制造出它俩好像有因果的假象。冰淇淋销量和溺水人数一起上升——真正的推手是"天气热",不是冰淇淋导致溺水。
还有一种更隐蔽的坑:人自己会"看"到根本不存在的相关——叫虚假相关(illusory correlation)。"满月会让你行为异常"——荟萃分析已证伪,但很多人(包括一些医护)还坚信,因为满月那天出事就记住、没出事就忽略。脑子会自动挑符合预期的例子来记,这就是虚假相关的来源。来源:Simply Psychology: Correlation
还有一种研究什么都不操纵,只管"客观描述现象长什么样"。三类常见:自然观察(在真实环境里看行为,贴近现实但难控制)、个案研究(深挖一两个人,信息极丰富但很难推广到普通人)、调查(用问卷问一大批人,样本大但每个人挖得浅,且人不总是如实回答)。能回答"现象长什么样、有多普遍",不能回答因果。来源:OpenStax 2.2
前面四种方法(实验/相关/自然观察/个案/调查)解决"研究设计"的问题。但还有一个前提:你用的测量工具本身靠不靠谱?两个概念——
信度(reliability)问"稳不稳":同一个东西没变,反复测能不能得到差不多的结果?效度(validity)问"准不准":这个工具是不是真的在量它声称要量的那个东西?
打靶比喻最好懂。靶心 = 你真正想测的东西;每一箭 = 一次测量。四种情况:① 又准又稳——箭都紧紧扎在靶心(信效俱佳,理想状态);② 稳但不准——箭紧紧聚成一团、却偏在角落(像那个每次都多显示 2 公斤的秤:很一致、但一直错);③ 准但不稳——箭散布在靶心周围、平均对但每箭乱飘;④ 既不准也不稳——又散又偏。这条关系的关键句:信度是效度的必要不充分条件——有信度不一定有效度(那个偏 2 公斤的秤),但真正有效度的测量一定也有信度。来源:Simply Psychology: Reliability vs Validity
有了好设计和好测量,还有最后一道防线:人带来的偏差。
安慰剂效应:人只要"以为"自己在接受治疗,就可能出现改善——即使吃的只是糖丸。这就是为什么新药不能只和"不吃药"比,还必须和安慰剂比——不然分不清是药真有效,还是"相信"在起作用。更严谨地说,安慰剂反应里还混着自然痊愈、向均值回归等,不全是"心理作用"。来源:OpenStax 2.3
单盲:参与者不知道自己在哪组(挡住参与者期望)。双盲:参与者和直接接触他们的研究者都不知道谁在哪组——同时挡住参与者的期望和研究者的实验者期望效应(研究者自己都没察觉的暗示,比如对实验组更热情、语气不同)。最经典的例子是"聪明的汉斯"——一匹会"算术"的马:当提问者知道答案时,马答对约 89%;提问者不知道答案时,只对约 6%。原来它是在读人不自觉的身体线索,不是真会算。双盲就是为了防这种事。来源:Wikipedia: Observer-expectancy effect
合上内容回答:(1) 为什么只有实验能谈因果?随机分配解决了什么问题?(2) 信度和效度的区别——用打靶比喻讲。(3) "相关不等于因果"的两个原因分别是什么?
按《心理学与生活》第 20 版 16 章顺序。绿=已点亮,棕=当前站。
讲不顺的地方就是还没真懂的地方 —— 发给我,我帮你补上。
本课对应第 2 章《心理学研究方法》。回去翻时重点抓三块:科学方法的循环(理论→假设→检验→修正)、实验与相关的区别(为什么只有实验能推因果)、以及信度与效度。读每个研究案例时,先问:这是实验还是相关?有没有随机分配?因变量怎么测的?
首选精读:OpenStax Psychology 2e 第 2 章 2.2-2.3——把实验/相关/描述三种方法的边界和"相关≠因果"讲得最干净的免费教材。Approaches to Research
术语速查 → 术语表(实验法 / 相关法 / 信度 / 效度 / 双盲 / 可证伪性 已收录)