你有没有过这种事:一听到某首歌就莫名难过,或者明知该睡了手指还在划手机停不下来?这些反应你从没"决定"过,它们是学来的。这一课讲三条学习规律:两条管你"怎么被环境塑造成现在这样"——经典条件作用和操作条件作用;一条管你"光看别人也能学会"——观察学习。看懂它们,你能解释自己一大半的自动行为和习惯。
学习,就是经验让你的行为发生了相对持久的改变。它不靠想通,靠的是一次次经历慢慢塑形。
心理学讲的学习,跟你平时说的"学知识"不完全一样——它更底层:你身上那些从没"决定"过的自动反应、改不掉的习惯、看到某个人就紧张——这些都是学来的。下面两条规律回答两个不同的问题:经典条件作用回答"我对什么产生了不由自主的反应";操作条件作用回答"我为什么会去做某事"。一个管"什么勾起你的反应",一个管"什么让你去行动"。先把这两句话定住。来源:OpenStax 6.1 What Is Learning
巴甫洛夫研究狗的消化时撞见一个现象:狗见到食物会自然分泌唾液(不用学)。他在每次喂食前先给一个信号——节拍器或蜂鸣器的声音(注:课本里常简化为"铃声",但巴甫洛夫本人主要用节拍器、蜂鸣器和音叉;"铃"是后世教材以讹传讹的简化说法)。反复配对之后,单独给信号、不给食物,狗也开始分泌唾液——一个原本毫无意义的声音,"学会"了引发原本只有食物才能引发的反应。来源:Simply Psychology Classical Conditioning
| 术语 | 在实验里是 | 含义 |
|---|---|---|
| UCS 无条件刺激 | 食物 | 天生就能引发反应、不用学 |
| UCR 无条件反应 | 见食物分泌唾液 | 天生、自动的反应 |
| CS 条件刺激 | 信号声(原本中性) | 反复与 UCS 配对后,"获得"了引发反应的能力 |
| CR 条件反应 | 听信号声分泌唾液 | 被学会的、对 CS 的反应 |
核心机制:一个中性刺激反复和一个天生能引发反应的刺激一起出现,最后它单独出现就能引发那个反应。反应本身没变(都是分泌唾液),变的是"什么东西能触发它"——触发权从食物挪到了信号声上。
① 听到某首歌心情突然低落——那首歌曾反复伴随和前任的回忆。歌=中性刺激,恋爱的情绪=无条件的反应,听歌就难过=被挪过来的反应。
② 一闻到医院消毒水味就开始紧张——消毒水味多次伴随打针、坏消息,于是味道本身就能勾起紧张。你从没"决定"要对这个气味有反应,是反复配对把它悄悄装了进去。
五个词串起来看——它们直接解释"为什么戒了又犯":获得(反复配对建立关联)→消退(信号不再兑现,反应变弱)→自发恢复(歇一阵后旧反应自己冒回来)→泛化(类似的刺激也能勾起反应,一朝被蛇咬见到绳子也怕)→辨别(学会只对特定信号反应,听到自家门铃才起身)。
这里有一条最关键的边界:消退不是把旧学习抹掉,而是在上面叠了一层新学习去压制它。旧的关联还在底下,所以只要条件合适就会自发恢复。戒烟很久后某天闻到烟味突然"又想抽了",不是你意志力崩了——是那层旧配对被线索重新唤醒。这正是恐惧和上瘾容易复发的机制。来源:Simply Psychology;OpenStax 6.2
经典条件作用管"什么勾起你的反应";操作条件作用管的是另一个问题——"你为什么会去做某件事"。斯金纳的核心规律朴素到近乎废话:带来好结果的行为会被强化(以后更常做),带来坏结果的行为会被削弱(以后更少做)。行为像被自己的后果一点点雕出来。
这里先钉死两个定义——它们按行为变多还是变少来定义,跟"好坏"无关:强化(reinforcement)=任何让行为增多的后果;惩罚(punishment)=任何让行为减少的后果。来源:Simply Psychology Operant Conditioning
孩子在超市哭闹,家长妥协买了玩具。对孩子来说,哭闹这个行为刚刚"拿到了想要的东西"——好结果,于是哭闹被强化了,下次更会哭。家长以为在息事宁人,其实在亲手训练孩子哭闹。是后果决定了这个行为以后出现的频率。
这里是最容易绕晕、也最值钱的地方。先记死口诀:"正/负"=加上/拿走一个刺激(不是好/坏);"强化/惩罚"=让行为增多/减少。两步分类:先看行为变多(强化)还是变少(惩罚),再看是加东西(正)还是拿东西(负)。
| 给予刺激(正=加) | 移除刺激(负=减) | |
|---|---|---|
| 行为增多 (强化) | 正强化:给予愉快→行为↑ 做对题得表扬→更愿做题 | 负强化:移除厌恶→行为↑ 系安全带→刺耳警报声停→更会系 |
| 行为减少 (惩罚) | 正惩罚:给予厌恶→行为↓ 摸热锅被烫→以后不摸 | 负惩罚:移除愉快→行为↓ 熬夜被没收手机→少熬夜 |
强化不一定每次都给。给奖的节奏不同,养出的行为顽固程度天差地别。其中最难戒的是可变比率强化——奖励不定时、不定次地出现,你永远不知道下一次会不会中。正因为无法预测,你就一直停不下来。刷短视频、老虎机、赌博——都是同一套机制。注意区分:可变比率最抗消退(停奖后最难消失),但不等于"响应速度最快"或"是最好的教学程式"——教新行为初期反而常用连续强化(每次都奖)学得更快。来源:OpenStax 6.3
前面两条规律都默认"你必须亲身经历后果"——但生活中大量行为是光看别人怎么做、以及别人被奖还是被罚就学会的。班杜拉(Bandura)把这叫观察学习(observational learning)——不用亲身经历后果,看"模型"的行为和结果就能学。走四步:注意→记住(保持)→再现→动机。第四步"动机"受替代强化(vicarious reinforcement)驱动——看到别人被奖励你就更想模仿,看到别人被惩罚你就抑制。
最经典的证据是波波玩偶实验(Bandura, Ross & Ross, 1961):72 名 3-6 岁幼儿分三组各 24 人,先看一个成人模型,看到攻击组的孩子之后自己也更会攻击玩偶,甚至做出模型没示范过的新攻击动作——在没有任何人直接奖励他们的情况下。1965 年后续还发现:看到模型被惩罚的孩子会抑制模仿——说明"学没学会"和"做不做出来"是两回事。这直接挑战了"学习必须靠亲身强化"的行为主义观点。注意:不能把"看到暴力→模仿"误读成"媒体暴力必然导致暴力"——学会≠表现,且样本限于特定年龄和情境。来源:Simply Psychology Bobo Doll
经典条件作用眼镜:有没有某个场景、声音、气味,在不讲道理地勾起你的情绪?是不是有什么东西被反复配对,成了"一碰就响"的触发?
操作条件作用眼镜:这个反复出现的行为(拖延、刷手机、发脾气),是被什么后果维持的?它给他带来了什么好处,或帮他躲掉了什么难受?拖延的"好处"常常是躲开了做事的焦虑——难受被暂时拿走(负强化),于是拖延被养大。
观察学习眼镜:这个行为是不是看别人做、看别人被奖赏而学来的?如果是,"反学习"也得从改变"他看到什么"下手——暴露疗法就是让触发反复出现却不再跟着坏事(消退),以及让"看到别人安全地做了这件事"成为新的观察对象。
合上回答:① 经典和操作各回答什么问题?② 负强化为什么不是惩罚?③ 消退和遗忘有什么区别?④ 观察学习的四步是什么?
讲不顺的地方就是还没真懂的地方 —— 发给我,我帮你补上。
对应第 6 章《学习与行为分析》。重点:经典条件作用(巴甫洛夫,UCS/UCR/CS/CR)、操作条件作用(斯金纳,强化与惩罚)、观察学习(班杜拉)。读每个例子时先问:这是"刺激→反应"还是"行为→后果"还是"看模型→模仿"?
首选精读:OpenStax Psychology 2e 第 6 章——学习全章。What Is Learning
术语速查 → 术语表