B 块 · 决策与认知偏差 · 样本家族 · 第 11 课

自信三兄弟

过度自信、达克效应、幸存者偏差——三个都在说"你以为的比实际的好",但机制完全不同。这一课也是本课程最重的一次批判训练:一个人人都听过的"经典效应",它的现象是真的、图表是骗人的、解释是存疑的、而网上流传的版本是走样的——这四件事同时成立

📍 你在哪个家族? 这一课属于样本家族——你看到的样本,早就被筛过了。第 10 课是你自己挑样本(确认偏差),这一课是现实先替你筛过(幸存者偏差),再加一个"你对自己能力的估计也不准"(过度自信)。三课拼出一块完整的拼图:你看到的从来不是全貌。
🎯 一句能带走的话:自信出问题,很少是因为你太蠢,多半是因为你手上的样本被筛过了——被难度筛、被统计筛、被现实筛。记住难易反转(难事上低估自己、易事上高估自己),再加一句"死掉的那些呢?"
为什么这一课值钱? 它同时给你两样东西:一是看清自己判断力边界的工具(该自信时自信、该谨慎时谨慎);二是识破"成功学"整个产业的能力——从炒股 App 到知识付费到微商,用的都是同一招。

先做一个测试:你的九成把握

招牌场景 · 记住这个

写下 10 个你不知道确切答案的数字(某国人口、某座山高度、某公司年收入……),每个给一个"我有 90% 把握,真值落在这个区间里"的估计。然后去查。

真值实际落进去的比例通常只有 30%–60%

你说"九成把握"的时候,实际大概只有一半。这就是过度精确——过度自信三兄弟里最顽固的一个。"能减轻,但消不掉。"Moore 综述教学安全区间;经典来源 Alpert & Raiffa (1982)、Lichtenstein, Fischhoff & Phillips (1982)。

先把概念拆开:过度自信其实是三件事

把它们混为一谈,是绝大多数科普文章的通病。

类型说的是日常样子
高估
overestimation
觉得自己实际水平比真实的高"这活儿我两天能干完"(实际一周)
高置
overplacement
觉得自己比别人强"我开车技术在平均以上"
过度精确
overprecision
觉得自己的判断比实际更准"我确定就是这个原因"
最反直觉的发现:这三个不但不是一回事,还可能反着来。
· 难任务上:人高估自己的成绩,却又觉得自己不如别人
· 易任务上:人低估自己的成绩,却又觉得自己比别人强
Moore, D. A., & Healy, P. J. (2008)《The trouble with overconfidence》Psychological Review 115(2):502。跨 18 个测验,高估与高置显著相关 r(18)=−.64, p=.004。

为什么会这样?因为你对自己的信息不完美,对别人的信息更不完美——对他人的估计更"往中间缩"。考得好时,你低估自己、但更低估别人,于是觉得自己领先;考砸时反过来。它不是"人自大",而是信息量不对称造成的系统性错觉。18 轮实验没有学习效应——偏差不会因为多做几次就消失。

那个"人人都觉得自己车技好":开车技术自认高于中位数,美国样本 93%、瑞典 69%;开车安全,美国 88%、瑞典 77%。每组仅 35–45 人、样本小,但 2023 年一项 N=1,203 的预注册复制确认了结论。Svenson, O. (1981) Acta Psychologica 47(2):143。注意拼写是 Svenson(一个 s)。

过度精确方面:让人给"90% 把握"的区间,真值落入率通常仅 30%–60%。三兄弟里这一个最顽固。平衡一下:有研究认为其中相当一部分是提问格式造成的假象——改用频率格式加金钱激励,测出的过度自信会明显下降。别把它当成"人脑铁律"。

顺带认识:计划谬误

经典实验 · 毕业论文

让 33 名学生预测自己的荣誉论文什么时候能写完:

问法预测天数实际按期完成率
最佳估计33.955.529.7%
乐观(一切顺利)27.455.510.8%
悲观(一切尽可能糟)48.655.548.7%
最扎心的一行是最后一行:连"往最坏处想"的估计都还是不够坏。刻意悲观,预测 48.6 天,实际 55.5 天——依然是低估Buehler, Griffin & Ross (1994) JPSP 67(3):366。但别过度解读:预测与实际的相关高达 r=.77——排序有效(你知道哪个任务更久),只是整体系统性偏短。

达克效应:本课的重头戏

你一定听过:"能力越差的人越觉得自己厉害。"还有那张著名的"愚昧之巅→绝望之谷→开悟之坡"曲线。现在一层层拆开。

(逻辑测验)实际百分位自评百分位
最低四分之一12th62nd
最高四分之一86th74th

Kruger, J., & Dunning, D. (1999)《Unskilled and Unaware of It》JPSP 77(6):1121。注:这组数字是四个研究的汇总口径,各研究底部组自评在 55–68 之间浮动。

注意第二行——高手反而低估了自己。这半边故事在流传中几乎完全丢失了。

⚠ 澄清一:低分者从来没觉得自己比高分者强。

原文 Study 4 的自评数据是单调上升的:最低组 55.0 < 第二组 58.5 < 第三组 67.2 < 最高组 78.3。准确的说法是:"人人都自认高于平均,只是低分者高估得更多。"

⚠ 澄清二:那条"愚昧之巅"曲线,原始论文里根本不存在。

原文只有 4 张图,全是四分位折线图,形状是单调上升的"剪刀图",没有先涨后跌的驼峰。而且原文横轴是实际能力,网络版换成了经验/时间——两个完全不同的东西。

批评者指出这个经典图形有三重统计问题叠加:①自相关——纵轴(自评−实际)里含着横轴(实际),负斜率数学上就是必然的;②回归均值——考得最差的那批本就含有运气成分,下次自然回升;③人人自认高于平均——叠加上"高置"这个独立偏差。

这个假象有多大?同一批数据,用相对估计 + 同批试次时,达克相关高达 −.92;改用绝对估计 + 独立测量后,衰减到 −.07(不显著)差了一个数量级。McIntosh, Fowler, Lyu & Della Sala (2019) JEP: General 148(11):1882。但校正之后效应衰减、却没有归零——低分者在信度高的测验上仍然高估近 40 个百分点;用全国代表性样本(N=13,977)重做也测到了显著效应,只是效应量小到让人怀疑实践意义

幸存者偏差:连它的起源故事本身都被筛过

幸存者偏差:你只能看到"活下来"的样本,看不到消失的那些——于是对整体做出系统性错误的判断。

流传版本

"二战时军方统计返航飞机的弹孔,想给中弹最多的地方加装甲。统计学家 Wald 说:错了,应该加在没有弹孔的地方——因为打中那里的飞机根本没能飞回来。"

这才是本课最妙的地方:讲幸存者偏差的这个故事,本身就是幸存者偏差的产物——戏剧性强的版本活下来了,克制的技术真相被淘汰了。和达克效应是同一个元现象:好记的"愚昧之巅"曲线活下来了,原始的剪刀图没人记得。知识在传播中也会被筛选——筛选标准是"好不好传",不是"对不对"。

用数字感受筛选有多狠:标普每年发布的基金业绩记分卡里,美国国内股票基金放到 20 年尺度上,只有大约三分之一还活着——另外三分之二被清盘或合并掉了。S&P Dow Jones Indices, SPIVA U.S. Scorecard(存活率栏目)。本课未能直接取得该 PDF 原文复核具体百分位,故只给量级不给精确小数。

更狠的一层:高风险策略产生高方差结果。在完整样本里,这类策略跟业绩毫无关系;但生存筛选砍掉了失败的那一半之后,在幸存者里它就显得跟成功正相关。结论:只观察成功者,你会系统性地得出"大胆、专注、all-in 优于稳健分散"——而这恰恰是被筛选偏爱的高方差策略,不是真正有效的策略。Denrell, J. (2003) Organization Science 14(3):227。这就是所有"成功学"的根本问题:它不只让你高估成功概率,它还推荐了错误的做法

三个流行说法要打折 ⚠ 详见 B 块总结

"蠢人不知道自己蠢"(达克效应大众版)。原始论文里低分组自评始终低于高分组;"愚昧之巅"曲线原文不存在,原文只有四张单调上升的剪刀图;高手其实低估自己。但现象是真的——低分者高估更多这个模式极可复制。四件事同时成立:现象真、图骗人、解释存疑、大众版走样。

"Wald 说要给没弹孔的地方加装甲。"原始档案里没有这句话,"armor"仅 1 次、"bias"全文 0 次,红点飞机图是 2016 年网友画的示意图。故事核真、金句假。

"过度自信是人脑铁律。"改格式(频率 + 金钱激励)后大幅下降。效应真、但别当"铁律"。完整账目见 B 块总结"有名但要打折"清单

四层拆解

🔧 自我调节 — 两个杀手锏
  1. 区分该自信和不该自信的场合。记住反转:做难事时你会低估自己(该多点信心),做容易事时你会高估自己(该多点谨慎)。跟直觉正好相反。
  2. 问"死掉的那些呢"。看到任何成功案例,机械地问一句:"用同样方法但失败了的,有多少?他们在哪?"这一句能拆掉大部分成功学。
  3. 辅助动作:给区间加宽——说"九成把握"时实际约五成,把你的区间往两边各拉宽一倍再交出去。排期别问自己要多久,去查同类任务上次实际花了多久
👁 识破套路 — 整个"成功学"产业的配方

⚠ 诚实提醒:同一份调查发现,"了解得多"并没有对应更低的受骗率(15% vs 12%)。所以——上完这一课不等于你就防得住。知道套路和挡得住套路是两回事,别因为学过而更自信(那正好是本课主题)。

🧠 懂原理 — 机制与一个反转故事

认知(主):过度自信的核心机制是信息不对称——你对自己了解得不完美,对别人了解得更不完美,对他人的估计更向中间收缩。幸存者偏差的核心是样本选择——你的观测集被现实筛过。两者共享同一个根:可得样本 ≠ 真实母体

进化视角(假说):适度的过度自信可能有利于争取资源、吸引合作者、在竞争中先出手。诚实标注:这是常被引用的解释框架,不是实验定论。

🧪 本课不给"脑区/激素解释过度自信"的结论——原因本身就是教材。
曾有一项广为流传的研究报告"交易员晨间睾酮水平预测当日盈亏",样本是 17 名交易员、8 个工作日。但后续证据链:赢家效应的元分析(60 个效应量、>2,500 人)总效应只有 D=0.20,实验室内几乎为零(D=0.08);而 2026 年一项 N=1,000 的双盲随机预注册实验发现,睾酮对信心的效应是显著的负向——与预测方向相反。一个 17 人 8 天的相关研究,被 1,000 人的预注册 RCT 反转了。这正是本课主题最好的示范:看到"某激素/某脑区解释某行为"就相信,本身就是一种过度自信。
🗣 能讲出来

讲的时候别讲"蠢人不知道自己蠢"——那是走样版本。抓两个点:三兄弟各不相同(尤其难易反转),和"死掉的那些呢"。完整示范在复述区。

工作场景:一个"我有把握"的承诺

职场 · 过度精确 + 计划谬误

老板问这个需求多久能上线,你想了想说:"两周吧,我有信心。"六周后还在改。

三件事同时发生:①计划谬误——你在脑子里模拟的是"一切顺利"的路径,实际永远有插曲;②过度精确——"我有信心"这个九成把握,实际大概五成;③没查历史数据——上一个类似需求实际花了多久,那个数字比直觉可靠得多。

更好的答法:"类似的需求上次花了五周,所以我报五到七周。如果 X 和 Y 都顺利,可能提前。"给区间、给依据、给条件——这既更准,也显得更专业。

↔ 交叉网
· ↔ 第 05 课(可得性启发):幸存者偏差决定哪些样本还存在,可得性决定哪些容易被想起。两级筛选叠加——成功案例既存在得多、又传播得广。
· ↔ 第 10 课(确认偏差):确认偏差是你自己挑样本,幸存者偏差是现实先替你筛过。方向不同,效果叠加。
· ↔ 第 08 课(前景理论):亏钱时爱赌("再赌一把就回本")+过度自信,是散户亏损的标准配方。
· ↔ 回归均值:这是理解达克效应争议的钥匙,也解释了"骂完就进步、夸完就退步"的错觉。
· → 第 12 课(控制错觉):下一课讲一个近亲——以为自己能影响随机结果。

课后练习

  1. 做一次区间校准。写下 10 个你不知道确切答案的数字估计,各给一个"九成把握"的区间,然后去查。中了几个?
  2. 问一次"死掉的那些呢"。找一个你最近被打动的成功案例,去搜同赛道失败的人。
  3. 核对一次工期。翻出你上次预估的一个任务,对比实际耗时,算出你的个人系数。以后乘上去。

🎭 跟我练(回到对话里)

把一个你觉得很有把握的判断或计划发给我。我会用这一课的三把尺子量一遍:你是在高估、高置、还是过度精确?以及你的样本是不是被筛过。

想开始就发我:"帮我校准一下信心。"

📌 推荐主源(这一课的一手锚点)

想读一样东西,读这篇——它把"过度自信"这个含混的大词拆成三件事,是整个领域的分水岭:

Moore & Healy (2008)《The Trouble With Overconfidence》Psychological Review 115(2):502 ↗ 🟢 领域骨架论文

想深挖达克效应争议(最平衡的一篇):McIntosh et al. (2019) JEP: General 148(11):1882 ↗

🧠 本课核心概念速记(讲给别人时用这些名字)

只收本课最核心的概念名——记得住名字,才讲得出道理。

概念一句话
过度自信三分高估(实际水平)、高置(比别人强)、过度精确(判断准度)——三者不同,还会反着来(r=−.64)。
达克效应⚠ 低分者高估更多。现象真、图骗人、解释存疑、大众版走样——四件事同时成立。
幸存者偏差只看到活下来的样本。最狠:会让你学到反的结论(推荐高方差策略)。破法:"死掉的那些呢?"
计划谬误总低估耗时。连"往最坏处想"都还是不够坏(48.6 vs 55.5)。解法:查历史数据,别靠直觉。

🧠 背诵区 · 记住这 3 件事

点卡片翻面。每张卡只记一个点

⏳ 间隔复习:明天翻一遍;3 天后再翻。顺手翻 05(可得性)·10(确认偏差)——三者都是"样本被筛过"。

🗣 复述区 · 讲给别人听

能讲清楚,才是真懂。

讲不顺的地方,就是还没真懂的地方 — 发给我,我帮你补上。