课程总览 · 更新于 2026-07-06 · 你的私人学习地图
整个课程的骨架。按"你离开键盘的程度"分五级,每上一级你写的代码更少、写的规格与验收更多。管理 agent 本身就是战略活动——所以升级委派形态 = 练战略技能。
你已经用一条全自动 Workflow(KMP 重构)实操到了 ⑤ 级 —— 三节课走完了别人原地踏步几年的跨度。
核心技能:判断任何任务该放在五级委派阶梯的哪一级,依据是杠杆率与验收成本,不是工具能力。
你做了什么:审计了三个真实任务(文档写作 / 测试修复 skill / 12h Goal Mode),暴露出真正的瓶颈是规格与验证,不是委派工具。
核心技能:把"想要的效果"写成 agent 啃得动的规格——黄金样本 > 验收标准 > 反例 > 读者目的 > 素材清单(按杠杆率排序)。
关键洞察:生成结果与预期差距大,根因是欠规格的空间被默认值占领,不是模型不行。修正不回流 = 为同一错误反复付费。
核心技能:设计一条让多个 Agent 安全完成大体量重构的流水线,自己当总指挥——拆解、把门、对抗 review、防改坏。
实战结果:KMP 个人页(256 文件 / 4 万行 / 5 个子 Tab)的全自动 Workflow 完整跑通,10 个单元全部 MERGED、编译通过。真机验证(关 4)转为第五课的作业。
核心技能:诊断与预防上下文漂移(instruction drift)——agent 长流程中忘记早前规则、过程跑偏。先正名(这不是 trace,是病;trace 是诊断工具),再机制、诊断、预防闭环。
缘起:你的自动化测试 skill 编排执行中会忽略前面强调的规则。根因是 Transformer 注意力架构属性(lost in the middle / context rot),2026 最强模型也有——不是你的错,但有确定对策。
核心技能:让 agent 出示证据而非宣称成功——可观测性三件套(确定性 trace / run journal / 分析也委派)+ 官方四级验证梯度(prompt → /goal → Stop hook 门禁 → 独立 verifier)。
直击痛点:你流水线唯一卡在 ① 级的真机验证:VERIFY.md 断言清单 + device-control 驱动 + logcat 断言优先截图兜底,人从"逐 Tab 点"降到"只审矛盾报告"。含 codex 自述翻车的现场活教材。
核心技能:30 秒判断该不该开舰队(too big / too parallel / self-grading 三问 + 反向判据),用官方原语(pipeline/parallel/phase)和质量模式(对抗验证 / 评审团 / 挖到干涸)编排不浪费。
关键数字:multi-agent ≈ 15× token、比单强模型高 90.2%、token 用量解释 80% 性能方差——舰队的第一性原理是"把 token 花在对的结构上",不是 agent 头数。
核心技能:点亮阶梯 ④——Codex Cloud(网页建 environment、best-of-N --attempts、@codex review→fix 闭环)× Claude Code(--cloud/--teleport 会话接力、Routines 真云端定时、/code-review ultra)。
一句话总纲:Codex 的云是"任务农场"(事件驱动),Claude 的云是"会话的延伸"(日程驱动)——互补不互斥。含合规边界:内网代码不上云。
核心技能:用 Ousterhout 框架审 AI 代码——复杂度解剖学(依赖+晦涩→三症状)、深模块原文公式(收益是功能、成本是接口)、14 条 red flags × AI 典型表现全表,写成 Review guidelines 装进 review 链。
关键实证:AI 默认是战术型程序员——粘贴:重构 ≈ 5:1、smell +63%、模型越强越臃肿且"详细 prompt 救不了架构退化"。铁律:生成代码的模型不审自己的代码。
将教:把第五课的验证 harness 和第八课的复杂度门禁变成"每周自动跑"的常驻系统——Routine 设计、/goal 长目标、告警回流。
入课门票:第八课作业的两个基线数字(重复块数、pass-through 数)。
不是听课,是一条真实任务把理论逼成了实战:
| 节点 | 你做的判断(战略动作) |
|---|---|
| 第一课 | 承认"应用太原始"实为协作形态停在 ②级,开始上推 |
| 第二课 | 看清文档任务差距大 = 规格缺口,不是模型问题 |
| 插入实战 | 带来 KMP 重构真实任务,要求"先方案后动手 + 不想盯着" |
| 纠正教练 | 明确"老师只指导,执行我自己做"——夺回总指挥位置 |
| 四次修方案 | 用现场事实纠正 AI 假设:只到开发分支 / 自动 merge / 1 台设备 / 查出 Codex plugin |
| 审编排脚本 | 抓出 stash 数据风险、路径迁移静默失效——审"编排逻辑"而非"每行代码" |
↑ 这一列,就是"AI 时代战略型工程师"的日常:不接受 agent 给的方案,用对系统的真实理解去逼问、修正它。
教学的"架构决策记录",捕捉非显然的洞察与转折,驱动下一课。