← 返回书架
⚠️ 边界声明(本工具链适用场景 · 高亮常驻):本读书方法论的「最优」是针对春哥场景(投资/行业研究导向、时间碎片化、需要知识直接挂到已有认知上)的选型,非放之四海皆准。每本书入库都会判 fit——不适配的书会显式提醒、不硬套三层流程。使用场景若要迁移(如改造成学术/背诵/共读),必须先过需求变更等级门槛。
🤖

A Definition of AGI(AGI 的定义)

Dan Hendrycks 等 30+ 作者(含 Bengio / Tegmark / Marcus / Tallinn / Schmidt)· Center for AI Safety · 人工智能 · 学术论文 · 定义框架
fit:适配 📌 想读
🛟 fit 说明:书型=学术论文/定义框架,正对本工具链强项(AI 情报研判)。注意三点:①心理测量学概念多(CHC/因子分析/频次),遇到术语可查 AI 字典;②十认知域明细章节(§3-12)是参考手册性质,不必逐页精读,按需查阅;③论文给出的是框架与首批结果(GPT-4/5),未来模型会有新分数,卡片随版本更新。与 Goertzel 2014 综述互补。
🎯 为什么读:Center for AI Safety 领衔 30+ 作者的量化 AGI 定义框架:基于 CHC 认知理论拆 10 个认知域,产出 AGI Score(GPT-4 27% / GPT-5 57%)。给'判断 AGI 宣称'一把同一把尺子。
📖全文中英对照版:段落级翻译 · 移动端优先进入对照版 →
读薄 · 全书地图检视阅读产出 · 主线 + 每章要点 + ⭐ + 检验性问题
🧭 主线:(预期主线,待读薄后修正)以'拿到一把可复测的 AGI 尺子'为主线:先理解「为什么 AGI 定义是移动靶子、必须量化」(§1)→ 掌握 CHC 十认知域框架与 AGI Score 口径(§2)→ 看首批模型打分结果与「锯齿状轮廓」结论 → 最后读 Scope 界定,知道这把尺子测什么、不测什么。核心收益=任何 AGI 宣称都能用同一套认知域框架去拆解、质疑、打分。
§1
Introduction(引言:AGI 定义的痛点) 必读
  • 为什么说 AGI 是「移动靶子」(moving goalpost)——专用 AI 越强,AGI 标准被抬得越高。
  • 一句话定义:AGI = 匹配或超越「受过良好教育的成年人」的认知通用性与熟练度。
  • 为什么选 CHC 理论做落地(一百多年因子分析的实证基础,不是拍脑袋)。
  • 读时关注:「通用性(breadth)与熟练度(depth)」这两个词为什么缺一不可。
§2
Overview of Abilities(十认知域总览) 必读
  • 十个认知域各占 10%:K 常识 / RW 读写 / M 数学 / R 即时推理 / WM 工作记忆 / MS 长时记忆存储 / MR 长时记忆检索 / V 视觉 / A 听觉 / S 速度。
  • AGI Score = 十域等权累加,100% = 达成 AGI。
  • 读时关注:为什么「等权」?刻意压广度、防止一个域拉满充数。
§3-12
十个认知域明细规格(K/RW/M/R/WM/MS/MR/V/A/S) 可跳
  • 每个域再拆「窄能力」(如 R 域含演绎/归纳/心智理论/规划/适应)。
  • 参考手册性质:想查某域怎么测、有哪些子项时回来翻。
  • 与我们最相关的三个:MS(长时记忆存储=持续学习,AI 的 0 分短板)/ MR(检索+防幻觉)/ WM(工作记忆)。
结果
Results(AI System Performance:首批打分) 必读
  • GPT-4 = 27%(2023)/ GPT-5 = 57%(2025)——量化「进步快但差距大」。
  • 「锯齿状」认知轮廓:知识/读写/数学强,基础认知机制弱。
  • 致命短板:MS(长时记忆存储)= 0 分,且 R(即时推理)也很弱。
  • 读时关注:分数表里哪一列是 0?为什么?这对我们评估 AI 工具意味着什么。
界定
Scope(测什么、不测什么) 选读
  • 不是自动评估集,而是任务规格集合,任何人可手动复测。
  • 测的是 human-level(人类级认知),不是 economy-level(经济价值)——iPhone 有价值但不是 AGI。
  • 只测认知(头脑),不测身体(运动/触觉)。
讨论
Discussion(局限与后续) 选读
  • 框架的局限:任务清单不是穷尽的、人类基准也有争议。
  • 未来:更多模型打分 / 认知域扩展 / 与自动化经济指标分离。
附录
Appendix A-K(各认知域测试详单) 可跳
  • 每个认知域的实际测试题清单(含来源测验)。
  • 想复核某个域的测量方法时回来查。
❓ 检验性问题读完能答出,才算真读进去
  1. 用一句话给 AGI 下定义,再说明为什么「受过良好教育的成年人」是基准而不是「所有人/超人」?
  2. 十个认知域里,为什么 MS(长时记忆存储)对当前 AI 是 0 分?这对我们的人机协作方式有什么启发?
  3. 如果某厂商宣称「我们的模型已达到 AGI」,你会用这把尺子怎么拆解这句宣称?
读厚 · 费曼对话你主读,我护航 · 你讲我听,我追问纠偏
📖 读厚记录尚未开始——带着上方「检验性问题」去读原书,读一段我们聊一段。你用自己的话讲给我听(费曼),我帮你检查理解偏差、补漏洞。
内化 · 知识卡费曼输出 + 强制连接已有认知
🧠 知识卡尚未生成——读厚完成一块后,我们一起把「这和我已知的什么挂钩」写成知识卡,挂到你已有的认知网上。
← 主页