E454. 深度访谈田渊栋:AI“顿悟”的关键,是对优雅的追求?
#454

E454. 深度访谈田渊栋:AI“顿悟”的关键,是对优雅的追求?

田渊栋从表征学习出发,解释神经网络为何会从记忆跃迁到泛化:Grokking 并非神秘时刻,而是数据分布、优化 landscape 与隐含偏好共同塑造出的结果。对话还追问 Scaling Law、Loss Function 和“优雅”在模型学习中的位置。

适合研究大语言模型、关注 Scaling Law,或正在使用 GPT-5 辅助科研的人;它帮助你判断继续扩大数据和算力,与打开黑箱研究表征机制,各自能解决什么问题。

这期你会听到

• Grokking 从记忆到泛化的变化,如何由数据分布和不同表征对应的“山峰”解释?

• 表征学习为什么同时容纳直观学习与抽象学习,而不必二选一?

• 当数据遇到瓶颈,理解模型内部机制能否替代单纯的 data augmentation?

• Loss Function 只是代理时,训练过程中的 implicit bias 如何偏向更简洁、优雅的解释?

• 人类研究员怎样向 GPT-5 注入关键 Insight,并持续识别它的错误与矛盾?

章节

00:00:00 — 从 Meta 裁员谈研究团队的价值

00:04:10 — 研究员如何从稀疏数据中获得 Insight

00:06:11 — 研究品味与直觉意味着什么

00:08:14 — Grokking:模型怎样从记忆走向泛化

00:10:55 — 表征学习为何会出现飞跃

00:12:05 — 压缩、泛化与优雅解释

00:13:05 — Scaling Law 与理解内部机制的两条路径

00:18:41 — 大语言模型的输出是记忆还是泛化

00:20:41 — 用优化 landscape 解释“顿悟”

00:23:10 — Loss Function 为什么只是代理

00:32:05 — 如何与 GPT-5 协作做研究

00:36:05 — 人类研究员负责注入关键 Insight

本期嘉宾

田渊栋博士,本期围绕神经网络的 Grokking、表征学习、泛化机制,以及与 GPT-5 协作研究分享观点。

相关内容

观看本期视频版

田渊栋:模型的顿悟,AI的优雅,模型表征与人类心智模型的关系,优秀研究员的意义:

https://youtu.be/zAzsDHpR4xs

加入Superlinear Academy免费社区

拿出你的模型实验结果或研究疑问,讨论数据分布、优化过程与表征机制。

https://www.superlinear.academy/

关于主播与节目

孙煜征(课代表立正),康奈尔大学经济学博士、Superlinear Academy创始人。曾任Amazon经济学家、Meta数据科学家和腾讯IEG副总监,也是OpenAI收购团队早期成员。

《课代表立正》关注AI如何改变工作、职业与商业,以及人在变化中最需要保留的判断力。