E231. Fine tune概念已过时?|强化学习的数学直觉|AGI的自我迭代|开源vs闭源的第一性原理|说胡话的原理|大语言模型技术深度访谈2⧸3
#231

E231. Fine tune概念已过时?|强化学习的数学直觉|AGI的自我迭代|开源vs闭源的第一性原理|说胡话的原理|大语言模型技术深度访谈2⧸3

当 Fine tune 被用来指代多种不同操作,模型定制的讨论很容易失焦。本期从可导损失、连续决策与 reward 出发,比较强化学习、adapter 和提示层的作用,再追问 AGI 的自我迭代以及模型“说胡话”究竟意味着什么。

适合评估模型微调、智能体或高风险应用的技术人员,帮助判断何时需要强化学习、何时只需任务适配,以及怎样看待不确定输出。

这期你会听到

• 任务答案已知时,为什么普通训练可能比强化学习更直接?

• 连续决策与不可导的 reward,分别怎样改变训练方法的选择?

• adapter 如何在不重做底层模型的情况下适配不同任务?

• 开放强化学习能力后,AGI 系统能否借助机器反馈持续改进一连串行动?

• 模型说胡话与统计错误有什么差别,表达置信度能否改变风险判断?

相关内容

观看本期视频版

加入Superlinear Academy免费社区

带上一个模型容易答错却语气确定的案例,拆分错误来源、风险边界和可验证的反馈信号。

https://www.superlinear.academy/

关于主播与节目

孙煜征(课代表立正),康奈尔大学经济学博士、Superlinear Academy创始人。曾任Amazon经济学家、Meta数据科学家和腾讯IEG副总监,也是OpenAI收购团队早期成员。

《课代表立正》关注AI如何改变工作、职业与商业,以及人在变化中最需要保留的判断力。