跳到正文
原文
42章经·· 2025-04-05AI 评分34

一堂「强化学习」大师课:对谈清华叉院助理教授吴翼

一堂「强化学习」大师课|对谈清华叉院助理教授吴翼

AI 导读

清华大学交叉信息研究院助理教授、前 OpenAI 研究员吴翼在播客对谈中系统讲解了强化学习(RL)原理、RL 与 LLM 的结合路径及行业非共识。他提出 Intelligence = LLM(理解)× RL(决策),并指出 RL 三大分支为泛化(DeepSeek)、代码(Anthropic)、Agent(OpenAI)。

来源:42章经 · xiaoyuzhoufm.com