42章经·· 2025-04-05AI 评分34
一堂「强化学习」大师课:对谈清华叉院助理教授吴翼
一堂「强化学习」大师课|对谈清华叉院助理教授吴翼
AI 导读
清华大学交叉信息研究院助理教授、前 OpenAI 研究员吴翼在播客对谈中系统讲解了强化学习(RL)原理、RL 与 LLM 的结合路径及行业非共识。他提出 Intelligence = LLM(理解)× RL(决策),并指出 RL 三大分支为泛化(DeepSeek)、代码(Anthropic)、Agent(OpenAI)。
来源:42章经 · xiaoyuzhoufm.com