跳到正文

#论文/研究

今日 0 条
8月19日周三
  1. 张小珺Jùn|商业访谈录22

    17岁高中生苏庭灏独立完成预训练论文被 ICML 2026 收录

    出生于2009年、现年17岁的高二学生苏庭灏独立完成预训练研究,其关于 Attention 机制的论文《Attention Projection Mixing with Exogenous Anchors》被 ICML 2026 Main Track 接收。他在这期播客中谈到,AI 让同学们感到人生意义感流失,而他选择以"开心是人之根本"自处,从韩国 ICML 回来后即将去农村支教。

4月15日周三
10月28日周二
6月26日周二
  1. Sam Altman Blog78

    OpenAI 用 PPO 训练 5 个智能体在 Dota 中击败半职业选手

    OpenAI 发布新成果,用其发明的通用强化学习算法 PPO 训练一支 5 个智能体的队伍玩 Dota,并击败了半职业选手。这些智能体对两周前的旧版本胜率稳定在 90-95%,训练过程没有使用人类对局数据,而是通过自我对弈学会游戏。Sam Altman 认为这表明只要有足够算力和能还原问题的模拟环境,深度强化学习就能解决极难的问题,并有望应用于更接近真实世界的环境。

    推荐理由:OpenAI 用 PPO 训练 5 个智能体在 Dota 中击败半职业选手,可了解自我对弈与算力规模在复杂决策任务中的作用。