跳到正文

#OpenAI

今日 0 条
6月26日周二
  1. Sam Altman Blog78

    OpenAI 用 PPO 训练 5 个智能体在 Dota 中击败半职业选手

    OpenAI 发布新成果,用其发明的通用强化学习算法 PPO 训练一支 5 个智能体的队伍玩 Dota,并击败了半职业选手。这些智能体对两周前的旧版本胜率稳定在 90-95%,训练过程没有使用人类对局数据,而是通过自我对弈学会游戏。Sam Altman 认为这表明只要有足够算力和能还原问题的模拟环境,深度强化学习就能解决极难的问题,并有望应用于更接近真实世界的环境。

    推荐理由:OpenAI 用 PPO 训练 5 个智能体在 Dota 中击败半职业选手,可了解自我对弈与算力规模在复杂决策任务中的作用。