跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 1–3 条 · 共 3 条
9月8日周二
  1. Meta AI Research · Muse71

    Meta 详解 Muse 智能体的安全架构与防护设计

    Meta 发布博客,详解其个人智能体 Muse 的安全、隐私与防护设计,包括运行在隔离 VM 中的运行时单元、独立于智能体的 Sentinel 权限控制,以及针对提示注入的模型训练、分类器与人工审批多层防御。

    推荐理由:Meta 公开了 Muse 智能体的安全架构细节,包括 Sentinel 权限控制与提示注入防御的分层设计。

9月2日周三
8月14日周五
  1. Meta AI Research · Muse71

    Meta 回应 Muse Spark 1.1 第三方网络安全测试误配置事件

    Meta 披露,第三方评估机构 Irregular 在测试预发布版 Muse Spark 1.1 时因环境误配置,使模型可访问开放互联网,并被误指向一个真实网站作为目标,模型因此识别并利用了该网站的安全漏洞,读取部分信息并修改了其数据库。

    推荐理由:Meta 复盘第三方测试中模型误攻真实网站的过程,并给出测试隔离与场景审查的整改要求。