跳到正文
9月30日 · 周三

最新精选

今天9月30日周三
9月29日周二
  1. Meta Newsroom · AI62

    Meta 为 Muse 推出小型企业版,新增技能与连接器

    Meta 为个人 AI 智能体 Muse 推出小型企业版,新增一批技能和连接器,可连接 Instagram 专业账号分析、Facebook 主页和 Meta 广告账户,并接入 Canva 等数十款商家常用工具。Muse 还支持自定义连接器,合作伙伴可在 muse.ai/platform 申请接入。Muse 对多数需求免费,更多功能需订阅,官方称未来数月将增加更多连接器和技能。

    推荐理由:Meta 官方说明 Muse 新增技能与连接器,读者可了解个人 AI 智能体如何接入商家现有工具链。

  2. Google Gemini 博客62

    Google 展示开发者用 Gemini 3.8 Flash 做的四个项目

    Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。

    推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。

9月28日周一
  1. Meta Newsroom · AI62

    Meta 推出 Meta Enterprise Platform,MongoDB 前 CEO CJ Desai 出任首席企业平台官

    Meta 宣布启动 Meta Enterprise Platform,面向企业和开发者提供包括 Muse agent、Meta Business Agent、Muse API、Muse Code 在内的完整技术栈,帮助其用 AI 增长和转型。

    推荐理由:Meta 把模型、智能体和基础设施打包成企业平台,并引入 MongoDB 前 CEO 掌舵,可观察其企业级 AI 落地路径。

  2. Manus 博客78

    Manus 2.0 正式发布,推出自研 Agent 框架 Cascade 与新应用 Cue

    Manus 发布 2.0 版本,包含自研 Agent 框架 Cascade、升级为 Manus Studio 的桌面应用,以及独立个人 Agent 应用 Cue。

    推荐理由:官方给出 Cascade 的 token、耗时与成本对比数据,以及 Studio 与 Cue 的能力边界,可据此判断 Agent 产品的演进方向。

9月25日周五
  1. Meta Newsroom · AI62

    Meta Connect 2026:Muse 智能体登陆 AI 眼镜,并发布 VR 眼镜与音频眼镜

    Meta 在 Connect 2026 上宣布,本月早些时候发布的个人 AI 智能体 Muse 将在未来几个月登陆其 AI 眼镜,用户可直接说出智能体名字,Muse 能对眼前所见采取行动,并支持可长时间深入对话、在对话同时后台完成任务的语音模式。

    推荐理由:Meta 把个人智能体 Muse 从手机延伸到 AI 眼镜与随身设备,并公布首批零售与办公连接器名单,可据此判断其智能体落地路径。

9月24日周四
  1. Google Gemini 博客71

    Google 发布 Gemini 3.8 Live with Live Avatar

    Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。

9月23日周三
  1. Google Gemini 博客72

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。

  2. Meta Newsroom · AI66

    Meta 发布 Meta VR Glasses:约 100 克的分体式 VR 眼镜

    Meta 发布 Meta VR Glasses,整机约 100 克,采用眼镜加外接 puck 的两部分设计,puck 负责算力、电池与存储,官方称比 Meta Quest 3 轻五倍。

    推荐理由:Meta 首次把 VR 做成约 100 克的分体眼镜形态,读者可据此了解其显示规格、内容生态与定价定位。

  3. Meta Newsroom · AI62

    Meta 发布 Ray-Ban Meta Audio 音频眼镜与多款 AI 眼镜新品

    Meta 在 Connect 上发布首款音频眼镜 Ray-Ban Meta Audio,重 43 克,单次充电可听音乐、通话和使用 AI 助手最长 12 小时,配合充电盒可再延长 48 小时,提供 23 种配色与镜片组合,起售价 349 美元,10 月 13 日发货。

    推荐理由:Meta 一次性铺开音频眼镜、Gen 3 与多品牌多价位产品线,可据此看清 AI 眼镜从单品走向全价位覆盖的路径。

  4. Meta AI Research · Muse82

    Meta 发布 Muse Realtime Avatar 实时数字人技术

    Meta 推出 Muse Realtime Avatar,将 Muse Realtime Voice 的语音 token 流转化为可实时对话的虚拟形象,支持面部、手部和全身动作。

    推荐理由:Meta 公开了实时数字人系统的蒸馏与推理栈细节,读者可据此了解实时视频生成如何做到亚秒级延迟。

9月18日周五
  1. Google Labs 博客66

    Google Labs 将 CC 扩展为面向家庭的 AI 智能体

    Google Labs 推出面向家庭的新版 CC 智能体,拥有独立 Google 账号和明确权限模型,最多支持六名成员协作。CC 只读取成员主动共享的信息,自动整理成共享每日简报并接入 Calendar 和 Tasks,还能在授权下填写许可单、活动报名 PDF 等事务。

    推荐理由:Google Labs 把个人智能体 CC 扩展为家庭共享形态,读者可了解其权限模型与共享记忆的具体设计。

9月16日周三
  1. Google Gemini 博客82

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。

    推荐理由:Google 发布两款实时语音对话模型,给出语音智能体基准成绩与开发者接入渠道,可据此判断语音 Agent 的可用性。

9月15日周二
9月8日周二
  1. Meta AI Research · Muse71

    Meta 详解 Muse 智能体的安全架构与防护设计

    Meta 发布博客,详解其个人智能体 Muse 的安全、隐私与防护设计,包括运行在隔离 VM 中的运行时单元、独立于智能体的 Sentinel 权限控制,以及针对提示注入的模型训练、分类器与人工审批多层防御。

    推荐理由:Meta 公开了 Muse 智能体的安全架构细节,包括 Sentinel 权限控制与提示注入防御的分层设计。

9月2日周三
  1. Meta AI Research · Muse74

    Meta 发布 Muse Spark 1.3,改进智能体与编码任务表现

    Meta 发布 Muse Spark 1.3,在智能体与编码任务上性能提升,max reasoning 版本已在 Muse Code 和 Meta Model API 上线。

    推荐理由:官方给出智能体与编码任务的改进细节和工具调用、token 消耗降幅,可据此判断长任务工作流的变化。

9月1日周二
  1. Meta AI Research · Muse74

    Meta 发布 Muse Voice Transcribe 实时语音感知模型

    Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。

    推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。

8月28日周五
  1. Midjourney Updates62

    Midjourney 开放首个 V8.2 图像编辑模型测试

    Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。

    推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。

8月20日周四
  1. Meta AI Research · Muse66

    Meta 发布 Muse Spark 1.2 多模态评测结果

    Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。

    推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。