Google 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
Google 发布 Gemini 3.5 Transcribe 语音转文字模型,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。
推荐理由:官方给出流式与非流式两档 WER 数字和相对 Chirp 3 的延迟提升,便于判断语音转写在实际管线中的可用性。
Google 为 Gemini Live 推出生产力升级,加入 Personal Intelligence、Daily Brief、Spark 和免手操作收件箱等功能。
推荐理由:官方说明了 Gemini Live 接入 Spark 后的多步任务与跨应用记忆能力,可据此判断语音助手的任务边界变化。
Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。
推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。
Manus 宣布即将恢复以独立公司形式运营,作为与 Meta 分拆的一部分并遵守特定司法辖区监管要求,部分用户在 2025 年 12 月 29 日当天或之后产生的数据将于 2026 年 8 月 23 日 08:00 起至 8 月 24 日期间(SGT)被删除。
推荐理由:官方说明了分拆后部分用户数据的删除与备份时间窗口,受影响用户可据此安排备份。
Meta Superintelligence Labs 发布 Muse Glimmer,一个 30B 参数的开源智能体模型,权重以 Apache 2.0 许可在 Hugging Face 开放下载。
推荐理由:Meta 开源 30B 端侧智能体模型,量化后可在单张消费级 GPU 上运行,读者可据此判断本地智能体的可行边界。
Meta 发布终端编码智能体 Muse Code(beta),由新模型 Muse Spark 1.2 驱动,可在 macOS 或 Linux 安装,面向大型代码仓库的规划、写码与结果验证,并能协调多个常驻子智能体。
推荐理由:官方披露了 Muse Spark 1.2 的编码训练重点与 Muse Code 的运行时设计,可据此判断终端编码智能体的工程取舍。
Manus 发布 Plan Mode,在开始构建前先暂停并生成一份包含目标、步骤和约束的 Markdown 计划,用户可编辑并确认后 Manus 才按计划执行。该功能为手动启用,Web 端输入 / 选择 Plan,移动端点击 + 选择 Plan Mode,可在任务中途开启,目前已在 Web 和移动端向所有用户开放。
推荐理由:官方说明 Plan Mode 在执行前插入方案审阅步骤,读者可据此判断它如何改变与智能体协作的流程。
Manus 推出 PowerPoint 模式,可直接生成原生 .pptx 文件,而非从网页格式转换或导出。图表背后保留可编辑的数据表格,表格为结构化单元格,布局遵循标准幻灯片母版,可在 Microsoft PowerPoint 或 Google Slides 中打开并继续编辑。
推荐理由:官方说明原生 .pptx 输出与图表数据可编辑的差异,读者可据此判断 AI 生成演示文稿的可用性变化。
Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,面向智能体任务,在工具与电脑操作、编码和多模态理解上有明显提升。
推荐理由:Meta 发布面向智能体任务的多模态推理模型,并首次开放 Meta Model API 公共预览,读者可据此了解其能力定位与接入方式。
Google 在 I/O 2026 上公布 12 项主要更新,包括新模型 Gemini Omni 与 Gemini 3.5 Flash。
推荐理由:Google I/O 2026 一次性放出 Gemini Omni、3.5 Flash 与 Search 智能体等 12 项更新,可据此判断其产品线走向。
Manus 上线 Shopify 连接器,向所有付费等级开放,用户通过与 Manus 对话即可创建 Shopify 开发店铺、搭建店面并管理商品目录与营销活动。
推荐理由:官方给出 Shopify 连接器的搭建、管理与营销三类用法和示例提示词,可据此判断对话式电商运营的边界。
Google 为 Google Flow 和 Google Flow Music 推出多项新能力:Gemini Omni Flash 模型支持从任意输入生成内容并实现精准视频剪辑,Flow Agent 可协助头脑风暴、批量编辑和整理素材,Flow Tools 让用户用自然语言创建并分享自定义工具。
推荐理由:Google Flow 一次性补齐智能体、自然语言建工具和移动端,读者可据此判断 AI 创作工具正从单点生成走向全流程协作。
Google 在 I/O 2026 发布 Gemini 3.5 Flash,官方称其对比 3.1 Pro 在几乎所有基准上更好,输出速度是其他前沿模型的 4 倍,价格不到同类前沿模型的一半,即日起在 Google 全线产品与 API 提供,Gemini 3.5 Pro 将于下月推出。
推荐理由:Google 一次性放出 Gemini 3.5 Flash、Gemini Omni 与 Antigravity 2.0,读者可据此判断其智能体产品线的整体走向。
Google Labs 在 I/O 上宣布 Stitch 新增实时设计方式,用户可与 Stitch Agent 协作,实时设计、流式生成并调整迭代。用户可用文本提示词、语音或导入现有代码库与设计文件作为起点,完成后可通过 Google AI Studio 生成可分享链接,并将界面导出到 Google Antigravity 接入后端逻辑,或直接通过 Netlify 发布到网页。
推荐理由:Google Labs 在 I/O 上公布 Stitch 的实时协作设计能力,读者可了解其输入方式与导出链路。
Google DeepMind 为实验性原型 Project Genie 推出 Street View 实景锚定能力,用户可选取美国地点并搭配风格与角色描述,生成起点绑定真实街景的互动世界,该能力由 Maps Imagery Grounding 技术驱动。
推荐理由:官方说明 Genie 接入 Street View 实景锚定,读者可了解世界模型如何为智能体与机器人提供贴近现实的环境。
Google 推出 Gemini for Science,包含 Google Labs 上的三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究工具打包成面向科研的智能体产品,读者可了解其能力边界与开放节奏。
Manus 为 Project 推出自我更新功能,可将对话中可复用的决策、术语和工作流模式识别出来,提出对 Project 指令、文件和技能的更新建议,仅在用户审批通过后才应用。用户可通过提示词手动触发审查,例如让 Manus 检查对话并建议更新;官方称该功能适用于支持 Project 指令和文件的会话,若工作区或任务不支持 Project 上下文则不适用。
推荐理由:官方说明 Project 如何从对话中提炼指令、文件与技能更新,并保留用户审批环节,可据此判断团队上下文维护方式的变化。
Manus 发布 Cloud Computer,一台 24/7 在线的云端专属机器,可托管 Bot、Python 脚本和自托管开源工具,文件与已安装工具在任务之间保留。
推荐理由:官方说明 Cloud Computer 与临时沙盒的差异,读者可据此判断哪些常驻任务适合交给它。
Manus 发布一整套 Slack 集成,提供三种使用方式:Manus Agent 以私信形式对话并具备持久记忆,Slack 集成可在频道话题中标记 @manus 读取上下文并发布结果,Slack 连接器基于 MCP 让 Manus 阅读频道并以用户身份发送消息。
推荐理由:官方给出三种 Slack 集成方式与各自适用场景,读者可据此判断哪种方式适合自己团队的工作流。