Google 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
Higgsfield 发布 Genjutsu,可在不重拍整段视频的前提下重建片段中的局部内容,包含 Motion Transfer 和 Object Swap 两项功能,前者提取原视频运动并套用到新角色或场景,后者只替换指定对象并保留其余画面,两者均无需完整提示词,可用预设完成。
推荐理由:官方给出 Genjutsu 的局部重绘能力、输入限制与按长度分辨率计费的价格表,可据此判断视频改造成本。
Google 为 Gemini Live 推出生产力升级,加入 Personal Intelligence、Daily Brief、Spark 和免手操作收件箱等功能。
推荐理由:官方说明了 Gemini Live 接入 Spark 后的多步任务与跨应用记忆能力,可据此判断语音助手的任务边界变化。
MiniMax Hailuo 3.0 已在 Higgsfield 上线,相比 Hailuo 2.3 分辨率从 1080p 提升到 2K,单次生成时长从 10 秒延长到 15 秒,并首次在同一生成过程中输出原生立体声,包含对白、音效与环境音。
推荐理由:原文给出 Hailuo 3.0 与 2.3 的分辨率、时长、音频和输入数量对比,可据此判断多参考合成视频的可用边界。
Black Forest Labs 的首个视频模型 Flux 3 已在 Higgsfield 上线,自 2026 年 7 月 23 日公布后处于早期访问阶段,可生成 5 至 20 秒片段并可选同步音频。
推荐理由:梳理了 Flux 3 在 Higgsfield 上的输入模式、参考帧与计费方式,便于判断短片的生成成本与适用场景。
Introducing Seedance 2.5, our new-generation video creation model! With advancements in long-form storytelling, multimodal reference, and editing, Seedance 2.5 goes beyond longer single-pass video generation, delivering the journey from idea to finished video with greater control. Key highlights include: 1. Users can generate high-quality, 30-second audio-video clips in a single pass, bringing a complete story to life in one take. 2. Users can input up to 30 images, 10 video clips, and 10 audio clips as reference materials in a single pass. 3. Seedance 2.5 offers timestamp-level control for targeted editing of audio and video content, notably improving efficiency and controllability. Visit project homepage learn more: https://seed.bytedance.com/seedance2_5
推荐理由:Seedance 2.5 的 API 上线 BytePlus ModelArk,读者可据此了解单次生成 30 秒音视频与多模态参考的能力边界。
Manus 发布 Plan Mode,在开始构建前先暂停并生成一份包含目标、步骤和约束的 Markdown 计划,用户可编辑并确认后 Manus 才按计划执行。该功能为手动启用,Web 端输入 / 选择 Plan,移动端点击 + 选择 Plan Mode,可在任务中途开启,目前已在 Web 和移动端向所有用户开放。
推荐理由:官方说明 Plan Mode 在执行前插入方案审阅步骤,读者可据此判断它如何改变与智能体协作的流程。
Manus 推出 PowerPoint 模式,可直接生成原生 .pptx 文件,而非从网页格式转换或导出。图表背后保留可编辑的数据表格,表格为结构化单元格,布局遵循标准幻灯片母版,可在 Microsoft PowerPoint 或 Google Slides 中打开并继续编辑。
推荐理由:官方说明原生 .pptx 输出与图表数据可编辑的差异,读者可据此判断 AI 生成演示文稿的可用性变化。
Google 在 I/O 2026 上公布 12 项主要更新,包括新模型 Gemini Omni 与 Gemini 3.5 Flash。
推荐理由:Google I/O 2026 一次性放出 Gemini Omni、3.5 Flash 与 Search 智能体等 12 项更新,可据此判断其产品线走向。
Manus 上线 Shopify 连接器,向所有付费等级开放,用户通过与 Manus 对话即可创建 Shopify 开发店铺、搭建店面并管理商品目录与营销活动。
推荐理由:官方给出 Shopify 连接器的搭建、管理与营销三类用法和示例提示词,可据此判断对话式电商运营的边界。
Google 为 Google Flow 和 Google Flow Music 推出多项新能力:Gemini Omni Flash 模型支持从任意输入生成内容并实现精准视频剪辑,Flow Agent 可协助头脑风暴、批量编辑和整理素材,Flow Tools 让用户用自然语言创建并分享自定义工具。
推荐理由:Google Flow 一次性补齐智能体、自然语言建工具和移动端,读者可据此判断 AI 创作工具正从单点生成走向全流程协作。
Google Labs 在 I/O 上宣布 Stitch 新增实时设计方式,用户可与 Stitch Agent 协作,实时设计、流式生成并调整迭代。用户可用文本提示词、语音或导入现有代码库与设计文件作为起点,完成后可通过 Google AI Studio 生成可分享链接,并将界面导出到 Google Antigravity 接入后端逻辑,或直接通过 Netlify 发布到网页。
推荐理由:Google Labs 在 I/O 上公布 Stitch 的实时协作设计能力,读者可了解其输入方式与导出链路。
Google DeepMind 为实验性原型 Project Genie 推出 Street View 实景锚定能力,用户可选取美国地点并搭配风格与角色描述,生成起点绑定真实街景的互动世界,该能力由 Maps Imagery Grounding 技术驱动。
推荐理由:官方说明 Genie 接入 Street View 实景锚定,读者可了解世界模型如何为智能体与机器人提供贴近现实的环境。
Google 推出 Gemini for Science,包含 Google Labs 上的三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究工具打包成面向科研的智能体产品,读者可了解其能力边界与开放节奏。
Manus 为 Project 推出自我更新功能,可将对话中可复用的决策、术语和工作流模式识别出来,提出对 Project 指令、文件和技能的更新建议,仅在用户审批通过后才应用。用户可通过提示词手动触发审查,例如让 Manus 检查对话并建议更新;官方称该功能适用于支持 Project 指令和文件的会话,若工作区或任务不支持 Project 上下文则不适用。
推荐理由:官方说明 Project 如何从对话中提炼指令、文件与技能更新,并保留用户审批环节,可据此判断团队上下文维护方式的变化。
Manus 发布 Cloud Computer,一台 24/7 在线的云端专属机器,可托管 Bot、Python 脚本和自托管开源工具,文件与已安装工具在任务之间保留。
推荐理由:官方说明 Cloud Computer 与临时沙盒的差异,读者可据此判断哪些常驻任务适合交给它。
Manus 发布一整套 Slack 集成,提供三种使用方式:Manus Agent 以私信形式对话并具备持久记忆,Slack 集成可在频道话题中标记 @manus 读取上下文并发布结果,Slack 连接器基于 MCP 让 Manus 阅读频道并以用户身份发送消息。
推荐理由:官方给出三种 Slack 集成方式与各自适用场景,读者可据此判断哪种方式适合自己团队的工作流。
Manus 为 Google Workspace 连接器推出重大升级,集成 Google Workspace 团队在 GitHub 上发布的开源 CLI,使其不再局限于创建和读取文件,而能在 Docs、Sheets 和 Slides 中做精准编辑。
推荐理由:官方说明了连接器从读写文件升级到文档内精准编辑,并给出五类可直接套用的提示词示例。
Manus 推出桌面应用核心功能「我的电脑」,让 Manus 在本地终端执行命令行指令,读取、分析和编辑本地文件,并启动和控制本地应用程序,现已面向所有 macOS 和 Windows 用户开放。每个终端命令都需要用户明确批准,可选「始终允许」或「仅允许一次」。该功能还可调用本地 GPU 训练模型或运行大语言模型推理,并与个人项目、Agent 和定时任务集成。
推荐理由:Manus 从云端沙盒延伸到本地终端,读者可据此判断本地文件与闲置算力如何接入 Agent 工作流。
Manus 推出 Manus Agents,让用户直接在消息应用中使用 Manus,Telegram 是首个支持的渠道,今天起向所有订阅层级用户开放。连接只需在 Manus 工作区打开 Agents 标签页、扫描二维码,约一分钟完成,无需命令行、配置文件或 API tokens。
推荐理由:Manus 把完整 Agent 能力接入 Telegram,读者可据此判断聊天入口能否替代网页端完成多步骤任务。