Manus 2.0 发布视频编辑器,支持分层时间轴与本地素材剪辑
Manus 发布 2.0 视频编辑器,内置于 Manus Studio 桌面应用,把生成镜头、图像、字幕、动态图形、配音、音乐和音效放在独立轨道上,用户可拖动修改或交给 Manus 处理。
推荐理由:官方复盘 Manus 2.0 视频能力与 Video Editor 的分层时间轴设计,可看到从一句话提示词到成片的完整工作流。
Manus 发布 2.0 视频编辑器,内置于 Manus Studio 桌面应用,把生成镜头、图像、字幕、动态图形、配音、音乐和音效放在独立轨道上,用户可拖动修改或交给 Manus 处理。
推荐理由:官方复盘 Manus 2.0 视频能力与 Video Editor 的分层时间轴设计,可看到从一句话提示词到成片的完整工作流。
Higgsfield 宣布其年化收入运行率达到 10 亿美元以上,此时距其 AI 原生创意套件上线 18 个月。该数字由最近四周收入乘以 13 推算,并非过去一年已实现收入;企业客户合同收入自 6 月以来增长 10 倍,订阅收入占比从超过 90% 降至略高于 60%,按需用量上升。
推荐理由:官方披露年化收入运行率突破 10 亿美元,并给出订阅与按需用量的收入结构变化,可观察 AI 生成广告的商业化路径。
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Meta 推出 Muse Realtime Avatar,将 Muse Realtime Voice 的语音 token 流转化为可实时对话的虚拟形象,支持面部、手部和全身动作。
推荐理由:Meta 公开了实时数字人系统的蒸馏与推理栈细节,读者可据此了解实时视频生成如何做到亚秒级延迟。
Higgsfield 发布 AI 原生 3D 工作空间 3D Jutsu,可将提示词或参考图生成含物体、布局、灯光、相机与动画的可编辑 3D 场景,并直接在同一对话中渲染成视频。
推荐理由:官方给出 3D Jutsu 的场景搭建、编辑与导出流程,可据此判断提示词到 3D 预演再到视频的工作方式。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
Higgsfield 发布 Genjutsu,可在不重拍整段视频的前提下重建片段中的局部内容,包含 Motion Transfer 和 Object Swap 两项功能,前者提取原视频运动并套用到新角色或场景,后者只替换指定对象并保留其余画面,两者均无需完整提示词,可用预设完成。
推荐理由:官方给出 Genjutsu 的局部重绘能力、输入限制与按长度分辨率计费的价格表,可据此判断视频改造成本。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。
MiniMax Hailuo 3.0 已在 Higgsfield 上线,相比 Hailuo 2.3 分辨率从 1080p 提升到 2K,单次生成时长从 10 秒延长到 15 秒,并首次在同一生成过程中输出原生立体声,包含对白、音效与环境音。
推荐理由:原文给出 Hailuo 3.0 与 2.3 的分辨率、时长、音频和输入数量对比,可据此判断多参考合成视频的可用边界。
Black Forest Labs 的首个视频模型 Flux 3 已在 Higgsfield 上线,自 2026 年 7 月 23 日公布后处于早期访问阶段,可生成 5 至 20 秒片段并可选同步音频。
推荐理由:梳理了 Flux 3 在 Higgsfield 上的输入模式、参考帧与计费方式,便于判断短片的生成成本与适用场景。
Introducing Seedance 2.5, our new-generation video creation model! With advancements in long-form storytelling, multimodal reference, and editing, Seedance 2.5 goes beyond longer single-pass video generation, delivering the journey from idea to finished video with greater control. Key highlights include: 1. Users can generate high-quality, 30-second audio-video clips in a single pass, bringing a complete story to life in one take. 2. Users can input up to 30 images, 10 video clips, and 10 audio clips as reference materials in a single pass. 3. Seedance 2.5 offers timestamp-level control for targeted editing of audio and video content, notably improving efficiency and controllability. Visit project homepage learn more: https://seed.bytedance.com/seedance2_5
推荐理由:Seedance 2.5 的 API 上线 BytePlus ModelArk,读者可据此了解单次生成 30 秒音视频与多模态参考的能力边界。
推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。
Google 为 Google Flow 和 Google Flow Music 推出多项新能力:Gemini Omni Flash 模型支持从任意输入生成内容并实现精准视频剪辑,Flow Agent 可协助头脑风暴、批量编辑和整理素材,Flow Tools 让用户用自然语言创建并分享自定义工具。
推荐理由:Google Flow 一次性补齐智能体、自然语言建工具和移动端,读者可据此判断 AI 创作工具正从单点生成走向全流程协作。
字节 Seed 发布论文 Seedance 2.0,主题为面向世界复杂度的视频生成,原文链接为 https://seed.bytedance.com/zh/public_papers/seedance-2-0-advancing-video-generation-for-world-complexity。
OpenAI 发布新模型 Sora 2 和配套应用 Sora,让用户更容易创作、分享和观看视频,并支持通过 cameo 功能把自己和朋友放进视频中,团队在角色一致性上投入了大量工作。
推荐理由:OpenAI 同时发布 Sora 2 模型与 Sora 应用,并公开了产品设计原则与对成瘾、霸凌等风险的顾虑。