Google 展示开发者用 Gemini 3.8 Flash 做的四个项目
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
Kling AI 宣布 Kling 4.0 将于今年 10 月发布,Kling 4.0 Flash 已面向 Ultra 年费订阅用户上线。
在 Higgsfield AI 上制作 AI 动画短片需五步:设计角色与视觉风格、分镜、逐镜生成、配音对口型、剪辑成片,最大难点是保持角色与画风跨镜头一致。
Meta 在 Connect 2026 上宣布,本月早些时候发布的个人 AI 智能体 Muse 将在未来几个月登陆其 AI 眼镜,用户可直接说出智能体名字,Muse 能对眼前所见采取行动,并支持可长时间深入对话、在对话同时后台完成任务的语音模式。
推荐理由:Meta 把个人智能体 Muse 从手机延伸到 AI 眼镜与随身设备,并公布首批零售与办公连接器名单,可据此判断其智能体落地路径。
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Higgsfield Blog 盘点 2026 年 15 款面向内容创作者的 AI 平台,覆盖策划、生成、剪辑与发布全流程。Higgsfield 以 30+ 模型整合图像、视频与广告制作,起价 $15/mo;Canva 主打日常设计,Descript 与 OpusClip 侧重长视频二次剪辑,HeyGen 与 Synthesia 专注数字人出镜视频。
Google Labs 在 Google Flow 中发布 6 款由建筑、声音设计和数字内容领域创意人打造的新工具,包括生成自定义环境音与音效的 Mondo Sónico。
Meta 在 Connect 2026 上公布 Ray-Ban Display 的多项更新,包括支持骑行与公交实时导航、用前方实景描述步行路线的语音导航,以及通过 Meta AI 应用自拍生成、由语音驱动表情的 Hologram 通话形象。
Meta 发布 Meta VR Glasses,整机约 100 克,采用眼镜加外接 puck 的两部分设计,puck 负责算力、电池与存储,官方称比 Meta Quest 3 轻五倍。
推荐理由:Meta 首次把 VR 做成约 100 克的分体眼镜形态,读者可据此了解其显示规格、内容生态与定价定位。
Meta 在 Connect 上发布首款音频眼镜 Ray-Ban Meta Audio,重 43 克,单次充电可听音乐、通话和使用 AI 助手最长 12 小时,配合充电盒可再延长 48 小时,提供 23 种配色与镜片组合,起售价 349 美元,10 月 13 日发货。
推荐理由:Meta 一次性铺开音频眼镜、Gen 3 与多品牌多价位产品线,可据此看清 AI 眼镜从单品走向全价位覆盖的路径。
Higgsfield 用 Audio、Lipsync Studio 和 Reframe 三步完成视频广告本地化:翻译并重新配音、将新语音与口型同步、再按平台比例重构画面。
Meta 推出 Muse Realtime Avatar,将 Muse Realtime Voice 的语音 token 流转化为可实时对话的虚拟形象,支持面部、手部和全身动作。
推荐理由:Meta 公开了实时数字人系统的蒸馏与推理栈细节,读者可据此了解实时视频生成如何做到亚秒级延迟。
Gabo 借助 Higgsfield 的 CPP 计划制作出约 50 部、多数时长约一小时的 AI 长片,单部制作周期 20 天至一个月,部分视频播放量达 600 万,部分作品播放量增长近 5 倍。
Higgsfield 与 Magnific 在一份订阅内覆盖图像、视频、语音和导出,是七家平台中覆盖面最广的两个;Runway 强在 Aleph 2.0 的帧级剪辑,ElevenLabs 强在以语音为核心的制作与本地化。
Higgsfield 的 Marketing Studio 可从一条母版广告出发,通过替换开场钩子、产品和语言批量生成广告变体:5 个产品 × 5 个钩子 × 4 个语言版本即得 100 条,若在原语言外再加 4 种语言则达 125 条。
多伦多创企 smartARM 开发出以视觉为核心的仿生手臂原型,借助 Meta 开源视觉模型 DINOv2,仅凭几张参考照片即可识别日常物体并自动选择合适的抓握方式,无需预先编程或训练。
Higgsfield 推出 Supercomputer,一个可研究、写代码、处理文件并生成图像、视频和音频的智能体工作台,首版约六周建成。其底层 harness 专为承载视觉上下文、跨模型调用和 Skills 设计,源于团队此前用 Claude Code、ChatGPT、Gemini 辅助生成的工作流痛点。
Higgsfield 发布教程,展示如何用情侣已有照片在 higgsfield.ai 上分七步生成 AI 婚礼邀请函,最终由 Cinema Studio 4.0 输出最长 30 秒的带音频影片。
Gemini 应用现已登陆 Windows。 只需一个快捷键,助你保持专注。按下 Alt + Space,即可在你常用的工具和日常应用旁润色草稿、总结长文档、头脑风暴新想法,以及创建自定义图像和视频。
Higgsfield 发布 AI 原生 3D 工作空间 3D Jutsu,可将提示词或参考图生成含物体、布局、灯光、相机与动画的可编辑 3D 场景,并直接在同一对话中渲染成视频。
推荐理由:官方给出 3D Jutsu 的场景搭建、编辑与导出流程,可据此判断提示词到 3D 预演再到视频的工作方式。
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,面向编码与智能体,每百万 token 价格为首发时 3.6 Flash 的一半。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。
推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。
Higgsfield 发布 Genjutsu,可在不重拍整段视频的前提下重建片段中的局部内容,包含 Motion Transfer 和 Object Swap 两项功能,前者提取原视频运动并套用到新角色或场景,后者只替换指定对象并保留其余画面,两者均无需完整提示词,可用预设完成。
推荐理由:官方给出 Genjutsu 的局部重绘能力、输入限制与按长度分辨率计费的价格表,可据此判断视频改造成本。
同一提示词在四款 AI 视频工具上产生不同结果:Cinema Studio 4.0 保留最多指定约束,Seedance 2.5 擅长变化角度与物体细节,Veo 3.1 的物理与真实感最强,Gemini Omni Flash 1.1 最擅长风格化元素,没有一款工具在所有类别中胜出。
Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。
推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。
Google Flow 通过 Gemini Omni 1.1 Flash 推出更新,带来更多创作控制能力。新增首尾帧控制以保持角色与叙事一致,支持导出 1080p 或 4K 视频,并可用 360p 低额度快速草拟、再下载 720p 版本。这些能力即日起在 Google Flow 中可用。
Higgsfield 推出 Blender 插件,把 AI 图像、视频、3D、动画与场景生成能力放进 Blender 视口,通过悬浮栏操作,生成结果可直接落入当前场景。
Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。
推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。
用脚本制作 AI 视频需五步:格式化脚本、拆分为场景、生成分镜表、逐镜生成、按序剪辑。Higgsfield 的 Cinema Studio 4.0 单次生成最长 30 秒、最高 1080p,可依节奏自动切成多个镜头,并支持 30+ 运镜预设、50+ 调色盘与最多 50 张参考图;Popcorn 负责分镜,Soul ID 保持角色一致。
MiniMax Hailuo 3.0 已在 Higgsfield 上线,相比 Hailuo 2.3 分辨率从 1080p 提升到 2K,单次生成时长从 10 秒延长到 15 秒,并首次在同一生成过程中输出原生立体声,包含对白、音效与环境音。
推荐理由:原文给出 Hailuo 3.0 与 2.3 的分辨率、时长、音频和输入数量对比,可据此判断多参考合成视频的可用边界。
Black Forest Labs 的首个视频模型 Flux 3 已在 Higgsfield 上线,自 2026 年 7 月 23 日公布后处于早期访问阶段,可生成 5 至 20 秒片段并可选同步音频。
推荐理由:梳理了 Flux 3 在 Higgsfield 上的输入模式、参考帧与计费方式,便于判断短片的生成成本与适用场景。
Introducing Seedance 2.5, our new-generation video creation model! With advancements in long-form storytelling, multimodal reference, and editing, Seedance 2.5 goes beyond longer single-pass video generation, delivering the journey from idea to finished video with greater control. Key highlights include: 1. Users can generate high-quality, 30-second audio-video clips in a single pass, bringing a complete story to life in one take. 2. Users can input up to 30 images, 10 video clips, and 10 audio clips as reference materials in a single pass. 3. Seedance 2.5 offers timestamp-level control for targeted editing of audio and video content, notably improving efficiency and controllability. Visit project homepage learn more: https://seed.bytedance.com/seedance2_5
推荐理由:Seedance 2.5 的 API 上线 BytePlus ModelArk,读者可据此了解单次生成 30 秒音视频与多模态参考的能力边界。
推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。
Lovart 的图像引擎 Nano Banana 并非单一模型,而是由 Nano Banana 2(基于 Gemini 3.1 Flash Image,5 秒内出图、1K-2K 分辨率)与 Nano Banana Pro(基于 Gemini 3 Pro Image,10-30 秒、2K-4K 原生、支持 SVG 矢量导出)组成的模型家族,在 MCoT 思维链系统下协同工作。
Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,面向智能体任务,在工具与电脑操作、编码和多模态理解上有明显提升。
推荐理由:Meta 发布面向智能体任务的多模态推理模型,并首次开放 Meta Model API 公共预览,读者可据此了解其能力定位与接入方式。
Google 在 5 月正式发布 Gemini 3.5 与 Gemini Omni,前者主打智能体与编程的前沿智能,后者支持图像、音频、视频和文本输入并生成高质量视频。
Google Labs 推出实验性应用 Dreambeans,借助 Personal Intelligence 和 Nano Banana 2 生成个性化每日故事,连接 Gmail、Calendar、Photos、YouTube 和 Search 历史,以有限的故事集替代无限滚动。