Google 展示开发者用 Gemini 3.8 Flash 做的四个项目
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
Kling AI 宣布 Kling 4.0 将于今年 10 月发布,Kling 4.0 Flash 已面向 Ultra 年费订阅用户上线。
在 Higgsfield AI 上制作 AI 动画短片需五步:设计角色与视觉风格、分镜、逐镜生成、配音对口型、剪辑成片,最大难点是保持角色与画风跨镜头一致。
Meta 在 Connect 2026 上宣布,本月早些时候发布的个人 AI 智能体 Muse 将在未来几个月登陆其 AI 眼镜,用户可直接说出智能体名字,Muse 能对眼前所见采取行动,并支持可长时间深入对话、在对话同时后台完成任务的语音模式。
推荐理由:Meta 把个人智能体 Muse 从手机延伸到 AI 眼镜与随身设备,并公布首批零售与办公连接器名单,可据此判断其智能体落地路径。
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Higgsfield Blog 盘点 2026 年 15 款面向内容创作者的 AI 平台,覆盖策划、生成、剪辑与发布全流程。Higgsfield 以 30+ 模型整合图像、视频与广告制作,起价 $15/mo;Canva 主打日常设计,Descript 与 OpusClip 侧重长视频二次剪辑,HeyGen 与 Synthesia 专注数字人出镜视频。
Google Labs 在 Google Flow 中发布 6 款由建筑、声音设计和数字内容领域创意人打造的新工具,包括生成自定义环境音与音效的 Mondo Sónico。
Meta 在 Connect 2026 上公布 Ray-Ban Display 的多项更新,包括支持骑行与公交实时导航、用前方实景描述步行路线的语音导航,以及通过 Meta AI 应用自拍生成、由语音驱动表情的 Hologram 通话形象。
Meta 发布 Meta VR Glasses,整机约 100 克,采用眼镜加外接 puck 的两部分设计,puck 负责算力、电池与存储,官方称比 Meta Quest 3 轻五倍。
推荐理由:Meta 首次把 VR 做成约 100 克的分体眼镜形态,读者可据此了解其显示规格、内容生态与定价定位。
Meta 在 Connect 上发布首款音频眼镜 Ray-Ban Meta Audio,重 43 克,单次充电可听音乐、通话和使用 AI 助手最长 12 小时,配合充电盒可再延长 48 小时,提供 23 种配色与镜片组合,起售价 349 美元,10 月 13 日发货。
推荐理由:Meta 一次性铺开音频眼镜、Gen 3 与多品牌多价位产品线,可据此看清 AI 眼镜从单品走向全价位覆盖的路径。
Higgsfield 用 Audio、Lipsync Studio 和 Reframe 三步完成视频广告本地化:翻译并重新配音、将新语音与口型同步、再按平台比例重构画面。
Meta 推出 Muse Realtime Avatar,将 Muse Realtime Voice 的语音 token 流转化为可实时对话的虚拟形象,支持面部、手部和全身动作。
推荐理由:Meta 公开了实时数字人系统的蒸馏与推理栈细节,读者可据此了解实时视频生成如何做到亚秒级延迟。
Gabo 借助 Higgsfield 的 CPP 计划制作出约 50 部、多数时长约一小时的 AI 长片,单部制作周期 20 天至一个月,部分视频播放量达 600 万,部分作品播放量增长近 5 倍。
Higgsfield 与 Magnific 在一份订阅内覆盖图像、视频、语音和导出,是七家平台中覆盖面最广的两个;Runway 强在 Aleph 2.0 的帧级剪辑,ElevenLabs 强在以语音为核心的制作与本地化。
多伦多创企 smartARM 开发出以视觉为核心的仿生手臂原型,借助 Meta 开源视觉模型 DINOv2,仅凭几张参考照片即可识别日常物体并自动选择合适的抓握方式,无需预先编程或训练。
Higgsfield 推出 Supercomputer,一个可研究、写代码、处理文件并生成图像、视频和音频的智能体工作台,首版约六周建成。其底层 harness 专为承载视觉上下文、跨模型调用和 Skills 设计,源于团队此前用 Claude Code、ChatGPT、Gemini 辅助生成的工作流痛点。
Higgsfield 发布教程,展示如何用情侣已有照片在 higgsfield.ai 上分七步生成 AI 婚礼邀请函,最终由 Cinema Studio 4.0 输出最长 30 秒的带音频影片。
Gemini 应用现已登陆 Windows。 只需一个快捷键,助你保持专注。按下 Alt + Space,即可在你常用的工具和日常应用旁润色草稿、总结长文档、头脑风暴新想法,以及创建自定义图像和视频。
Higgsfield 发布 AI 原生 3D 工作空间 3D Jutsu,可将提示词或参考图生成含物体、布局、灯光、相机与动画的可编辑 3D 场景,并直接在同一对话中渲染成视频。
推荐理由:官方给出 3D Jutsu 的场景搭建、编辑与导出流程,可据此判断提示词到 3D 预演再到视频的工作方式。
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,面向编码与智能体,每百万 token 价格为首发时 3.6 Flash 的一半。
Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。
推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。
Higgsfield 发布 Genjutsu,可在不重拍整段视频的前提下重建片段中的局部内容,包含 Motion Transfer 和 Object Swap 两项功能,前者提取原视频运动并套用到新角色或场景,后者只替换指定对象并保留其余画面,两者均无需完整提示词,可用预设完成。
推荐理由:官方给出 Genjutsu 的局部重绘能力、输入限制与按长度分辨率计费的价格表,可据此判断视频改造成本。
Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。
推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。
Google Flow 通过 Gemini Omni 1.1 Flash 推出更新,带来更多创作控制能力。新增首尾帧控制以保持角色与叙事一致,支持导出 1080p 或 4K 视频,并可用 360p 低额度快速草拟、再下载 720p 版本。这些能力即日起在 Google Flow 中可用。
Higgsfield 推出 Blender 插件,把 AI 图像、视频、3D、动画与场景生成能力放进 Blender 视口,通过悬浮栏操作,生成结果可直接落入当前场景。
Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。
推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。
用脚本制作 AI 视频需五步:格式化脚本、拆分为场景、生成分镜表、逐镜生成、按序剪辑。Higgsfield 的 Cinema Studio 4.0 单次生成最长 30 秒、最高 1080p,可依节奏自动切成多个镜头,并支持 30+ 运镜预设、50+ 调色盘与最多 50 张参考图;Popcorn 负责分镜,Soul ID 保持角色一致。
Introducing Seedance 2.5, our new-generation video creation model! With advancements in long-form storytelling, multimodal reference, and editing, Seedance 2.5 goes beyond longer single-pass video generation, delivering the journey from idea to finished video with greater control. Key highlights include: 1. Users can generate high-quality, 30-second audio-video clips in a single pass, bringing a complete story to life in one take. 2. Users can input up to 30 images, 10 video clips, and 10 audio clips as reference materials in a single pass. 3. Seedance 2.5 offers timestamp-level control for targeted editing of audio and video content, notably improving efficiency and controllability. Visit project homepage learn more: https://seed.bytedance.com/seedance2_5
推荐理由:Seedance 2.5 的 API 上线 BytePlus ModelArk,读者可据此了解单次生成 30 秒音视频与多模态参考的能力边界。
推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。
Lovart 的图像引擎 Nano Banana 并非单一模型,而是由 Nano Banana 2(基于 Gemini 3.1 Flash Image,5 秒内出图、1K-2K 分辨率)与 Nano Banana Pro(基于 Gemini 3 Pro Image,10-30 秒、2K-4K 原生、支持 SVG 矢量导出)组成的模型家族,在 MCoT 思维链系统下协同工作。
Google 在 5 月正式发布 Gemini 3.5 与 Gemini Omni,前者主打智能体与编程的前沿智能,后者支持图像、音频、视频和文本输入并生成高质量视频。
十字路口与播客 405 游局主播筱宁对谈,把 2026 年 AI 游戏行业拆成四层图景:AI 作为工具、创作入口、交互对象,以及改变娱乐关系,并指出三种常见误区。讨论认为「AI 版愤怒的小鸟」式的共识爆款尚未出现,更可能从创业者中野蛮生长而非大厂立项做出来。
ChatCut 创始人李凯文在播客对谈中提出,视频剪辑正迎来自己的「Cursor 时刻」,但他坚持「不生成任何像素」,让 AI 作为剪辑助理工作在编辑器之上,服务「还不是剪辑师」的人群。他认为视频是 token 黑洞,多模态理解尚不足以精确到剪辑层面,Gemini 2.5/3.0 已带来巨大帮助,MG 动画能力很大程度来自 3.0。
真格基金管理合伙人戴雨森提出 2026 年关键词为"The Year of R",即 Return、Research、Remember 与多模态 Reasoning,认为这将是现实与回调之年。
Google DeepMind 机器人团队高级研究科学家谭捷在访谈中介绍了 Gemini Robotics 1.5 的两项关键突破:把 thinking 加入 VLA 模型,以及 cross-embodiment transfer(跨具身迁移),并称 motion transfer 是独门秘诀。他认为机器人智能近年主要依赖多模态大模型,最大瓶颈是数据,未来传统物理仿真会逐步被生成式模型仿真取代。
张小珺发布与理想创始人兼CEO李想的第二次3小时访谈完整版,录制于2025年4月。李想以“CEO大模型”自比,按MoE架构调用技术、战略、组织三位“专家”,谈及理想自研基座大模型、VLA三阶段训练、每1万公里验证成本从18万降至4000元,以及记忆程序、能量与亲密关系等话题。
美团光年之外产品负责人谢青池用一年多啃完200多篇AI论文后,从中精选36篇经典,以4小时讲解开源自己的论文探索之旅。
十字路口与庄明浩复盘 2025 年 AI 行业,以“拐点”为年度关键词,梳理从年初 DeepSeek R1 到近期 Sora 2 的模型大战,以及 Manus 引爆的“Agent 元年”。节目还讨论开源生态与人才流向、DeepSeek V3.2 发布后 V4 和 R2 今年或不再出现,并将目光投向资本市场对 AI 的集体狂想。
京东健康探索研究院首席科学家王国鑫介绍「京医千询2.0」大模型与「AI医院」的研发应用,该模型实现三大进化:大量使用合成数据并向行业开放可模拟真实医患对话的Agent、单模型内同时支持CT/MRI/X光等影像理解、从简单推理升级为可追溯证据来源的循证推理。京东健康每天有49万次医疗服务咨询,其底气在于拥有实体医疗机构、药品供应链和30分钟送药上门能力。