Google 展示开发者用 Gemini 3.8 Flash 做的四个项目
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
Meta 在 Connect 2026 上宣布,本月早些时候发布的个人 AI 智能体 Muse 将在未来几个月登陆其 AI 眼镜,用户可直接说出智能体名字,Muse 能对眼前所见采取行动,并支持可长时间深入对话、在对话同时后台完成任务的语音模式。
推荐理由:Meta 把个人智能体 Muse 从手机延伸到 AI 眼镜与随身设备,并公布首批零售与办公连接器名单,可据此判断其智能体落地路径。
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Meta 发布 Meta VR Glasses,整机约 100 克,采用眼镜加外接 puck 的两部分设计,puck 负责算力、电池与存储,官方称比 Meta Quest 3 轻五倍。
推荐理由:Meta 首次把 VR 做成约 100 克的分体眼镜形态,读者可据此了解其显示规格、内容生态与定价定位。
Meta 在 Connect 上发布首款音频眼镜 Ray-Ban Meta Audio,重 43 克,单次充电可听音乐、通话和使用 AI 助手最长 12 小时,配合充电盒可再延长 48 小时,提供 23 种配色与镜片组合,起售价 349 美元,10 月 13 日发货。
推荐理由:Meta 一次性铺开音频眼镜、Gen 3 与多品牌多价位产品线,可据此看清 AI 眼镜从单品走向全价位覆盖的路径。
Meta 推出 Muse Realtime Avatar,将 Muse Realtime Voice 的语音 token 流转化为可实时对话的虚拟形象,支持面部、手部和全身动作。
推荐理由:Meta 公开了实时数字人系统的蒸馏与推理栈细节,读者可据此了解实时视频生成如何做到亚秒级延迟。
Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。
推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。
Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。
推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。
Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。
推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。