Google 展示开发者用 Gemini 3.8 Flash 做的四个项目
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
布鲁克林 Edy's Grocer 店主 Edy Massih 用 Gemini 将家族黎巴嫩菜谱按需放大为大型宴会批量配方,避免手工换算香料与糕点比例出错。Gemini 还能把活动菜单转成分区采购清单、汇总共用食材并提前排好备餐日程,同时为无麸质、无坚果等饮食限制提供保留风味的替换方案。Edy 表示 Gemini 让他减少行政事务,把更多时间用于推广黎巴嫩饮食文化。
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Google Gemini 开始推送新一批 Connected Apps,用户可在 Gemini 内直接连接第三方工具,无需在标签页之间切换。
推荐理由:Gemini 把第三方应用接入聊天入口,读者可据此判断多应用协同的工作方式会如何变化。
Google Labs 在 Google Flow 中发布 6 款由建筑、声音设计和数字内容领域创意人打造的新工具,包括生成自定义环境音与音效的 Mondo Sónico。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。
Nano Banana 2(Gemini 3.1 Flash Image)目前可通过 Google 订阅、按量计费 API 以及创意平台限时无限量窗口三种方式使用。
Higgsfield 与 Magnific 在一份订阅内覆盖图像、视频、语音和导出,是七家平台中覆盖面最广的两个;Runway 强在 Aleph 2.0 的帧级剪辑,ElevenLabs 强在以语音为核心的制作与本地化。
Google Labs 推出面向家庭的新版 CC 智能体,拥有独立 Google 账号和明确权限模型,最多支持六名成员协作。CC 只读取成员主动共享的信息,自动整理成共享每日简报并接入 Calendar 和 Tasks,还能在授权下填写许可单、活动报名 PDF 等事务。
推荐理由:Google Labs 把个人智能体 CC 扩展为家庭共享形态,读者可了解其权限模型与共享记忆的具体设计。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。
推荐理由:Google 发布两款实时语音对话模型,给出语音智能体基准成绩与开发者接入渠道,可据此判断语音 Agent 的可用性。
Google 博客介绍用 Gemini 处理家务的 4 种方式:借助 Gemini Live 摄像头排查家电故障、定制膳食计划与购物清单、上传收据照片整理家庭开支,以及对比家庭用车等大额采购。
Google DevFest 2026 于 10 月 1 日至 12 月 31 日回归,由全球 Google Developer Groups 在 115 个国家举办 800 多场活动,预计近百万开发者参与。
Google Labs 的 Dreambeans 现已向美国所有账号(18+)开放,支持 Android 和 iOS。该实验功能结合个性化主题与用户选定的 Google 应用(Calendar、Gmail、Photos、Search、YouTube,以及新增的 Gemini)生成每日故事集,连接 Google Photos 后还可融入用户及亲友的影像。
Gemini 应用现已登陆 Windows。 只需一个快捷键,助你保持专注。按下 Alt + Space,即可在你常用的工具和日常应用旁润色草稿、总结长文档、头脑风暴新想法,以及创建自定义图像和视频。
Google 发布 Windows 版 Gemini 桌面应用,Windows 10 和 11 用户可在 gemini.google/desktop 下载,全球同步上线。
推荐理由:官方给出 Windows 端 Gemini 的快捷键入口、智能体与图像视频生成能力,可据此判断桌面工作流的变化。
Google 博客介绍 Gemini 处理行政事务的 4 种用法:填写表格与缴费、参与公民事务、查找政府机构与法规、申请社会服务。Google 的 AI & Economy ATLAS v1.0 研究显示,约 40% 用 Gemini 处理公民事务的人咨询此类问题,26% 用于了解政府事务,超 16% 用于查找机构,超 15% 用于社会服务,近半数对话发生在非标准工作时间。
Higgsfield 发布 Soul 2.0 与 Nano Banana Pro 的选型对比:Soul 2.0 是 Higgsfield 自研基础图像模型,主打电影级写实、20+ 预设和 Soul ID 跨代人脸一致性;Nano Banana Pro 是 Google 的 Gemini 驱动图像模型,最高 4K 分辨率,强于风格广度、对象级编辑和图像内文字渲染。
Google 在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,官方称其音质表现最好,人声更具表现力、编曲更丰富。Gemini 应用内支持选择或描述曲风、在带人声与纯器乐之间切换,并提供从背景音乐到生日定制曲的模板,还可选择短曲或长曲。
推荐理由:Lyria 3.5 在音质、人声表现和编曲丰富度上的升级,以及它在 Gemini 应用与 API 中的开放范围,可供读者判断音乐生成能力当前所处的位置。
Google 推出 Fairwind Program,这是一个面向政府、Google Cloud 客户和网络安全合作伙伴的受限访问计划,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具组合,用于自主发现、验证并修复漏洞。
推荐理由:Google 把前沿模型与自动修复工具打包成受限访问计划,读者可了解其面向政府与关键基础设施的准入方式。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的定价、基准表现和开放入口,可据此判断长程编码与安全场景的选型。
Google 与 Beast Industries 启动多年合作,将 MrBeast 与 YouTube 的关系延伸至 Gemini 和 Google Health。9 月 5 日上线的 MrBeast 新视频中,团队将在丛林、沙漠和北极三大极端环境中借助 Gemini 识别危险、应对天气变化。他还会出现在 Gemini 新广告中,并在后续挑战里接入 Fitbit Air。
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,面向编码与智能体,每百万 token 价格为首发时 3.6 Flash 的一半。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
2026 年值得考虑的 Midjourney 替代方案包括 Google Gemini、ChatGPT Images、Higgsfield、Leonardo、Ideogram、Adobe Firefly、Flux、Stable Diffusion、Recraft 和 Krea,多数提供免费或有限免费额度,Stable Diffusion 可自托管。
同一提示词在四款 AI 视频工具上产生不同结果:Cinema Studio 4.0 保留最多指定约束,Seedance 2.5 擅长变化角度与物体细节,Veo 3.1 的物理与真实感最强,Gemini Omni Flash 1.1 最擅长风格化元素,没有一款工具在所有类别中胜出。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。
Google Flow 通过 Gemini Omni 1.1 Flash 推出更新,带来更多创作控制能力。新增首尾帧控制以保持角色与叙事一致,支持导出 1080p 或 4K 视频,并可用 360p 低额度快速草拟、再下载 720p 版本。这些能力即日起在 Google Flow 中可用。
Google Workspace 产品副总裁 Yulie Kwon Kim 介绍了用 Gemini 开启新学期的 7 种方式,包括在 Sheets canvas 中生成学期规划 mini app、在 Docs 中把笔记转成学习指南和图表、在 Slides 中用 Deck Generation 生成整套演示文稿。
Google 发布 Gemini 3.5 Transcribe 语音转文字模型,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。
推荐理由:官方给出流式与非流式两档 WER 数字和相对 Chirp 3 的延迟提升,便于判断语音转写在实际管线中的可用性。
Google 为 Gemini Live 推出生产力升级,加入 Personal Intelligence、Daily Brief、Spark 和免手操作收件箱等功能。
推荐理由:官方说明了 Gemini Live 接入 Spark 后的多步任务与跨应用记忆能力,可据此判断语音助手的任务边界变化。
Higgsfield、Midjourney、OpenAI、Google Gemini、Adobe Firefly、Ideogram、Dreamina、Runway、Magnific 和 Canva 入选 2026 年十大 AI 图像生成器。
Google Flow Sessions 第四期结营,这一为期六周的创意合作项目让艺术家们借助 Google Flow 的生成模型完成各自的短片创作,作品现已公开。该项目以共同创作为核心,为创作者提供时间和空间把个人热情项目落地。
Google 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改善,同时更易控制输出的节奏与时长。
Google AI Futures Fund 与日本电信运营商 KDDI 合作启动 AI Startup Support Program,面向日本 AI 原生创业公司提供双方基金的投资。
Google 在 5 月正式发布 Gemini 3.5 与 Gemini Omni,前者主打智能体与编程的前沿智能,后者支持图像、音频、视频和文本输入并生成高质量视频。
Google Labs 推出实验性应用 Dreambeans,借助 Personal Intelligence 和 Nano Banana 2 生成个性化每日故事,连接 Gmail、Calendar、Photos、YouTube 和 Search 历史,以有限的故事集替代无限滚动。