Google 如何用 Gemini 打造 Google I/O 2026
Google 用 Gemini 系列模型完成了 Google I/O 2026 的短片、视觉品牌与预热节目制作。
Google 用 Gemini 系列模型完成了 Google I/O 2026 的短片、视觉品牌与预热节目制作。
Google 在 I/O 2026 上公布 12 项主要更新,包括新模型 Gemini Omni 与 Gemini 3.5 Flash。
推荐理由:Google I/O 2026 一次性放出 Gemini Omni、3.5 Flash 与 Search 智能体等 12 项更新,可据此判断其产品线走向。
十字路口与播客 405 游局主播筱宁对谈,把 2026 年 AI 游戏行业拆成四层图景:AI 作为工具、创作入口、交互对象,以及改变娱乐关系,并指出三种常见误区。讨论认为「AI 版愤怒的小鸟」式的共识爆款尚未出现,更可能从创业者中野蛮生长而非大厂立项做出来。
Google 为 Google Flow 和 Google Flow Music 推出多项新能力:Gemini Omni Flash 模型支持从任意输入生成内容并实现精准视频剪辑,Flow Agent 可协助头脑风暴、批量编辑和整理素材,Flow Tools 让用户用自然语言创建并分享自定义工具。
推荐理由:Google Flow 一次性补齐智能体、自然语言建工具和移动端,读者可据此判断 AI 创作工具正从单点生成走向全流程协作。
Google 在 I/O 2026 发布 Gemini 3.5 Flash,官方称其对比 3.1 Pro 在几乎所有基准上更好,输出速度是其他前沿模型的 4 倍,价格不到同类前沿模型的一半,即日起在 Google 全线产品与 API 提供,Gemini 3.5 Pro 将于下月推出。
推荐理由:Google 一次性放出 Gemini 3.5 Flash、Gemini Omni 与 Antigravity 2.0,读者可据此判断其智能体产品线的整体走向。
Google DeepMind 为实验性原型 Project Genie 推出 Street View 实景锚定能力,用户可选取美国地点并搭配风格与角色描述,生成起点绑定真实街景的互动世界,该能力由 Maps Imagery Grounding 技术驱动。
推荐理由:官方说明 Genie 接入 Street View 实景锚定,读者可了解世界模型如何为智能体与机器人提供贴近现实的环境。
Google 公布 4 月 AI 更新,包括开源模型 Gemma 4、自主研究智能体 Deep Research Max 和 Colab 的 Learn Mode。
字节 Seed 发布论文 Seedance 2.0,主题为面向世界复杂度的视频生成,原文链接为 https://seed.bytedance.com/zh/public_papers/seedance-2-0-advancing-video-generation-for-world-complexity。
ChatCut 创始人李凯文在播客对谈中提出,视频剪辑正迎来自己的「Cursor 时刻」,但他坚持「不生成任何像素」,让 AI 作为剪辑助理工作在编辑器之上,服务「还不是剪辑师」的人群。他认为视频是 token 黑洞,多模态理解尚不足以精确到剪辑层面,Gemini 2.5/3.0 已带来巨大帮助,MG 动画能力很大程度来自 3.0。
真格基金管理合伙人戴雨森提出 2026 年关键词为"The Year of R",即 Return、Research、Remember 与多模态 Reasoning,认为这将是现实与回调之年。
Google DeepMind 机器人团队高级研究科学家谭捷在访谈中介绍了 Gemini Robotics 1.5 的两项关键突破:把 thinking 加入 VLA 模型,以及 cross-embodiment transfer(跨具身迁移),并称 motion transfer 是独门秘诀。他认为机器人智能近年主要依赖多模态大模型,最大瓶颈是数据,未来传统物理仿真会逐步被生成式模型仿真取代。
张小珺发布与理想创始人兼CEO李想的第二次3小时访谈完整版,录制于2025年4月。李想以“CEO大模型”自比,按MoE架构调用技术、战略、组织三位“专家”,谈及理想自研基座大模型、VLA三阶段训练、每1万公里验证成本从18万降至4000元,以及记忆程序、能量与亲密关系等话题。
美团光年之外产品负责人谢青池用一年多啃完200多篇AI论文后,从中精选36篇经典,以4小时讲解开源自己的论文探索之旅。
十字路口与庄明浩复盘 2025 年 AI 行业,以“拐点”为年度关键词,梳理从年初 DeepSeek R1 到近期 Sora 2 的模型大战,以及 Manus 引爆的“Agent 元年”。节目还讨论开源生态与人才流向、DeepSeek V3.2 发布后 V4 和 R2 今年或不再出现,并将目光投向资本市场对 AI 的集体狂想。
京东健康探索研究院首席科学家王国鑫介绍「京医千询2.0」大模型与「AI医院」的研发应用,该模型实现三大进化:大量使用合成数据并向行业开放可模拟真实医患对话的Agent、单模型内同时支持CT/MRI/X光等影像理解、从简单推理升级为可追溯证据来源的循证推理。京东健康每天有49万次医疗服务咨询,其底气在于拥有实体医疗机构、药品供应链和30分钟送药上门能力。
阶跃星辰首席科学家张祥雨在播客中回顾多模态研究10年历程,并预判未来两年将出现2个“GPT-4时刻”。他透露训练中发现模型推理能力(尤其数学)随规模先升后降,认为这是next token prediction的本质缺陷,解决方案是引入RL。他还提出o1范式本质是Meta-CoT,下一个“GPT-4时刻”指向模型的在线学习与自主学习。
42章经在年终复盘播客中判断,25 年将是 AI 爆发的一年,还没进场的人当下可能是最好的机会。复盘认为 24 年 1-9 月一级市场为过去十年最差,但 9 月后融资市场明显复苏、多模态能力持续加强、AI 创始人画像明显变化,构成乐观理由。展望 25 年,市场关键词从 23 年「大模型」、24 年「具身智能」转向「应用落地」,最看好 Prosumer、Agent 和多模态。
前 Character.ai 模型应用算法专家 Ted 在播客中复盘了 C.AI 的 Post Training 实践,称其核心是设计高效的迭代路径,主要依赖 SFT、RLHF、DPO 三大件,RAG 和 Prompt Engineering 几乎没做。他还提到 C.AI 的语音延迟基本是业界做得最好的,并观察到 ChatGPT 内部也是多模型混用、硅谷 Post-train 人才极其抢手。
OpenAI 发布 GPT-4o,Sam Altman 表示已在 ChatGPT 中免费提供这一模型,且不含广告。他称新的语音与视频模式是自己用过最好的计算机界面,达到接近人类的响应速度和表现力,并提到后续会加入可选个性化、访问用户信息以及代为执行操作等能力。
推荐理由:OpenAI 官方说明 GPT-4o 免费开放与语音视频模式,读者可了解其能力定位与商业化取舍。