跳到正文

#多模态

今日 0 条
6月2日周二
5月28日周四
5月20日周三
  1. Google Labs 博客74

    Google Flow 与 Flow Music 新增智能体、Gemini Omni 和移动应用

    Google 为 Google Flow 和 Google Flow Music 推出多项新能力:Gemini Omni Flash 模型支持从任意输入生成内容并实现精准视频剪辑,Flow Agent 可协助头脑风暴、批量编辑和整理素材,Flow Tools 让用户用自然语言创建并分享自定义工具。

    推荐理由:Google Flow 一次性补齐智能体、自然语言建工具和移动端,读者可据此判断 AI 创作工具正从单点生成走向全流程协作。

  2. Google Labs 博客88

    Google I/O 2026:Gemini 3.5 Flash、Gemini Omni 与 Antigravity 2.0 发布

    Google 在 I/O 2026 发布 Gemini 3.5 Flash,官方称其对比 3.1 Pro 在几乎所有基准上更好,输出速度是其他前沿模型的 4 倍,价格不到同类前沿模型的一半,即日起在 Google 全线产品与 API 提供,Gemini 3.5 Pro 将于下月推出。

    推荐理由:Google 一次性放出 Gemini 3.5 Flash、Gemini Omni 与 Antigravity 2.0,读者可据此判断其智能体产品线的整体走向。

  3. Google Labs 博客60

    Google 为 Project Genie 加入 Street View 实景能力并扩大开放范围

    Google DeepMind 为实验性原型 Project Genie 推出 Street View 实景锚定能力,用户可选取美国地点并搭配风格与角色描述,生成起点绑定真实街景的互动世界,该能力由 Maps Imagery Grounding 技术驱动。

    推荐理由:官方说明 Genie 接入 Street View 实景锚定,读者可了解世界模型如何为智能体与机器人提供贴近现实的环境。

5月5日周二
4月15日周三
1月26日周一
  1. 十字路口Crossing26

    视频剪辑的「Cursor 时刻」来了?对谈 ChatCut 创始人李凯文

    ChatCut 创始人李凯文在播客对谈中提出,视频剪辑正迎来自己的「Cursor 时刻」,但他坚持「不生成任何像素」,让 AI 作为剪辑助理工作在编辑器之上,服务「还不是剪辑师」的人群。他认为视频是 token 黑洞,多模态理解尚不足以精确到剪辑层面,Gemini 2.5/3.0 已带来巨大帮助,MG 动画能力很大程度来自 3.0。

12月14日周日
11月28日周五
  1. 张小珺Jùn|商业访谈录40

    对 DeepMind 谭捷的访谈:机器人、跨本体、世界模型与 Gemini Robotics 1.5

    Google DeepMind 机器人团队高级研究科学家谭捷在访谈中介绍了 Gemini Robotics 1.5 的两项关键突破:把 thinking 加入 VLA 模型,以及 cross-embodiment transfer(跨具身迁移),并称 motion transfer 是独门秘诀。他认为机器人智能近年主要依赖多模态大模型,最大瓶颈是数据,未来传统物理仿真会逐步被生成式模型仿真取代。

10月30日周四
  1. 张小珺Jùn|商业访谈录22

    对李想的第二次3小时访谈:CEO大模型、MoE、VLA、记忆与人类的智慧

    张小珺发布与理想创始人兼CEO李想的第二次3小时访谈完整版,录制于2025年4月。李想以“CEO大模型”自比,按MoE架构调用技术、战略、组织三位“专家”,谈及理想自研基座大模型、VLA三阶段训练、每1万公里验证成本从18万降至4000元,以及记忆程序、能量与亲密关系等话题。

10月28日周二
10月22日周三
  1. 十字路口Crossing23

    2025 AI 现场:从 DeepSeek R1 到 Sora 2,十字路口复盘“拐点之年”

    十字路口与庄明浩复盘 2025 年 AI 行业,以“拐点”为年度关键词,梳理从年初 DeepSeek R1 到近期 Sora 2 的模型大战,以及 Manus 引爆的“Agent 元年”。节目还讨论开源生态与人才流向、DeepSeek V3.2 发布后 V4 和 R2 今年或不再出现,并将目光投向资本市场对 AI 的集体狂想。

9月30日周二
  1. 十字路口Crossing34

    京东健康王国鑫谈京医千询2.0与AI医院:垂直大模型如何解决看病难、看病贵

    京东健康探索研究院首席科学家王国鑫介绍「京医千询2.0」大模型与「AI医院」的研发应用,该模型实现三大进化:大量使用合成数据并向行业开放可模拟真实医患对话的Agent、单模型内同时支持CT/MRI/X光等影像理解、从简单推理升级为可追溯证据来源的循证推理。京东健康每天有49万次医疗服务咨询,其底气在于拥有实体医疗机构、药品供应链和30分钟送药上门能力。

6月3日周二
  1. 张小珺Jùn|商业访谈录38

    和张祥雨聊多模态研究的挣扎史与未来两年的2个“GPT-4时刻”

    阶跃星辰首席科学家张祥雨在播客中回顾多模态研究10年历程,并预判未来两年将出现2个“GPT-4时刻”。他透露训练中发现模型推理能力(尤其数学)随规模先升后降,认为这是next token prediction的本质缺陷,解决方案是引入RL。他还提出o1范式本质是Meta-CoT,下一个“GPT-4时刻”指向模型的在线学习与自主学习。

1月4日周六
  1. 42章经22

    为什么我们对 25 年 AI 极度乐观|AI 年终复盘

    42章经在年终复盘播客中判断,25 年将是 AI 爆发的一年,还没进场的人当下可能是最好的机会。复盘认为 24 年 1-9 月一级市场为过去十年最差,但 9 月后融资市场明显复苏、多模态能力持续加强、AI 创始人画像明显变化,构成乐观理由。展望 25 年,市场关键词从 23 年「大模型」、24 年「具身智能」转向「应用落地」,最看好 Prosumer、Agent 和多模态。

11月16日周六
  1. 42章经36

    我在 Character.ai 做 Post Training:前 C.AI 模型应用算法专家 Ted 谈内部实践与硅谷观察

    前 Character.ai 模型应用算法专家 Ted 在播客中复盘了 C.AI 的 Post Training 实践,称其核心是设计高效的迭代路径,主要依赖 SFT、RLHF、DPO 三大件,RAG 和 Prompt Engineering 几乎没做。他还提到 C.AI 的语音延迟基本是业界做得最好的,并观察到 ChatGPT 内部也是多模型混用、硅谷 Post-train 人才极其抢手。

5月14日周二
  1. Sam Altman Blog88

    OpenAI 发布 GPT-4o,免费向 ChatGPT 用户开放并推出语音视频模式

    OpenAI 发布 GPT-4o,Sam Altman 表示已在 ChatGPT 中免费提供这一模型,且不含广告。他称新的语音与视频模式是自己用过最好的计算机界面,达到接近人类的响应速度和表现力,并提到后续会加入可选个性化、访问用户信息以及代为执行操作等能力。

    推荐理由:OpenAI 官方说明 GPT-4o 免费开放与语音视频模式,读者可了解其能力定位与商业化取舍。