对谈清华叉院助理教授徐梦迪:具身智能、世界模型与真正的泛化
清华交叉信息研究院助理教授徐梦迪在播客中提出,机器人可通过 in-context learning(ICL)在新环境中经一两次交互当场学会新任务,且越学越快。她同时讨论了预训练天花板、真正的泛化、Scaling Law 的信号与陷阱,以及数据闭环的“鸡生蛋”难题。
清华交叉信息研究院助理教授徐梦迪在播客中提出,机器人可通过 in-context learning(ICL)在新环境中经一两次交互当场学会新任务,且越学越快。她同时讨论了预训练天花板、真正的泛化、Scaling Law 的信号与陷阱,以及数据闭环的“鸡生蛋”难题。
24 岁的深朴智能(Simple AI)首席科学家王家伟,从中科大少年班、MSRA、DeepSeek、字节 Seed 一路走到大模型前沿,毕业后转向具身智能。深朴智能从 HiFi-UMI 数据、具身基础模型、Agentic OS 做到本体,开源 2,000 小时数据、内部积累数万小时,模型已观察到一定的 Zero-shot 泛化。
在2026 Inclusion外滩大会圆桌现场,苏度科技韩铮、蚂蚁灵波沈宇军、自变量机器人王潜、破壳机器人许华哲四位嘉宾围绕具身智能的路线级分歧展开讨论,议题包括仿真与真机数据之争、GPT-6 Astra 是否会对具身行业形成降维打击,以及高成功率、泛化性与客户持续付费等商业化指标。讨论还涉及五年后哪些领域被高估或低估,以及具身智能是否会复刻语言模型的发展路径。
数美万物创始人兼CEO任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍了公司最新发布的Hi3D 3.0 2048³模型。他将创业目标从Maker OS推向制造业OS,认为基础模型不会吞噬一切,实体制造仍需能产出生产级3D资产的模型,以及拆件、连接结构、材料适配等模型之后的工程能力。
Pyromind 创始人兼 CEO Kevin Ding 在访谈中提出,AI 终局更像 Agent 蜂群而非超级基础模型一统天下,公司押注 AutoRL,把训练、奖励、反馈、部署与数据回流串成自动循环管道。
Mind Lab 研究员逯雨鑫以个人开发者身份、数百美元成本后训练的两个小模型两次登顶 Hugging Face Model Trending 榜首,他此前没有 AI Lab 经历,也不是 AI PhD,整个过程只用了 2 周。
Meta 最新 AI 优化数据中心大多采用闭环液冷,冷却液(水与乙二醇混合)在密封回路中循环,经热交换器散热后回流服务器机架,预计可连续使用长达十年无需更换。Meta 称典型采用干冷器的闭环液冷 AI 数据中心年用水量低于几家全服务餐厅,且相比风冷可在同一机架内容纳更多 GPU。
Kimi K3 是有效扩展到 2.8T 总参数并全量开源的 MoE 模型,清华博士候选人孙宇涛领读其技术报告,串联讲解十余篇相关论文。报告覆盖线性注意力、Gated MLA、Attention Residuals、Stable LatentMoE 与 Muon 等架构创新,以及预训练、多教师 On-Policy 蒸馏和 KDA Kernel 等基础设施。
字节跳动视频生成模型 Seedance 2.5 支持最长 30 秒、原生 1080p 与原生音频,单次生成最多可输入 50 个多模态参考,并支持区域编辑。该指南给出其提示词结构写法,并按剧情、动作、商业、恐怖等 10 类场景提供经多次生成测试的完整提示词库。
英伟达研究副总裁刘洺堉在4小时访谈中详解世界基座模型Cosmos:项目2024年立项,已迭代至Cosmos 3,直属团队不到100人,虚线汇报规模200至300人。他称英伟达不参与存量竞争,黄仁勋要求"做到Cosmos 97",并援引《孙子兵法》"备多则力寡"思考世界模型技术趋势。
Evolvent AI 联合创始人孟繁青在访谈中提出,国内模型真正的特色并非工程化的 Post-training,而是 Pre-training 阶段被资源限制倒逼出的架构创新,蒸馏只是加速手段而非国模变强的决定性因素。
清华大学人工智能学院助理教授、KAN 网络一作刘子鸣在访谈中用"太疯狂了"形容当下 neo labs 融资热潮,他于 3 月回国任教并参与创建元环智能。他指出当前资本涌入最活跃的两个方向是世界模型和 AutoResearch(AI for AI),并梳理了今年中美做 AI for AI 的创业团队与路线。
Google AI Futures Fund 与日本电信运营商 KDDI 合作启动 AI Startup Support Program,面向日本 AI 原生创业公司提供双方基金的投资。
Manus 上线 Supabase 连接器,用户可用自然语言查询和操作 Supabase 项目中的数据,并借助 Supabase MCP 将其作为后端构建新应用。
蚂蚁集团孵化的蚂蚁灵波刚发布第二代具身基础模型,首席科学家沈宇军称具身智能尚未到GPT-1时刻,最大卡点是数据没有scale up,需百万小时起步的数据量。此次发布包含Depth、Vision、VLA、Video、World、VA 2.0六个模型,他预计当具身数据与互联网数据达到相同量级、约明年中才可能迎来GPT-1时刻。
英灵殿创始人 Odin 投身 AI for Science 创业,短期内融资数千万美元,目标是打造「全模态分子世界模型」与「通用科学人工智能」,把人类科学进程压缩上百年。团队约 30 人,本科生带做 8 个靶点均产出 sub 纳摩尔级活性分子,他称 AI 是把人类从工程化问题中解放出来。
MiniMax CEO 闫俊杰在 Dev Meetup 上谈 M3 的关键突破、训练 10T 大模型的决心,以及推出 10X 专家合作项目。他称美国模型"基本上大 10 倍",10 倍意味着整整两代,而一个 10T 模型需要 200T 数据。MiniMax 开始招募经济学家、哲学家甚至核物理学家,数据观从标注转向专家知识。
Aether AI 创始人黄碧薇提出「因果世界模型」路线,认为视频生成、3D 生成、JEPA 三条被广泛称为世界模型的路线之外还有第四条。她给 VLA 打 5 分、WAM 打 6.5 分,称 WAM 只是比 VLA 好但注定到不了终点的中间态。Aether AI 近期完成 2000 万美金天使轮融资,将因果 AI 用于 Physical AI 与机器人大脑。
前Anthropic、现Google DeepMind研究科学家姚顺宇在访谈中回顾了参与Claude 3.7、4.5和Gemini 3开发的经历,并直言AI个人英雄主义时代已经过去,如今是集体主义的故事。他还谈及预训练未到头、Coding爆发、"硬蒸"与"聪明的蒸"等技术话题,以及从理论物理转行AI的心路。
张小珺访谈小米大模型团队负责人罗福莉,她认为大模型正从预训练主导的 Chat 时代转向后训练主导的 Agent 时代,Anthropic 的路径是当下共识。她提到国内团队在预训练上的代差已基本没有,接下来要在 Agent 上做好 RL 的 scaling,用卡比例可能从 3 比 5 比 1 变为 3 比 1 比 1,并让预训练的人补充到后训练以增加多样性。
00后华人女孩洪乐潼(Carina)创办的 AI for Math 公司 Axiom(公理)刚完成2亿美元A轮融资,估值16亿美金,这是她首次接受中文访谈。她探索的方向是 AI for Math,包括把数学变成 Lean。57岁美国终身教授小野肯(Ken Ono)辞职加入她的团队。
开物纪创始人陆子恒在十字路口播客中谈如何用 AI 发现并验证可量产、可商用的新材料,公司成立即获数亿元种子轮融资,由 Monolith 领投,光合创投、集富亚洲跟投,高瓴创投、IDG、蓝驰创投、BV 百度风投、L2F 光源创业者基金等老股东超额加注。他认为该领域真正的壁垒不在模型和算力,而在难以复制的事情上,并称"如果真的能挖出金子,我肯定不会先把铲子给别人用"。
未来不远机器人创始人张翼在具身智能融资热潮中反其道而行,先潜行三年不融资,将机器人送进300个上海真实家庭采集场景数据,并于本周发布新一代家庭机器人F2。F2主打带娃与轻家务两个场景,采用先租后买的模式,月租3-4千元,以50%转介绍率和30%续租率作为核心指标。张翼认为真实家庭数据飞轮是护城河,现阶段世界模型与VLA两条路并行更现实。
播客《张小珺Jùn|商业访谈录》第134期邀请光轮智能创始人兼CEO谢晨,做了一期关于数据的产业综述。节目指出大语言模型的数据正遇到撞墙难题,而机器人的数据仍处于一片荒漠,并围绕仿真数据、数据金字塔、定价与 Recipe 等话题展开讨论。
阿里云百炼技术负责人于文渊在播客对谈中透露,Claude Code、OpenClaw 等 Agent 带动 Token 按月翻倍增长,个人重度用户单日消耗 1 亿 Token 已不算门槛,且多为最高质量的 SOTA Coding Token。
剑桥量子光学博士相子恒创办 DeepOptica,构建整合地球物理、遥感卫星、地质化学等多模态数据的矿业世界模型,直接输出地下矿体的吨铜、盎司黄金概率分布与置信区间。其训练数据中合成数据占比已达 50%,团队已在蒙古、中东、巴西完成早期验证,并拿下南美最大地质咨询公司 GE21 的合作。
张小珺与广密在《全球大模型季报》第8集跨年对谈中提出,Pre-training scaling 已接近尾声,Online Learning 是继预训练和 RL 之后的第三个范式,可能才是唯一重要的真问题。
Google DeepMind 机器人团队高级研究科学家谭捷在访谈中介绍了 Gemini Robotics 1.5 的两项关键突破:把 thinking 加入 VLA 模型,以及 cross-embodiment transfer(跨具身迁移),并称 motion transfer 是独门秘诀。他认为机器人智能近年主要依赖多模态大模型,最大瓶颈是数据,未来传统物理仿真会逐步被生成式模型仿真取代。
小鹏汽车自动驾驶中心负责人刘先明在上任后首次专访中称,团队把 VLA 中的 Language 直接拆掉,输入 V-L 联合语料、直接输出 Action,认为掺入 Language 会让模型效率极低。他于 2025 年 10 月 9 日接任该职位,此前小鹏已陆续拆掉激光雷达、规控规则和端到端。访谈还谈及小鹏向物理 AI 战略转型、换帅背后的阻力,以及明年对 L4 的规划。
前智谱 AI COO 张帆离职创办元理智能,获蓝驰创投 800 万美金天使投资,以商业强化学习为企业提供能创造业务价值的数字员工。他认为 ToC 创业是与巨头的不对称战争,而 AI 让 ToB 迎来新机遇,基座模型智能已从 60 分进化到 110 分,继续提升 IQ 的价值在递减。
MIT 在读博士杨松琳在播客中解析了 Kimi Linear、MiniMax M2、Qwen3-Next 等模型的注意力机制路线分歧:Kimi 走 Linear Attention,DeepSeek 探索 Sparse Attention,MiniMax 则从 M1 的 Linear Attention 回退到 M2 的 Full Attention。
百度智能云 AI 计算首席科学家王雁鹏在播客中亲述中国互联网基础设施从大数据、云计算到 AI 时代的演进,并介绍百度已建成国内首个全自研的 3 万卡集群。他谈到中美算力差距为 3 万卡对 10 万卡,电力是万卡集群的巨大瓶颈,一个 3 万卡集群需园区级变电站。他认为中国版英伟达的唯一路径是与最先进模型深度绑定。
美团光年之外产品负责人谢青池用一年多啃完200多篇AI论文后,从中精选36篇经典,以4小时讲解开源自己的论文探索之旅。
京东健康探索研究院首席科学家王国鑫介绍「京医千询2.0」大模型与「AI医院」的研发应用,该模型实现三大进化:大量使用合成数据并向行业开放可模拟真实医患对话的Agent、单模型内同时支持CT/MRI/X光等影像理解、从简单推理升级为可追溯证据来源的循证推理。京东健康每天有49万次医疗服务咨询,其底气在于拥有实体医疗机构、药品供应链和30分钟送药上门能力。
VAST 创始人兼 CEO 宋亚宸在播客中表示,大语言模型已"撞墙"、进化放缓,而 3D 大模型才刚起步,仍是一片蓝海。VAST 最新 3D 生成大模型为 Tripo 3.0,公司同时研发大模型并下场做应用 Tripo Studio,认为纯应用层公司在模型每 3-5 个月迭代一次时几乎难以生存。
极峰科技创始人王筱圃研发时序大模型 Geegobyte-g1 及工业智能体平台「河谷」,其数字工人在垃圾焚烧电厂替代了原先 4 班 3 倒的 4 位师傅,实现无人值守,每年为客户带来 400 到 500 万人民币增量收益。该 Agent 采用「劳务派遣」式按月付费模式,费用远低于被替代的人力成本。
Mercor 首位中国工程师虞快在访谈中回顾了公司从 AI 招聘平台转型为数据标注公司、11 个月内实现年收入 1 亿美金、估值攀升至 20 亿美金的历程。他拆解了 Mercor 获客、AI Interview、匹配验证的业务流程与 ToB 商业模式,并谈到其与 Scale AI、Surge 竞争的核心竞争力。节目后半段还聊到创业公司选人标准、如何判断一个人是否聪明等职场话题。
月之暗面创始人兼CEO杨植麟在播客中复盘了7月发布的Kimi K2:一个基于MoE架构的开源编程与Agentic大语言模型,重点在token efficiency与Agentic泛化能力,并采用Muon优化器。他谈到Kimi从闭源转向开源,认为基于FLOPs的scaling仍是更有效路径,多模态不应损伤"脑子"。
蚂蚁集团副总裁、首席技术安全官、蚂蚁密算董事长韦韬在「隐语」开源社区三周年对话中提出,密态计算让数据"可用不可见",高阶程序通过任务拆解与自动核验构建可靠保障框架,二者或成 AI 走向工业化的关键。他同时分享了隐语社区三年来的进展,包括非洲手机巨头的加入。
阶跃星辰联合创始人朱亦博在播客中系统讲述 AI Infra 的定义、衡量指标与投入 ROI,并称 DeepSeek 能冲出来的一大原因是选对了优化目标。他提到阶跃近期开源了推理效率更高的基模 Step 3,团队同时正在招人。