对谈清华叉院助理教授徐梦迪:具身智能、世界模型与真正的泛化
清华交叉信息研究院助理教授徐梦迪在播客中提出,机器人可通过 in-context learning(ICL)在新环境中经一两次交互当场学会新任务,且越学越快。她同时讨论了预训练天花板、真正的泛化、Scaling Law 的信号与陷阱,以及数据闭环的“鸡生蛋”难题。
清华交叉信息研究院助理教授徐梦迪在播客中提出,机器人可通过 in-context learning(ICL)在新环境中经一两次交互当场学会新任务,且越学越快。她同时讨论了预训练天花板、真正的泛化、Scaling Law 的信号与陷阱,以及数据闭环的“鸡生蛋”难题。
24 岁的深朴智能(Simple AI)首席科学家王家伟,从中科大少年班、MSRA、DeepSeek、字节 Seed 一路走到大模型前沿,毕业后转向具身智能。深朴智能从 HiFi-UMI 数据、具身基础模型、Agentic OS 做到本体,开源 2,000 小时数据、内部积累数万小时,模型已观察到一定的 Zero-shot 泛化。
在2026 Inclusion外滩大会圆桌现场,苏度科技韩铮、蚂蚁灵波沈宇军、自变量机器人王潜、破壳机器人许华哲四位嘉宾围绕具身智能的路线级分歧展开讨论,议题包括仿真与真机数据之争、GPT-6 Astra 是否会对具身行业形成降维打击,以及高成功率、泛化性与客户持续付费等商业化指标。讨论还涉及五年后哪些领域被高估或低估,以及具身智能是否会复刻语言模型的发展路径。
数美万物创始人兼CEO任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍了公司最新发布的Hi3D 3.0 2048³模型。他将创业目标从Maker OS推向制造业OS,认为基础模型不会吞噬一切,实体制造仍需能产出生产级3D资产的模型,以及拆件、连接结构、材料适配等模型之后的工程能力。
Pyromind 创始人兼 CEO Kevin Ding 在访谈中提出,AI 终局更像 Agent 蜂群而非超级基础模型一统天下,公司押注 AutoRL,把训练、奖励、反馈、部署与数据回流串成自动循环管道。
英伟达研究副总裁刘洺堉在4小时访谈中详解世界基座模型Cosmos:项目2024年立项,已迭代至Cosmos 3,直属团队不到100人,虚线汇报规模200至300人。他称英伟达不参与存量竞争,黄仁勋要求"做到Cosmos 97",并援引《孙子兵法》"备多则力寡"思考世界模型技术趋势。
Evolvent AI 联合创始人孟繁青在访谈中提出,国内模型真正的特色并非工程化的 Post-training,而是 Pre-training 阶段被资源限制倒逼出的架构创新,蒸馏只是加速手段而非国模变强的决定性因素。
清华大学人工智能学院助理教授、KAN 网络一作刘子鸣在访谈中用"太疯狂了"形容当下 neo labs 融资热潮,他于 3 月回国任教并参与创建元环智能。他指出当前资本涌入最活跃的两个方向是世界模型和 AutoResearch(AI for AI),并梳理了今年中美做 AI for AI 的创业团队与路线。
蚂蚁集团孵化的蚂蚁灵波刚发布第二代具身基础模型,首席科学家沈宇军称具身智能尚未到GPT-1时刻,最大卡点是数据没有scale up,需百万小时起步的数据量。此次发布包含Depth、Vision、VLA、Video、World、VA 2.0六个模型,他预计当具身数据与互联网数据达到相同量级、约明年中才可能迎来GPT-1时刻。
英灵殿创始人 Odin 投身 AI for Science 创业,短期内融资数千万美元,目标是打造「全模态分子世界模型」与「通用科学人工智能」,把人类科学进程压缩上百年。团队约 30 人,本科生带做 8 个靶点均产出 sub 纳摩尔级活性分子,他称 AI 是把人类从工程化问题中解放出来。
MiniMax CEO 闫俊杰在 Dev Meetup 上谈 M3 的关键突破、训练 10T 大模型的决心,以及推出 10X 专家合作项目。他称美国模型"基本上大 10 倍",10 倍意味着整整两代,而一个 10T 模型需要 200T 数据。MiniMax 开始招募经济学家、哲学家甚至核物理学家,数据观从标注转向专家知识。
Aether AI 创始人黄碧薇提出「因果世界模型」路线,认为视频生成、3D 生成、JEPA 三条被广泛称为世界模型的路线之外还有第四条。她给 VLA 打 5 分、WAM 打 6.5 分,称 WAM 只是比 VLA 好但注定到不了终点的中间态。Aether AI 近期完成 2000 万美金天使轮融资,将因果 AI 用于 Physical AI 与机器人大脑。
前Anthropic、现Google DeepMind研究科学家姚顺宇在访谈中回顾了参与Claude 3.7、4.5和Gemini 3开发的经历,并直言AI个人英雄主义时代已经过去,如今是集体主义的故事。他还谈及预训练未到头、Coding爆发、"硬蒸"与"聪明的蒸"等技术话题,以及从理论物理转行AI的心路。
张小珺访谈小米大模型团队负责人罗福莉,她认为大模型正从预训练主导的 Chat 时代转向后训练主导的 Agent 时代,Anthropic 的路径是当下共识。她提到国内团队在预训练上的代差已基本没有,接下来要在 Agent 上做好 RL 的 scaling,用卡比例可能从 3 比 5 比 1 变为 3 比 1 比 1,并让预训练的人补充到后训练以增加多样性。
00后华人女孩洪乐潼(Carina)创办的 AI for Math 公司 Axiom(公理)刚完成2亿美元A轮融资,估值16亿美金,这是她首次接受中文访谈。她探索的方向是 AI for Math,包括把数学变成 Lean。57岁美国终身教授小野肯(Ken Ono)辞职加入她的团队。
开物纪创始人陆子恒在十字路口播客中谈如何用 AI 发现并验证可量产、可商用的新材料,公司成立即获数亿元种子轮融资,由 Monolith 领投,光合创投、集富亚洲跟投,高瓴创投、IDG、蓝驰创投、BV 百度风投、L2F 光源创业者基金等老股东超额加注。他认为该领域真正的壁垒不在模型和算力,而在难以复制的事情上,并称"如果真的能挖出金子,我肯定不会先把铲子给别人用"。
未来不远机器人创始人张翼在具身智能融资热潮中反其道而行,先潜行三年不融资,将机器人送进300个上海真实家庭采集场景数据,并于本周发布新一代家庭机器人F2。F2主打带娃与轻家务两个场景,采用先租后买的模式,月租3-4千元,以50%转介绍率和30%续租率作为核心指标。张翼认为真实家庭数据飞轮是护城河,现阶段世界模型与VLA两条路并行更现实。
播客《张小珺Jùn|商业访谈录》第134期邀请光轮智能创始人兼CEO谢晨,做了一期关于数据的产业综述。节目指出大语言模型的数据正遇到撞墙难题,而机器人的数据仍处于一片荒漠,并围绕仿真数据、数据金字塔、定价与 Recipe 等话题展开讨论。
阿里云百炼技术负责人于文渊在播客对谈中透露,Claude Code、OpenClaw 等 Agent 带动 Token 按月翻倍增长,个人重度用户单日消耗 1 亿 Token 已不算门槛,且多为最高质量的 SOTA Coding Token。
剑桥量子光学博士相子恒创办 DeepOptica,构建整合地球物理、遥感卫星、地质化学等多模态数据的矿业世界模型,直接输出地下矿体的吨铜、盎司黄金概率分布与置信区间。其训练数据中合成数据占比已达 50%,团队已在蒙古、中东、巴西完成早期验证,并拿下南美最大地质咨询公司 GE21 的合作。
张小珺与广密在《全球大模型季报》第8集跨年对谈中提出,Pre-training scaling 已接近尾声,Online Learning 是继预训练和 RL 之后的第三个范式,可能才是唯一重要的真问题。
Google DeepMind 机器人团队高级研究科学家谭捷在访谈中介绍了 Gemini Robotics 1.5 的两项关键突破:把 thinking 加入 VLA 模型,以及 cross-embodiment transfer(跨具身迁移),并称 motion transfer 是独门秘诀。他认为机器人智能近年主要依赖多模态大模型,最大瓶颈是数据,未来传统物理仿真会逐步被生成式模型仿真取代。
小鹏汽车自动驾驶中心负责人刘先明在上任后首次专访中称,团队把 VLA 中的 Language 直接拆掉,输入 V-L 联合语料、直接输出 Action,认为掺入 Language 会让模型效率极低。他于 2025 年 10 月 9 日接任该职位,此前小鹏已陆续拆掉激光雷达、规控规则和端到端。访谈还谈及小鹏向物理 AI 战略转型、换帅背后的阻力,以及明年对 L4 的规划。
前智谱 AI COO 张帆离职创办元理智能,获蓝驰创投 800 万美金天使投资,以商业强化学习为企业提供能创造业务价值的数字员工。他认为 ToC 创业是与巨头的不对称战争,而 AI 让 ToB 迎来新机遇,基座模型智能已从 60 分进化到 110 分,继续提升 IQ 的价值在递减。
MIT 在读博士杨松琳在播客中解析了 Kimi Linear、MiniMax M2、Qwen3-Next 等模型的注意力机制路线分歧:Kimi 走 Linear Attention,DeepSeek 探索 Sparse Attention,MiniMax 则从 M1 的 Linear Attention 回退到 M2 的 Full Attention。
百度智能云 AI 计算首席科学家王雁鹏在播客中亲述中国互联网基础设施从大数据、云计算到 AI 时代的演进,并介绍百度已建成国内首个全自研的 3 万卡集群。他谈到中美算力差距为 3 万卡对 10 万卡,电力是万卡集群的巨大瓶颈,一个 3 万卡集群需园区级变电站。他认为中国版英伟达的唯一路径是与最先进模型深度绑定。
京东健康探索研究院首席科学家王国鑫介绍「京医千询2.0」大模型与「AI医院」的研发应用,该模型实现三大进化:大量使用合成数据并向行业开放可模拟真实医患对话的Agent、单模型内同时支持CT/MRI/X光等影像理解、从简单推理升级为可追溯证据来源的循证推理。京东健康每天有49万次医疗服务咨询,其底气在于拥有实体医疗机构、药品供应链和30分钟送药上门能力。
VAST 创始人兼 CEO 宋亚宸在播客中表示,大语言模型已"撞墙"、进化放缓,而 3D 大模型才刚起步,仍是一片蓝海。VAST 最新 3D 生成大模型为 Tripo 3.0,公司同时研发大模型并下场做应用 Tripo Studio,认为纯应用层公司在模型每 3-5 个月迭代一次时几乎难以生存。
极峰科技创始人王筱圃研发时序大模型 Geegobyte-g1 及工业智能体平台「河谷」,其数字工人在垃圾焚烧电厂替代了原先 4 班 3 倒的 4 位师傅,实现无人值守,每年为客户带来 400 到 500 万人民币增量收益。该 Agent 采用「劳务派遣」式按月付费模式,费用远低于被替代的人力成本。
Mercor 首位中国工程师虞快在访谈中回顾了公司从 AI 招聘平台转型为数据标注公司、11 个月内实现年收入 1 亿美金、估值攀升至 20 亿美金的历程。他拆解了 Mercor 获客、AI Interview、匹配验证的业务流程与 ToB 商业模式,并谈到其与 Scale AI、Surge 竞争的核心竞争力。节目后半段还聊到创业公司选人标准、如何判断一个人是否聪明等职场话题。
月之暗面创始人兼CEO杨植麟在播客中复盘了7月发布的Kimi K2:一个基于MoE架构的开源编程与Agentic大语言模型,重点在token efficiency与Agentic泛化能力,并采用Muon优化器。他谈到Kimi从闭源转向开源,认为基于FLOPs的scaling仍是更有效路径,多模态不应损伤"脑子"。
蚂蚁集团副总裁、首席技术安全官、蚂蚁密算董事长韦韬在「隐语」开源社区三周年对话中提出,密态计算让数据"可用不可见",高阶程序通过任务拆解与自动核验构建可靠保障框架,二者或成 AI 走向工业化的关键。他同时分享了隐语社区三年来的进展,包括非洲手机巨头的加入。
阶跃星辰联合创始人朱亦博在播客中系统讲述 AI Infra 的定义、衡量指标与投入 ROI,并称 DeepSeek 能冲出来的一大原因是选对了优化目标。他提到阶跃近期开源了推理效率更高的基模 Step 3,团队同时正在招人。
光轮智能创始人兼 CEO 谢晨在访谈中讨论具身智能的仿真与合成数据实操,指出行业仍处 GPT-1 阶段、尚未找到 scaling law 配方,真实数据在训练中占比极低。他拆解了 Sim2Real 的 gap、合成数据与真实数据的配比,以及智能驾驶与具身智能在物理交互上的差异,并辣评 Meta 300 亿美金收购 Scale AI 与 Alexandr Wang。
北京大学助理教授、银河通用创始人兼CTO王鹤在播客中梳理了具身智能从计算机视觉流派萌芽到成为资本宠儿的学术边缘史。他指出真实数据在训练数据中仅占1%,合成数据管线挑起大梁,并称具身智能是"生产力即产品"。他批评行业内摇操冒充自主的乱象,呼吁真实展示,并警告5年内若做不到万台以上应用,这个领域就被证伪了。
阶跃星辰首席科学家张祥雨在播客中回顾多模态研究10年历程,并预判未来两年将出现2个“GPT-4时刻”。他透露训练中发现模型推理能力(尤其数学)随规模先升后降,认为这是next token prediction的本质缺陷,解决方案是引入RL。他还提出o1范式本质是Meta-CoT,下一个“GPT-4时刻”指向模型的在线学习与自主学习。
能量奇点创始人杨钊在访谈中回顾了公司2024年建成全球首台全高温超导托卡马克"洪荒70"的历程,并介绍了后续"洪荒170"、"洪荒380"的"三步走"规划。他测算,高温超导可将装置体积与建造成本各缩小约两个数量级,而当前全球聚变装置的Q值刚过1,行业正追求Q>10。
清华大学交叉信息研究院助理教授、前 OpenAI 研究员吴翼在播客对谈中系统讲解了强化学习(RL)原理、RL 与 LLM 的结合路径及行业非共识。他提出 Intelligence = LLM(理解)× RL(决策),并指出 RL 三大分支为泛化(DeepSeek)、代码(Anthropic)、Agent(OpenAI)。
理想汽车自动驾驶研发副总裁郎咸朋回顾自动驾驶10年演进:2018年行业从高精地图+激光雷达转向BEV+Transformer,特斯拉是标杆;早期激光雷达50-60万/台,百度一辆测试车成本达500万人民币。他提出"L3不是L2的延长,而是L4的先导",并称端到端+VLM+世界模型是强化学习架构。
前 Meta 应用强化学习组负责人、Pokee AI 创始人兼 CEO 朱哲清提出一种"RL 做核心、LLM 做翻译"的 Agent 架构,认为直接用 LLM 做不出规划型 Agent。其团队已在电商领域做出通用型 Agent,通过 self-play 让 Agent 学会调用上千个底层 API,体验相当于一名资深网站负责人,且训练与推理成本都很低。