逐段讲解 Kimi K2、ChatGPT Agent、Qwen3-Coder 技术报告:Agent 的技术路线与系统工程
俄亥俄州立大学在读博士郑博元逐段解读 Kimi K2、ChatGPT Agent、Qwen3-Coder 三份技术报告及 Manus 技术博文,对比其 Agent 技术路线。内容涵盖 Agent 的感知与行动定义、Coding/Search/Tool-Use/Computer Use 四类划分,以及合成数据、强化学习、安全三大训练环节。
俄亥俄州立大学在读博士郑博元逐段解读 Kimi K2、ChatGPT Agent、Qwen3-Coder 三份技术报告及 Manus 技术博文,对比其 Agent 技术路线。内容涵盖 Agent 的感知与行动定义、Coding/Search/Tool-Use/Computer Use 四类划分,以及合成数据、强化学习、安全三大训练环节。
光轮智能创始人兼 CEO 谢晨在访谈中讨论具身智能的仿真与合成数据实操,指出行业仍处 GPT-1 阶段、尚未找到 scaling law 配方,真实数据在训练中占比极低。他拆解了 Sim2Real 的 gap、合成数据与真实数据的配比,以及智能驾驶与具身智能在物理交互上的差异,并辣评 Meta 300 亿美金收购 Scale AI 与 Alexandr Wang。
北京大学助理教授、银河通用创始人兼CTO王鹤在播客中梳理了具身智能从计算机视觉流派萌芽到成为资本宠儿的学术边缘史。他指出真实数据在训练数据中仅占1%,合成数据管线挑起大梁,并称具身智能是"生产力即产品"。他批评行业内摇操冒充自主的乱象,呼吁真实展示,并警告5年内若做不到万台以上应用,这个领域就被证伪了。
阶跃星辰首席科学家张祥雨在播客中回顾多模态研究10年历程,并预判未来两年将出现2个“GPT-4时刻”。他透露训练中发现模型推理能力(尤其数学)随规模先升后降,认为这是next token prediction的本质缺陷,解决方案是引入RL。他还提出o1范式本质是Meta-CoT,下一个“GPT-4时刻”指向模型的在线学习与自主学习。
能量奇点创始人杨钊在访谈中回顾了公司2024年建成全球首台全高温超导托卡马克"洪荒70"的历程,并介绍了后续"洪荒170"、"洪荒380"的"三步走"规划。他测算,高温超导可将装置体积与建造成本各缩小约两个数量级,而当前全球聚变装置的Q值刚过1,行业正追求Q>10。
清华大学交叉信息研究院助理教授、前 OpenAI 研究员吴翼在播客对谈中系统讲解了强化学习(RL)原理、RL 与 LLM 的结合路径及行业非共识。他提出 Intelligence = LLM(理解)× RL(决策),并指出 RL 三大分支为泛化(DeepSeek)、代码(Anthropic)、Agent(OpenAI)。
理想汽车自动驾驶研发副总裁郎咸朋回顾自动驾驶10年演进:2018年行业从高精地图+激光雷达转向BEV+Transformer,特斯拉是标杆;早期激光雷达50-60万/台,百度一辆测试车成本达500万人民币。他提出"L3不是L2的延长,而是L4的先导",并称端到端+VLM+世界模型是强化学习架构。
播客邀请 MIT 计算机科学与人工智能实验室在读博士松琳,逐篇解读 DeepSeek、Kimi 同天发布的两篇注意力机制论文及 MiniMax 春节前的相关论文。
前 Meta 应用强化学习组负责人、Pokee AI 创始人兼 CEO 朱哲清提出一种"RL 做核心、LLM 做翻译"的 Agent 架构,认为直接用 LLM 做不出规划型 Agent。其团队已在电商领域做出通用型 Agent,通过 self-play 让 Agent 学会调用上千个底层 API,体验相当于一名资深网站负责人,且训练与推理成本都很低。
前 Character.ai 模型应用算法专家 Ted 在播客中复盘了 C.AI 的 Post Training 实践,称其核心是设计高效的迭代路径,主要依赖 SFT、RLHF、DPO 三大件,RAG 和 Prompt Engineering 几乎没做。他还提到 C.AI 的语音延迟基本是业界做得最好的,并观察到 ChatGPT 内部也是多模型混用、硅谷 Post-train 人才极其抢手。
EVE 创始人 Tristan 在播客中表示 Character.ai 类产品根本不算真正的陪伴,并介绍了 EVE 的实现方式:用 128 个记忆槽位区分被动记忆与主动记忆,以十几个模型搭建工程管线解决长期记忆问题。他将 AI 陪伴的核心要素归纳为超级对齐、真实时空感知、独立人格与荷尔蒙钩子,并称《奇点时代》一年流水 2 亿。