OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平。OpenAI 表示,这是目前同等性能下最具成本效率的模型。
推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定位与价格比例,读者可据此判断它在现有模型中的性价比位置。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平。OpenAI 表示,这是目前同等性能下最具成本效率的模型。
推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定位与价格比例,读者可据此判断它在现有模型中的性价比位置。
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。
推荐理由:Google 发布两款实时语音对话模型,给出语音智能体基准成绩与开发者接入渠道,可据此判断语音 Agent 的可用性。
Meta 发布 Muse Spark 1.3,在智能体与编码任务上性能提升,max reasoning 版本已在 Muse Code 和 Meta Model API 上线。
推荐理由:官方给出智能体与编码任务的改进细节和工具调用、token 消耗降幅,可据此判断长任务工作流的变化。
Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。
推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。
Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。
推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。
Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。
推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。
Meta Superintelligence Labs 发布 Muse Glimmer,一个 30B 参数的开源智能体模型,权重以 Apache 2.0 许可在 Hugging Face 开放下载。
推荐理由:Meta 开源 30B 端侧智能体模型,量化后可在单张消费级 GPU 上运行,读者可据此判断本地智能体的可行边界。
Meta 发布终端编码智能体 Muse Code(beta),由新模型 Muse Spark 1.2 驱动,可在 macOS 或 Linux 安装,面向大型代码仓库的规划、写码与结果验证,并能协调多个常驻子智能体。
推荐理由:官方披露了 Muse Spark 1.2 的编码训练重点与 Muse Code 的运行时设计,可据此判断终端编码智能体的工程取舍。
推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。
Ideogram 发布 9.3B 参数开源权重文生图模型 Ideogram 4.0,采用 34 层单流 DiT,文本编码器为 Qwen3-VL-8B-Instruct,并拼接其 13 个中间层隐状态。
推荐理由:官方披露 9.3B 开源文生图模型的架构与结构化 JSON 提示词方案,可据此判断开源图像模型的设计取舍。