跳到正文
10月5日 · 周一

最新精选

10月1日周四
  1. Google Gemini 博客84

    Google 发布 Gemini 4 Argon 前沿模型

    Google 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:Google 官方披露 Gemini 4 Argon 的基准成绩、内部落地案例与分阶段开放路径,可据此判断前沿模型在编码与安全场景的进展。

9月29日周二
  1. OpenAI News80

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景。其标准 API 输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 发布 GPT-6.1 Sol,价格降至 Astra 标准 API 的五分之一,读者可据此判断成本与能力取舍。

  2. Simon Willison76

    Simon Willison 指出,Sonnet 5.5 已成为 claude.ai 免费层所用模型,因此引用推文中展示的那些早期实验效果免费用户也能实现。他同时提到 ChatGPT 免费层目前仍是 GPT-5.6 Luna,能力弱不少。

    引用Claude@claudeai

    A thread of early experiments with Claude Sonnet 5.5. A fall foliage simulator by @_re_pete, made with Sonnet 5 vs Sonnet 5.5.

    推荐理由:从免费层可用性切入,说明 Sonnet 5.5 让普通用户也能做出此前需付费的效果,并与 ChatGPT 免费层模型形成对照。

  3. Boris Cherny66

    Anthropic 发布 Claude 5.5 家族的第二款模型 Claude Sonnet 5.5,相比 Sonnet 5 运行速度提升超过 30%,多数任务成本最多降低 30%。Boris Cherny 展示了 Sonnet 5.5 用 Claude Code 修复 bug 的过程,并称其速度提升 30%、用量消耗减少 30%。

    引用Claude@claudeai

    Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.

    推荐理由:Claude Sonnet 5.5 在速度与成本上的变化,以及它在 Claude Code 中修 bug 的实际表现,可供判断日常编码场景的取舍。

  4. Google Gemini 博客62

    Google 展示开发者用 Gemini 3.8 Flash 做的四个项目

    Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。

    推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。

9月24日周四
  1. Google Gemini 博客71

    Google 发布 Gemini 3.8 Live with Live Avatar

    Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。

9月23日周三
  1. Google Gemini 博客72

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。

9月16日周三
  1. Google Gemini 博客82

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。

    推荐理由:Google 发布两款实时语音对话模型,给出语音智能体基准成绩与开发者接入渠道,可据此判断语音 Agent 的可用性。

9月9日周三
  1. OpenAI News78

    OpenAI 发布 GPT-6 Astra,面向企业场景强化推理与电脑操作

    OpenAI 发布 GPT-6 Astra,称其是面向企业场景能力最强的模型,具备更强的推理、电脑操作以及写作与设计判断能力。

    推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力定位,可据此了解其推理与电脑操作方向。

9月5日周六
  1. Tech Brew Ride Home78

    OpenAI 发布 GPT-6 Astra,称迈入 AGI 时代

    OpenAI 发布 GPT-6 Astra,初期面向 Daybreak 计划客户开放,Greg Brockman 称其为代际跃升并宣称已进入 AGI 时代。Latent Space 在 20B+ token 测试中称 Astra 比 Sol 和 Fable 更省 token,能自主训练模型、标注数据和调试系统。

    推荐理由:汇总了 Astra 发布、智能体越权事件与本地模型方案等多条动态,可快速了解本周 AI 领域的关键进展。

  2. Google Gemini 博客60

    Google 在 Gemini 中上线 Lyria 3.5 音乐生成模型

    Google 在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,官方称其音质表现最好,人声更具表现力、编曲更丰富。Gemini 应用内支持选择或描述曲风、在带人声与纯器乐之间切换,并提供从背景音乐到生日定制曲的模板,还可选择短曲或长曲。

    推荐理由:Lyria 3.5 在音质、人声表现和编曲丰富度上的升级,以及它在 Gemini 应用与 API 中的开放范围,可供读者判断音乐生成能力当前所处的位置。

9月2日周三
  1. Google Gemini 博客85

    Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的定价、基准表现和开放入口,可据此判断长程编码与安全场景的选型。

  2. Meta AI Research · Muse74

    Meta 发布 Muse Spark 1.3,改进智能体与编码任务表现

    Meta 发布 Muse Spark 1.3,在智能体与编码任务上性能提升,max reasoning 版本已在 Muse Code 和 Meta Model API 上线。

    推荐理由:官方给出智能体与编码任务的改进细节和工具调用、token 消耗降幅,可据此判断长任务工作流的变化。

9月1日周二
  1. Meta AI Research · Muse74

    Meta 发布 Muse Voice Transcribe 实时语音感知模型

    Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。

    推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。

8月28日周五
  1. Google Gemini 博客76

    Google 发布 Gemini Omni 1.1 Flash,强化生成视频控制能力

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。

    推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。

8月27日周四
  1. Google Gemini 博客62

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转文字模型,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。

    推荐理由:官方给出流式与非流式两档 WER 数字和相对 Chirp 3 的延迟提升,便于判断语音转写在实际管线中的可用性。

8月20日周四
  1. Meta AI Research · Muse66

    Meta 发布 Muse Spark 1.2 多模态评测结果

    Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。

    推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。

8月17日周一
  1. Higgsfield Blog62

    MiniMax Hailuo 3.0 上线 Higgsfield:支持 2K、15 秒与原生立体声

    MiniMax Hailuo 3.0 已在 Higgsfield 上线,相比 Hailuo 2.3 分辨率从 1080p 提升到 2K,单次生成时长从 10 秒延长到 15 秒,并首次在同一生成过程中输出原生立体声,包含对白、音效与环境音。

    推荐理由:原文给出 Hailuo 3.0 与 2.3 的分辨率、时长、音频和输入数量对比,可据此判断多参考合成视频的可用边界。