跳到正文
9月30日 · 周三

最新精选

今天9月30日周三
9月29日周二
  1. Google Gemini 博客62

    Google 展示开发者用 Gemini 3.8 Flash 做的四个项目

    Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。

    推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。

9月24日周四
  1. Google Gemini 博客71

    Google 发布 Gemini 3.8 Live with Live Avatar

    Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。

9月23日周三
  1. Google Gemini 博客72

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。

9月16日周三
  1. Google Gemini 博客82

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。

    推荐理由:Google 发布两款实时语音对话模型,给出语音智能体基准成绩与开发者接入渠道,可据此判断语音 Agent 的可用性。

9月2日周三
  1. Meta AI Research · Muse74

    Meta 发布 Muse Spark 1.3,改进智能体与编码任务表现

    Meta 发布 Muse Spark 1.3,在智能体与编码任务上性能提升,max reasoning 版本已在 Muse Code 和 Meta Model API 上线。

    推荐理由:官方给出智能体与编码任务的改进细节和工具调用、token 消耗降幅,可据此判断长任务工作流的变化。

9月1日周二
  1. Meta AI Research · Muse74

    Meta 发布 Muse Voice Transcribe 实时语音感知模型

    Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。

    推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。

8月20日周四
  1. Meta AI Research · Muse66

    Meta 发布 Muse Spark 1.2 多模态评测结果

    Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。

    推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。

8月10日周一
  1. Meta AI Research · Muse80

    Meta 发布开源智能体模型 Muse Glimmer,30B 参数可在本地设备运行

    Meta Superintelligence Labs 发布 Muse Glimmer,一个 30B 参数的开源智能体模型,权重以 Apache 2.0 许可在 Hugging Face 开放下载。

    推荐理由:Meta 开源 30B 端侧智能体模型,量化后可在单张消费级 GPU 上运行,读者可据此判断本地智能体的可行边界。

6月3日周三
  1. Ideogram Blog71

    Ideogram 4.0 技术细节:9.3B 开源文生图模型发布

    Ideogram 发布 9.3B 参数开源权重文生图模型 Ideogram 4.0,采用 34 层单流 DiT,文本编码器为 Qwen3-VL-8B-Instruct,并拼接其 13 个中间层隐状态。

    推荐理由:官方披露 9.3B 开源文生图模型的架构与结构化 JSON 提示词方案,可据此判断开源图像模型的设计取舍。

已经到底了