跳到正文

全部动态

今日 0 条
9月11日周五
  1. Google Gemini 博客60

    Google 为 Windows 推出 Gemini 桌面应用

    Google 发布 Windows 版 Gemini 桌面应用,Windows 10 和 11 用户可在 gemini.google/desktop 下载,全球同步上线。

    推荐理由:官方给出 Windows 端 Gemini 的快捷键入口、智能体与图像视频生成能力,可据此判断桌面工作流的变化。

9月10日周四
  1. Google Gemini 博客24

    Gemini 处理行政事务的 4 种方式

    Google 博客介绍 Gemini 处理行政事务的 4 种用法:填写表格与缴费、参与公民事务、查找政府机构与法规、申请社会服务。Google 的 AI & Economy ATLAS v1.0 研究显示,约 40% 用 Gemini 处理公民事务的人咨询此类问题,26% 用于了解政府事务,超 16% 用于查找机构,超 15% 用于社会服务,近半数对话发生在非标准工作时间。

9月9日周三
  1. Higgsfield Blog40

    Higgsfield 上线 GPT Image 2.5:Flare 与 Sunburst 双版本解析

    OpenAI 最新图像模型 GPT Image 2.5 已在 Higgsfield 上线,分为 Flare 和 Sunburst 两个版本。Flare 面向日常高频生成,输出质量高于 GPT Image 2 且延迟降低约 50%;Sunburst 主打精确编辑,适合成品级广告与产品图。两版本均支持最多 16 张参考图、1K/2K/4K 分辨率,定价一致,4K Max 档约 $1.325/张。

  2. Meta Newsroom · AI84

    Meta 推出个人 AI 智能体 Muse,运行在 Muse Secure VM 上

    Meta 推出个人 AI 智能体 Muse,由 Muse Spark 模型驱动,运行在专用虚拟机 Muse Secure VM 上,智能体与用户数据同机存放,另有 Sentinel 智能体在系统层面隔离并审核其联网行为。

    推荐理由:Meta 把个人智能体放进独立安全虚拟机,并给出支付与权限控制方案,可观察大厂如何设计智能体的隐私边界。

9月8日周二
  1. Meta AI Research · Muse71

    Meta 详解 Muse 智能体的安全架构与防护设计

    Meta 发布博客,详解其个人智能体 Muse 的安全、隐私与防护设计,包括运行在隔离 VM 中的运行时单元、独立于智能体的 Sentinel 权限控制,以及针对提示注入的模型训练、分类器与人工审批多层防御。

    推荐理由:Meta 公开了 Muse 智能体的安全架构细节,包括 Sentinel 权限控制与提示注入防御的分层设计。

  2. Higgsfield Blog62

    Higgsfield 在 GPT-6 Astra 上推出 Games 2.0 与 MCP 体验

    Higgsfield 宣布 GPT-6 Astra 已接入其工作流,包括 Games 2.0 和 MCP 连接体验,可由一句提示词构建并部署完整多人游戏。在 Higgsfield MCP 流程中,GPT-6 Astra 负责编码、逻辑、推理与多步编排,Higgsfield 负责创意素材与游戏生成部署,用户可在界面直接设定游戏类型、风格、场景和多人开关。

    推荐理由:原文给出 GPT-6 Astra 在 Higgsfield 工作流中的分工与 Games 2.0 的完整操作路径,可据此判断一句话生成可玩游戏的落地方式。

9月5日周六
  1. Google Gemini 博客60

    Google 在 Gemini 中上线 Lyria 3.5 音乐生成模型

    Google 在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,官方称其音质表现最好,人声更具表现力、编曲更丰富。Gemini 应用内支持选择或描述曲风、在带人声与纯器乐之间切换,并提供从背景音乐到生日定制曲的模板,还可选择短曲或长曲。

    推荐理由:Lyria 3.5 在音质、人声表现和编曲丰富度上的升级,以及它在 Gemini 应用与 API 中的开放范围,可供读者判断音乐生成能力当前所处的位置。

9月4日周五
  1. Ideogram12

    感谢部长 @EvanLSolomon 拨冗出席并带来振奋人心的讲话。我们的团队比以往任何时候都更兴奋,要在加拿大构建生成式媒体的基础,并为全球企业客户创造价值。

    引用Mohammad Norouzi@mo_norouzi

    It was a pleasure hosting Canada's AI Minister @EvanLSolomon at Ideogram's Toronto HQ. We talked about the 3 C's and 2 T's Canadian AI needs: capital, compute, customers, talent, and trust. Proud of our superstar team, building sovereign generative media here at home. 🇨🇦

9月3日周四
9月2日周三
  1. Google Gemini 博客66

    Google 推出 Fairwind Program,向政府与企业提供 Gemini 3.8 Flash Cyber 网络防御能力

    Google 推出 Fairwind Program,这是一个面向政府、Google Cloud 客户和网络安全合作伙伴的受限访问计划,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具组合,用于自主发现、验证并修复漏洞。

    推荐理由:Google 把前沿模型与自动修复工具打包成受限访问计划,读者可了解其面向政府与关键基础设施的准入方式。

  2. Google Gemini 博客85

    Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的定价、基准表现和开放入口,可据此判断长程编码与安全场景的选型。

  3. Higgsfield Blog22

    Higgsfield 工作流:如何在一个平台生成图像、语音并编辑 AI 视频

    Higgsfield 提供覆盖图像、视频、音频生成的 30+ 模型创作套件,可在同一账号内完成参考图、配音、视频生成与剪辑全流程。其推荐链路为 Recraft 或 Soul 出图、Seed Audio 1.0 生成音频、Seedance 2.5 生成视频、Genjutsu 做局部修改,单条 10 秒 1080p 视频总成本约 205 credits、10.25 美元。

9月1日周二
  1. Meta AI Research · Muse74

    Meta 发布 Muse Voice Transcribe 实时语音感知模型

    Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。

    推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。

  2. Higgsfield Blog62

    Higgsfield 发布 Genjutsu:局部重建视频片段,支持 Motion Transfer 与 Object Swap

    Higgsfield 发布 Genjutsu,可在不重拍整段视频的前提下重建片段中的局部内容,包含 Motion Transfer 和 Object Swap 两项功能,前者提取原视频运动并套用到新角色或场景,后者只替换指定对象并保留其余画面,两者均无需完整提示词,可用预设完成。

    推荐理由:官方给出 Genjutsu 的局部重绘能力、输入限制与按长度分辨率计费的价格表,可据此判断视频改造成本。

  3. Manus 博客58

    Manus 恢复独立运营,创始团队继续领导公司

    Manus 宣布已正式恢复独立运营,创始团队将继续领导公司,并作为独立运营的 AI Agent 实验室推进通用 AI Agent 的能力与产品。部分用户此前需备份和恢复数据并经历访问临时中断,官方提供了恢复入口,恢复没有截止日期,未受影响的用户无需操作。Manus 表示后续会更深入融入日常工作流程、更直接地与周围世界互动,并更主动地代表用户采取行动。

8月31日周一
8月29日周六
  1. Higgsfield Blog32

    如何用 Higgsfield Popcorn 把剧本转成 AI 分镜与镜头清单

    Higgsfield Popcorn 是 Higgsfield 的 AI 分镜生成器,可把场景描述与参考图转成连贯的分镜序列,单次生成最多 8 帧、支持最多 4 张图像参考,并提供 Auto 与 Manual 两种模式。锁定后的分镜帧可进入 Cinema Studio 4.0 生成视频。流程为:拆分剧本序列、编写镜头清单、收集参考图、按五要素写提示词。

8月28日周五
  1. Midjourney Updates62

    Midjourney 开放首个 V8.2 图像编辑模型测试

    Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。

    推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。

  2. Meta Newsroom · AI22

    Meta 详解闭环液冷:AI 数据中心背后的“管道工程”

    Meta 最新 AI 优化数据中心大多采用闭环液冷,冷却液(水与乙二醇混合)在密封回路中循环,经热交换器散热后回流服务器机架,预计可连续使用长达十年无需更换。Meta 称典型采用干冷器的闭环液冷 AI 数据中心年用水量低于几家全服务餐厅,且相比风冷可在同一机架内容纳更多 GPU。

  3. Google Gemini 博客76

    Google 发布 Gemini Omni 1.1 Flash,强化生成视频控制能力

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。

    推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。