如何用 AI 制作婚礼邀请函:照片与视频全流程
Higgsfield 发布教程,展示如何用情侣已有照片在 higgsfield.ai 上分七步生成 AI 婚礼邀请函,最终由 Cinema Studio 4.0 输出最长 30 秒的带音频影片。
Higgsfield 发布教程,展示如何用情侣已有照片在 higgsfield.ai 上分七步生成 AI 婚礼邀请函,最终由 Cinema Studio 4.0 输出最长 30 秒的带音频影片。
Gemini 应用现已登陆 Windows。 只需一个快捷键,助你保持专注。按下 Alt + Space,即可在你常用的工具和日常应用旁润色草稿、总结长文档、头脑风暴新想法,以及创建自定义图像和视频。
Google 发布 Windows 版 Gemini 桌面应用,Windows 10 和 11 用户可在 gemini.google/desktop 下载,全球同步上线。
推荐理由:官方给出 Windows 端 Gemini 的快捷键入口、智能体与图像视频生成能力,可据此判断桌面工作流的变化。
Higgsfield 指出 AI 视频额度消耗快的核心原因是按生成次数而非成品计费,单条成片真实成本等于单次生成价格乘以平均尝试次数,多数创作者的这个乘数在 3 到 10 之间。
Google 博客介绍 Gemini 处理行政事务的 4 种用法:填写表格与缴费、参与公民事务、查找政府机构与法规、申请社会服务。Google 的 AI & Economy ATLAS v1.0 研究显示,约 40% 用 Gemini 处理公民事务的人咨询此类问题,26% 用于了解政府事务,超 16% 用于查找机构,超 15% 用于社会服务,近半数对话发生在非标准工作时间。
OpenAI 最新图像模型 GPT Image 2.5 已在 Higgsfield 上线,分为 Flare 和 Sunburst 两个版本。Flare 面向日常高频生成,输出质量高于 GPT Image 2 且延迟降低约 50%;Sunburst 主打精确编辑,适合成品级广告与产品图。两版本均支持最多 16 张参考图、1K/2K/4K 分辨率,定价一致,4K Max 档约 $1.325/张。
Meta 推出个人 AI 智能体 Muse,由 Muse Spark 模型驱动,运行在专用虚拟机 Muse Secure VM 上,智能体与用户数据同机存放,另有 Sentinel 智能体在系统层面隔离并审核其联网行为。
推荐理由:Meta 把个人智能体放进独立安全虚拟机,并给出支付与权限控制方案,可观察大厂如何设计智能体的隐私边界。
Higgsfield 发布 Soul 2.0 与 Nano Banana Pro 的选型对比:Soul 2.0 是 Higgsfield 自研基础图像模型,主打电影级写实、20+ 预设和 Soul ID 跨代人脸一致性;Nano Banana Pro 是 Google 的 Gemini 驱动图像模型,最高 4K 分辨率,强于风格广度、对象级编辑和图像内文字渲染。
58 岁、从未写过代码的 Amy 借助 Manus 为因癌症失去发声器官的哥哥 Jamie 构建了语音辅助应用 Wally,以高尔夫为主题包装,内置紧急求助、日常需求和给孙女的短语,一点即通即可替他开口。
Meta 发布博客,详解其个人智能体 Muse 的安全、隐私与防护设计,包括运行在隔离 VM 中的运行时单元、独立于智能体的 Sentinel 权限控制,以及针对提示注入的模型训练、分类器与人工审批多层防御。
推荐理由:Meta 公开了 Muse 智能体的安全架构细节,包括 Sentinel 权限控制与提示注入防御的分层设计。
Higgsfield 宣布 GPT-6 Astra 已接入其工作流,包括 Games 2.0 和 MCP 连接体验,可由一句提示词构建并部署完整多人游戏。在 Higgsfield MCP 流程中,GPT-6 Astra 负责编码、逻辑、推理与多步编排,Higgsfield 负责创意素材与游戏生成部署,用户可在界面直接设定游戏类型、风格、场景和多人开关。
推荐理由:原文给出 GPT-6 Astra 在 Higgsfield 工作流中的分工与 Games 2.0 的完整操作路径,可据此判断一句话生成可玩游戏的落地方式。
Higgsfield 发布 AI 原生 3D 工作空间 3D Jutsu,可将提示词或参考图生成含物体、布局、灯光、相机与动画的可编辑 3D 场景,并直接在同一对话中渲染成视频。
推荐理由:官方给出 3D Jutsu 的场景搭建、编辑与导出流程,可据此判断提示词到 3D 预演再到视频的工作方式。
Google 在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,官方称其音质表现最好,人声更具表现力、编曲更丰富。Gemini 应用内支持选择或描述曲风、在带人声与纯器乐之间切换,并提供从背景音乐到生日定制曲的模板,还可选择短曲或长曲。
推荐理由:Lyria 3.5 在音质、人声表现和编曲丰富度上的升级,以及它在 Gemini 应用与 API 中的开放范围,可供读者判断音乐生成能力当前所处的位置。
Midjourney 正在公开征集用户反馈与改进建议,并计划在未来一两周内举行正式投票。用户可通过 midjourney.com/ideas 提交想法,供团队确定后续优先开发方向。
Midjourney 在 alpha.midjourney.com 推送大更新,将新的 v8.2 编辑模型接入 alpha,并在 lightbox 中内置编辑器,支持用自然语言指令编辑、最多附加 4 张参考图,并集中查看本次会话的所有编辑。
对于今早孟菲斯计算中心宕机后你可能遇到的 Grok 问题,我们深表歉意。我们也要向受影响的计算合作伙伴致歉。 目前所有系统均已恢复,运行正常。
感谢部长 @EvanLSolomon 拨冗出席并带来振奋人心的讲话。我们的团队比以往任何时候都更兴奋,要在加拿大构建生成式媒体的基础,并为全球企业客户创造价值。
It was a pleasure hosting Canada's AI Minister @EvanLSolomon at Ideogram's Toronto HQ. We talked about the 3 C's and 2 T's Canadian AI needs: capital, compute, customers, talent, and trust. Proud of our superstar team, building sovereign generative media here at home. 🇨🇦
Higgsfield 提供 Video Upscale 与 Seedance 2.5 Edit 两条 AI 视频修复路径:前者负责分辨率与画质提升,后者通过文本提示词对最长 30 秒的片段做定向清理、调色与重打光。
Figma Design 新版本支持在变量(variables)弹窗中批量更新不透明度,并可将不透明度叠加到任意颜色上而无需解除与库的关联。用户可用数字变量为颜色变量设置不透明度,并限定其仅用于颜色变量,便于统一调整禁用态、遮罩层等场景。
Google 推出 Fairwind Program,这是一个面向政府、Google Cloud 客户和网络安全合作伙伴的受限访问计划,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具组合,用于自主发现、验证并修复漏洞。
推荐理由:Google 把前沿模型与自动修复工具打包成受限访问计划,读者可了解其面向政府与关键基础设施的准入方式。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的定价、基准表现和开放入口,可据此判断长程编码与安全场景的选型。
Google 与 Beast Industries 启动多年合作,将 MrBeast 与 YouTube 的关系延伸至 Gemini 和 Google Health。9 月 5 日上线的 MrBeast 新视频中,团队将在丛林、沙漠和北极三大极端环境中借助 Gemini 识别危险、应对天气变化。他还会出现在 Gemini 新广告中,并在后续挑战里接入 Fitbit Air。
Higgsfield MCP 让 Claude 通过一次连接直接调用其完整创意管线,在对话内生成图像、视频和音频,并复用历史素材。该连接开放 30+ 模型,包括 Soul、Cinema Studio、Seedance 2.5、Kling,图像最高支持 4K 分辨率,生成消耗现有 Higgsfield 账户积分,无需单独的 MCP 余额或 API key。
Meta 发布 Muse Spark 1.3,在智能体与编码任务上性能提升,max reasoning 版本已在 Muse Code 和 Meta Model API 上线。
推荐理由:官方给出智能体与编码任务的改进细节和工具调用、token 消耗降幅,可据此判断长任务工作流的变化。
Higgsfield 提供覆盖图像、视频、音频生成的 30+ 模型创作套件,可在同一账号内完成参考图、配音、视频生成与剪辑全流程。其推荐链路为 Recraft 或 Soul 出图、Seed Audio 1.0 生成音频、Seedance 2.5 生成视频、Genjutsu 做局部修改,单条 10 秒 1080p 视频总成本约 205 credits、10.25 美元。
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,面向编码与智能体,每百万 token 价格为首发时 3.6 Flash 的一半。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。
推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。
Figma 为生成式插件和 shader 新增动画与交互能力,可通过提示词让 agent 生成响应鼠标移动的动态 shader 效果。用户还能将插件和 shader 发布至 Figma Community 或组织内部(仅 Organization 和 Enterprise 计划),并在 Figma 中查看和下载代码。
Higgsfield 发布 Genjutsu,可在不重拍整段视频的前提下重建片段中的局部内容,包含 Motion Transfer 和 Object Swap 两项功能,前者提取原视频运动并套用到新角色或场景,后者只替换指定对象并保留其余画面,两者均无需完整提示词,可用预设完成。
推荐理由:官方给出 Genjutsu 的局部重绘能力、输入限制与按长度分辨率计费的价格表,可据此判断视频改造成本。
2026 年值得考虑的 Midjourney 替代方案包括 Google Gemini、ChatGPT Images、Higgsfield、Leonardo、Ideogram、Adobe Firefly、Flux、Stable Diffusion、Recraft 和 Krea,多数提供免费或有限免费额度,Stable Diffusion 可自托管。
一份对比 12 款 AI 视频生成器单条成片成本的指南,覆盖 Higgsfield、Kling AI、Google Gemini、PixVerse、Vidu、Pika、Hailuo、Runway、Luma、Krea、LTX Studio 和 Dreamina,价格于 2026 年 8 月按官方定价页与产品内计数器核验。
Manus 宣布已正式恢复独立运营,创始团队将继续领导公司,并作为独立运营的 AI Agent 实验室推进通用 AI Agent 的能力与产品。部分用户此前需备份和恢复数据并经历访问临时中断,官方提供了恢复入口,恢复没有截止日期,未受影响的用户无需操作。Manus 表示后续会更深入融入日常工作流程、更直接地与周围世界互动,并更主动地代表用户采取行动。
同一提示词在四款 AI 视频工具上产生不同结果:Cinema Studio 4.0 保留最多指定约束,Seedance 2.5 擅长变化角度与物体细节,Veo 3.1 的物理与真实感最强,Gemini Omni Flash 1.1 最擅长风格化元素,没有一款工具在所有类别中胜出。
Midjourney 更新了 V8.2 编辑模型,图像质量得到提升。官方称过去 24 小时内遇到问题的用户可重新尝试,并继续反馈意见,后续还会有更多更新。
Higgsfield Popcorn 是 Higgsfield 的 AI 分镜生成器,可把场景描述与参考图转成连贯的分镜序列,单次生成最多 8 帧、支持最多 4 张图像参考,并提供 Auto 与 Manual 两种模式。锁定后的分镜帧可进入 Cinema Studio 4.0 生成视频。流程为:拆分剧本序列、编写镜头清单、收集参考图、按五要素写提示词。
Higgsfield、AdCreative.ai、InVideo、HeyGen、Synthesia、Pictory、Arcads 七款工具被列为 Creatify 的替代方案,其中 Higgsfield 起价 $15/mo,可从产品 URL 或照片生成图片与最长 30 秒视频,并提供 1,500+ 模板。
Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。
推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。
Meta 最新 AI 优化数据中心大多采用闭环液冷,冷却液(水与乙二醇混合)在密封回路中循环,经热交换器散热后回流服务器机架,预计可连续使用长达十年无需更换。Meta 称典型采用干冷器的闭环液冷 AI 数据中心年用水量低于几家全服务餐厅,且相比风冷可在同一机架内容纳更多 GPU。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。