如何用 ChatGPT、Claude、Cursor 等 AI 智能体生成视频
Higgsfield 通过 Plugin、MCP 和 CLI 接入 Claude、ChatGPT、Cursor、Claude Code、OpenClaw、Hermes 等 AI 智能体,用户用自然语言描述需求即可由智能体自动选模型、设参数并生成视频。
Higgsfield 通过 Plugin、MCP 和 CLI 接入 Claude、ChatGPT、Cursor、Claude Code、OpenClaw、Hermes 等 AI 智能体,用户用自然语言描述需求即可由智能体自动选模型、设参数并生成视频。
在 Higgsfield AI 上制作 AI 动画短片需五步:设计角色与视觉风格、分镜、逐镜生成、配音对口型、剪辑成片,最大难点是保持角色与画风跨镜头一致。
Higgsfield 用 Audio、Lipsync Studio 和 Reframe 三步完成视频广告本地化:翻译并重新配音、将新语音与口型同步、再按平台比例重构画面。
Gabo 借助 Higgsfield 的 CPP 计划制作出约 50 部、多数时长约一小时的 AI 长片,单部制作周期 20 天至一个月,部分视频播放量达 600 万,部分作品播放量增长近 5 倍。
Higgsfield Genjutsu 与 Seedance 2.5 Edit 支持在已生成的 AI 视频中只替换单个元素,其余画面保持不变。Genjutsu 提供 Object Swap 与 Motion Transfer,最多可用 30 张参考图和 30 秒源视频;Seedance 2.5 Edit 支持 Draw to Edit 圈选区域修改,最多 50 张参考图,两者输出均达 1080p。
Higgsfield 用 Marketing Studio 和 Cinema Studio 4.0 两条路径把运动产品照片生成视频广告:前者支持 Click to Ad 粘贴商品链接或上传照片,自动提取名称、描述、最多 8 张图片、品牌色和 logo,模板库含 1,500+ 模板;后者提供镜头运动、色调、节奏等直接控制,单片段最长 30 秒。
Higgsfield 发布教程,展示如何用情侣已有照片在 higgsfield.ai 上分七步生成 AI 婚礼邀请函,最终由 Cinema Studio 4.0 输出最长 30 秒的带音频影片。
Higgsfield 指出 AI 视频额度消耗快的核心原因是按生成次数而非成品计费,单条成片真实成本等于单次生成价格乘以平均尝试次数,多数创作者的这个乘数在 3 到 10 之间。
Higgsfield 提供 Video Upscale 与 Seedance 2.5 Edit 两条 AI 视频修复路径:前者负责分辨率与画质提升,后者通过文本提示词对最长 30 秒的片段做定向清理、调色与重打光。
Mind Lab 研究员逯雨鑫以个人开发者身份、数百美元成本后训练的两个小模型两次登顶 Hugging Face Model Trending 榜首,他此前没有 AI Lab 经历,也不是 AI PhD,整个过程只用了 2 周。
Google Workspace 产品副总裁 Yulie Kwon Kim 介绍了用 Gemini 开启新学期的 7 种方式,包括在 Sheets canvas 中生成学期规划 mini app、在 Docs 中把笔记转成学习指南和图表、在 Slides 中用 Deck Generation 生成整套演示文稿。
Kimi K3 是有效扩展到 2.8T 总参数并全量开源的 MoE 模型,清华博士候选人孙宇涛领读其技术报告,串联讲解十余篇相关论文。报告覆盖线性注意力、Gated MLA、Attention Residuals、Stable LatentMoE 与 Muon 等架构创新,以及预训练、多教师 On-Policy 蒸馏和 KDA Kernel 等基础设施。
用脚本制作 AI 视频需五步:格式化脚本、拆分为场景、生成分镜表、逐镜生成、按序剪辑。Higgsfield 的 Cinema Studio 4.0 单次生成最长 30 秒、最高 1080p,可依节奏自动切成多个镜头,并支持 30+ 运镜预设、50+ 调色盘与最多 50 张参考图;Popcorn 负责分镜,Soul ID 保持角色一致。
Higgsfield 发布指南,指出 AI 视频显得虚假主要源于三点:光线没有明确来源、运动缺乏重量感、镜头过于平稳顺滑。文章给出用提示词修复的方法,强调用具体光源和方向替代"电影感""真实"等无效词,并说明 Higgsfield 上对应设置的作用及一次 15 秒生成的成本。
Higgsfield 发布 2026 年 TikTok AI 内容制作指南,覆盖 AI influencer、数字人播报、Shorts 剪辑、品牌广告等五种格式,分别对应 AI Influencer Studio、Soul ID + LipSync Studio、Shorts Studio、Marketing Studio 等工具。
Lovart 的图像引擎 Nano Banana 并非单一模型,而是由 Nano Banana 2(基于 Gemini 3.1 Flash Image,5 秒内出图、1K-2K 分辨率)与 Nano Banana Pro(基于 Gemini 3 Pro Image,10-30 秒、2K-4K 原生、支持 SVG 矢量导出)组成的模型家族,在 MCoT 思维链系统下协同工作。
Lovart 发布 Reels 封面制作教程,用 AI 景深模糊自动检测主体并施加 3–5px 背景模糊,模拟 f/1.8 人像效果,配合 Touch Edit 裁剪定位。封面文字建议 3–6 个词,默认 Montserrat Bold 68pt,文字背景为 40% 不透明度黑色填充加 12px 圆角。Pro 计划(49 美元)支持 CSV 批量生成封面,模板复用后单个封面耗时不到 90 秒。
Lovart 的角色一致性流程由设定稿、Multi-Angles 多角度生成和 Touch Edit / Edit Elements 逐张校准组成,没有一键开关。
Lovart 发布 2026 年 AI 素描与绘画生成指南,称其草图精炼模式可把粗略草图转为干净风格化版本,并保留构图与主体位置。指南称石墨铅笔、技术线稿、钢笔与墨水等风格在屏幕分辨率下已与人类作品几乎无法区分,而书法与手写字体、儿童蜡笔画仍属困难。
Lovart 的 PBR 模式可从单个提示或参考图生成漫反射、法线、粗糙度、金属度、高度、AO 六张贴图,最高输出 4096×4096,支持 PNG 与 TGA,可直接导入 Unity、Unreal Engine、Blender。
Ideogram 发布指南,说明 4.0 基于结构化 JSON 描述训练,提示词需按 high_level_description、style_description、compositional_deconstruction 等字段组织,模型对具体光照、媒介和命名参考更敏感。
推荐理由:官方拆解 Ideogram 4.0 的 JSON 提示词写法,含字段职责、bbox 与十六进制色值等可迁移细节。
俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜在访谈中复盘了 Agent 技术演进史,梳理出从 Logical Agent(1960-90s)、Neural Agent、Semantic Parsing 到 Language Agent 的脉络,并称过去三年 Language Agent 的发展速度超过此前几十年。
播客「十字路口」新年第一期对话 Zara 张咋啦,她过去一年在小红书从 2 万粉丝增长到 18 万,累计发布近 500 篇内容,并完成从非技术背景到 AI 产品经理的转型,业余发布了自己的第一个 AI 产品 LongCut。
美团光年之外产品负责人谢青池用一年多啃完200多篇AI论文后,从中精选36篇经典,以4小时讲解开源自己的论文探索之旅。
OpusClip 前增长产品负责人谢君陶在分享中,从获客、转化、留存、洞察四个维度拆解了这款 AI 视频产品的增长框架。他提出冷启动阶段第一批用户应是 Partners 而非 Affiliates,并复盘了 OpusClip 如何与创作者形成利益共同体、如何通过定价策略和 AB Test 驱动转化与留存。他还透露了 OpusClip 的增长团队架构,并指出绝大多数 AI 产品仍有较大涨价空间。
Palona AI 联创任川分享称,公司 90% 的代码由 AI 编写,其核心经验是默认由 AI 承担所有研发工作、只要有 SOP 就没有 Claude Code 无法完成的任务,并反直觉地减少人与人之间的交互。他提到 CodeRabbit 可把一次代码审查从 1-2 天缩短到 10 分钟,20 人团队没有一个全职 PM,未来可能没有 Engineer、大家都是 Builder。
AI 创业者刘小排认领了 Anthropic 公告中那位每月 200 美元套餐消耗价值 5 万美元 Claude 模型用量的异常账户用户,他累计消耗 77 亿 Token。他借助 Claude Code 独立完成 Raphael AI、AnyVoice、Fast3D 三款产品的洞察、开发与盈利,团队仅六七人,并总结出后台命令、子 Agent 和输出风格三个进阶用法。
俄亥俄州立大学在读博士郑博元逐段解读 Kimi K2、ChatGPT Agent、Qwen3-Coder 三份技术报告及 Manus 技术博文,对比其 Agent 技术路线。内容涵盖 Agent 的感知与行动定义、Coding/Search/Tool-Use/Computer Use 四类划分,以及合成数据、强化学习、安全三大训练环节。
清华大学交叉信息研究院助理教授、星动纪元创始人陈建宇逐篇讲解机器人基座模型与 VLA(Vision-Language-Action Model,视觉语言动作模型)经典论文,梳理从用 LLM 替代 Planning、VLM 替代 Perception 到为机器人预训练基础模型的两阶段路径。
播客邀请 MIT 计算机科学与人工智能实验室在读博士松琳,逐篇解读 DeepSeek、Kimi 同天发布的两篇注意力机制论文及 MiniMax 春节前的相关论文。
高途 AI 提效与创新产品负责人封诚在播客中披露,AI 在获客、转化、交付三环节中转化端价值最大,可稳定提效至少一倍,成单率提高 3-4 倍。他认为提效本质是给金牌销售配一堆助理,并称招人时让懂 AI 的人学业务好过让懂业务的人学 AI。
Answer.AI 联创张阳在播客中复盘了这款北美 AI 教育赛道第一名产品从零到一的出海经验。他提出增长核心三要素为产品底子、供血的商业化能力和自然裂变能力,海外增长手段包括媒体投放、自然增长和社群,并强调社群一定要做且越早越好。他还谈到 AI 原生产品的设计思路,以及大模型能力仍有可被深挖的空间。