跳到正文

全部动态

今日 16 条
8月18日周二
  1. Higgsfield Blog22

    如何让 AI 视频看起来真实:光照、运动与镜头控制(Higgsfield 指南)

    Higgsfield 发布指南,指出 AI 视频显得虚假主要源于三点:光线没有明确来源、运动缺乏重量感、镜头过于平稳顺滑。文章给出用提示词修复的方法,强调用具体光源和方向替代"电影感""真实"等无效词,并说明 Higgsfield 上对应设置的作用及一次 15 秒生成的成本。

8月17日周一
  1. Higgsfield Blog62

    MiniMax Hailuo 3.0 上线 Higgsfield:支持 2K、15 秒与原生立体声

    MiniMax Hailuo 3.0 已在 Higgsfield 上线,相比 Hailuo 2.3 分辨率从 1080p 提升到 2K,单次生成时长从 10 秒延长到 15 秒,并首次在同一生成过程中输出原生立体声,包含对白、音效与环境音。

    推荐理由:原文给出 Hailuo 3.0 与 2.3 的分辨率、时长、音频和输入数量对比,可据此判断多参考合成视频的可用边界。

8月15日周六
8月14日周五
  1. Meta AI Research · Muse71

    Meta 回应 Muse Spark 1.1 第三方网络安全测试误配置事件

    Meta 披露,第三方评估机构 Irregular 在测试预发布版 Muse Spark 1.1 时因环境误配置,使模型可访问开放互联网,并被误指向一个真实网站作为目标,模型因此识别并利用了该网站的安全漏洞,读取部分信息并修改了其数据库。

    推荐理由:Meta 复盘第三方测试中模型误攻真实网站的过程,并给出测试隔离与场景审查的整改要求。

8月13日周四
  1. Figma Release Notes22

    Figma agent 支持从社区试用技能并自建技能

    Figma 的 agent 现已支持从 Figma Community 试用技能,并让用户自行创建技能。此前在 Config 上线的自定义生成式插件与 shader 能力同步扩展,新增动画与交互式 shader、社区发布、组织内发布、代码查看器,并可通过 Figma 的 MCP server 让第三方 agent 查看和修改这些插件与 shader。

  2. 张小珺Jùn|商业访谈录39

    对英伟达研究副总裁刘洺堉的4小时访谈:功夫、Cosmos 3、开源世界模型与黄仁勋

    英伟达研究副总裁刘洺堉在4小时访谈中详解世界基座模型Cosmos:项目2024年立项,已迭代至Cosmos 3,直属团队不到100人,虚线汇报规模200至300人。他称英伟达不参与存量竞争,黄仁勋要求"做到Cosmos 97",并援引《孙子兵法》"备多则力寡"思考世界模型技术趋势。

8月12日周三
8月11日周二
  1. Manus 博客62

    Manus 恢复独立运营,部分用户数据将于 8 月 23 日起删除

    Manus 宣布即将恢复以独立公司形式运营,作为与 Meta 分拆的一部分并遵守特定司法辖区监管要求,部分用户在 2025 年 12 月 29 日当天或之后产生的数据将于 2026 年 8 月 23 日 08:00 起至 8 月 24 日期间(SGT)被删除。

    推荐理由:官方说明了分拆后部分用户数据的删除与备份时间窗口,受影响用户可据此安排备份。

8月10日周一
8月8日周六
8月7日周五
  1. ByteDance Seed78

    Dreamina Seedance 2.5 的 API 服务已在 BytePlus ModelArk 上线,同时可在 Dreamina、CapCut 等平台体验。该模型支持单次生成 30 秒高质量音视频片段,单次最多输入 30 张图片、10 段视频和 10 段音频作为参考素材,并提供时间戳级别的音视频定向编辑控制。

    引用ByteDance Seed@ByteDanceSeed_

    Introducing Seedance 2.5, our new-generation video creation model! With advancements in long-form storytelling, multimodal reference, and editing, Seedance 2.5 goes beyond longer single-pass video generation, delivering the journey from idea to finished video with greater control. Key highlights include: 1. Users can generate high-quality, 30-second audio-video clips in a single pass, bringing a complete story to life in one take. 2. Users can input up to 30 images, 10 video clips, and 10 audio clips as reference materials in a single pass. 3. Seedance 2.5 offers timestamp-level control for targeted editing of audio and video content, notably improving efficiency and controllability. Visit project homepage learn more: https://seed.bytedance.com/seedance2_5

    推荐理由:Seedance 2.5 的 API 上线 BytePlus ModelArk,读者可据此了解单次生成 30 秒音视频与多模态参考的能力边界。

8月5日周三
  1. Meta AI Research · Muse78

    Meta 发布 Muse Code 终端编码智能体与 Muse Spark 1.2 模型

    Meta 发布终端编码智能体 Muse Code(beta),由新模型 Muse Spark 1.2 驱动,可在 macOS 或 Linux 安装,面向大型代码仓库的规划、写码与结果验证,并能协调多个常驻子智能体。

    推荐理由:官方披露了 Muse Spark 1.2 的编码训练重点与 Muse Code 的运行时设计,可据此判断终端编码智能体的工程取舍。

8月3日周一
  1. 十字路口Crossing22

    对谈汪天凡:AI 应用机会藏在 Context 与交互里,2026 该投真正的快乐

    BAI Capital 高级合伙人汪天凡在「十字路口」公路播客中判断,当基础模型趋同、智能开始通胀,AI 应用的新机会藏在 Context 和交互里。他认为 AI 硬件真正稀缺的是产品定义与「注入人性的光辉」,而非华强北 80 块的平替。面对 2026 年的泡沫,他主张投资有愿景的创始人和让人更快乐的产品。

7月31日周五
  1. ByteDance Seed78

    字节跳动 Seed 发布新一代视频创作模型 Seedance 2.5,在长叙事、多模态参考和编辑能力上做了升级。该模型支持单次生成 30 秒高质量音视频片段,单次可输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并提供时间戳级控制以对音视频内容做定向编辑。项目主页为 https://seed.bytedance.com/seedance2_5。

    推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。

  2. 张小珺Jùn|商业访谈录36

    清华刘子鸣聊中美 neo labs 资本狂潮:AI for AI、机制可解释性与 Max Tegmark

    清华大学人工智能学院助理教授、KAN 网络一作刘子鸣在访谈中用"太疯狂了"形容当下 neo labs 融资热潮,他于 3 月回国任教并参与创建元环智能。他指出当前资本涌入最活跃的两个方向是世界模型和 AutoResearch(AI for AI),并梳理了今年中美做 AI for AI 的创业团队与路线。

7月30日周四
  1. Google Labs 博客58

    Google 发布音乐生成模型 Lyria 3.5,上线 Flow Music

    Google 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改善,同时更易控制输出的节奏与时长。

7月29日周三
  1. Ideogram62

    Ideogram 发布 Ideogram 4.0,这是一个 9.3B 参数的开源权重 Diffusion Transformer 图像模型,官方称其在 LMArena 和 Design Arena 上超过所有开源权重图像模型,英文 OCR 文本渲染得分为 0.97,行业平均为 0.30–0.50。该模型运行在 AMD Instinct MI350X GPU 上,配备 288 GB HBM3 显存和 8 TB/s 带宽,Ideogram 表示与 AMD 合作将 Ideogram 4.0 规模化交付。

    引用AMD Data Center@AMDServer

    Enterprise-grade AI visual design, powered by AMD Instinct. Ideogram just released Ideogram 4.0, a 9.3B-parameter open-weight Diffusion Transformer that outperforms all open-weight image models in LMArena and Design Arena, with a 0.97 X-Omni English OCR text-rendering score (vs. an industry average of 0.30–0.50). The engine behind it? AMD Instinct MI350X GPUs, 288 GB of HBM3 memory and 8 TB/s of bandwidth, delivering the throughput enterprise diffusion workloads demand. Read how @ideogram_ai and AMD are scaling production-grade visual AI from millions to billions of images per month 👉 https://bit.ly/3TosU1m

  2. Lovart 博客22

    Lovart 教程:无需 Photoshop 制作 Reels 封面,AI 景深模糊与文字背景

    Lovart 发布 Reels 封面制作教程,用 AI 景深模糊自动检测主体并施加 3–5px 背景模糊,模拟 f/1.8 人像效果,配合 Touch Edit 裁剪定位。封面文字建议 3–6 个词,默认 Montserrat Bold 68pt,文字背景为 40% 不透明度黑色填充加 12px 圆角。Pro 计划(49 美元)支持 CSV 批量生成封面,模板复用后单个封面耗时不到 90 秒。

  3. Lovart 博客8

    如何为纹身工作室打造品牌套件

    Lovart 发布纹身工作室品牌套件设计指南,给出主墨水黑 #0D0D0D、副血红色 #B71C1C、点缀金色 #D4AF37 等完整配色方案,以及黑体标志、Bebas Neue 标题、Roboto Condensed 正文的字体组合。指南覆盖经典闪片、精品艺术、私人预约三类工作室模板,并包含同意书、护理卡、作品集等模板,其中同意书模板已按样本州卫生部门纹身法规验证。

7月28日周二
  1. 张小珺Jùn|商业访谈录34

    对游凯超3小时访谈:开源Infra、和模型Co-design、“如果vLLM失败,我们会后悔一辈子”

    Inferact 联合创始人兼首席科学家游凯超在访谈中回顾了 vLLM 从伯克利校园开源项目演化为公司的近 3 年历程,Inferact 今年初获得 1.5 亿美元种子轮融资。他谈及开源项目商业化后的抉择与转变,以及 AI Infra 与模型结构、Harness Engineering 联合设计时代下的 Co-design 思路。