跳到正文

#多模态

今日 0 条
9月29日周二
  1. Google Gemini 博客62

    Google 展示开发者用 Gemini 3.8 Flash 做的四个项目

    Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。

    推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。

9月28日周一
9月26日周六
9月25日周五
  1. Meta Newsroom · AI62

    Meta Connect 2026:Muse 智能体登陆 AI 眼镜,并发布 VR 眼镜与音频眼镜

    Meta 在 Connect 2026 上宣布,本月早些时候发布的个人 AI 智能体 Muse 将在未来几个月登陆其 AI 眼镜,用户可直接说出智能体名字,Muse 能对眼前所见采取行动,并支持可长时间深入对话、在对话同时后台完成任务的语音模式。

    推荐理由:Meta 把个人智能体 Muse 从手机延伸到 AI 眼镜与随身设备,并公布首批零售与办公连接器名单,可据此判断其智能体落地路径。

9月24日周四
  1. Google Gemini 博客71

    Google 发布 Gemini 3.8 Live with Live Avatar

    Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。

  2. Higgsfield Blog18

    2026 年 15 款最佳 AI 内容创作平台盘点

    Higgsfield Blog 盘点 2026 年 15 款面向内容创作者的 AI 平台,覆盖策划、生成、剪辑与发布全流程。Higgsfield 以 30+ 模型整合图像、视频与广告制作,起价 $15/mo;Canva 主打日常设计,Descript 与 OpusClip 侧重长视频二次剪辑,HeyGen 与 Synthesia 专注数字人出镜视频。

9月23日周三
  1. Meta Newsroom · AI62

    Meta 发布 Ray-Ban Meta Audio 音频眼镜与多款 AI 眼镜新品

    Meta 在 Connect 上发布首款音频眼镜 Ray-Ban Meta Audio,重 43 克,单次充电可听音乐、通话和使用 AI 助手最长 12 小时,配合充电盒可再延长 48 小时,提供 23 种配色与镜片组合,起售价 349 美元,10 月 13 日发货。

    推荐理由:Meta 一次性铺开音频眼镜、Gen 3 与多品牌多价位产品线,可据此看清 AI 眼镜从单品走向全价位覆盖的路径。

9月22日周二
9月21日周一
9月17日周四
9月16日周三
9月11日周五
9月5日周六
9月2日周三
9月1日周二
  1. Meta AI Research · Muse74

    Meta 发布 Muse Voice Transcribe 实时语音感知模型

    Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。

    推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。

  2. Higgsfield Blog62

    Higgsfield 发布 Genjutsu:局部重建视频片段,支持 Motion Transfer 与 Object Swap

    Higgsfield 发布 Genjutsu,可在不重拍整段视频的前提下重建片段中的局部内容,包含 Motion Transfer 和 Object Swap 两项功能,前者提取原视频运动并套用到新角色或场景,后者只替换指定对象并保留其余画面,两者均无需完整提示词,可用预设完成。

    推荐理由:官方给出 Genjutsu 的局部重绘能力、输入限制与按长度分辨率计费的价格表,可据此判断视频改造成本。

8月28日周五
  1. Midjourney Updates62

    Midjourney 开放首个 V8.2 图像编辑模型测试

    Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。

    推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。

8月21日周五
8月20日周四
  1. Meta AI Research · Muse66

    Meta 发布 Muse Spark 1.2 多模态评测结果

    Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。

    推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。

8月18日周二
  1. Higgsfield Blog22

    如何用脚本制作 AI 视频:2026 年分步指南

    用脚本制作 AI 视频需五步:格式化脚本、拆分为场景、生成分镜表、逐镜生成、按序剪辑。Higgsfield 的 Cinema Studio 4.0 单次生成最长 30 秒、最高 1080p,可依节奏自动切成多个镜头,并支持 30+ 运镜预设、50+ 调色盘与最多 50 张参考图;Popcorn 负责分镜,Soul ID 保持角色一致。

8月7日周五
  1. ByteDance Seed78

    Dreamina Seedance 2.5 的 API 服务已在 BytePlus ModelArk 上线,同时可在 Dreamina、CapCut 等平台体验。该模型支持单次生成 30 秒高质量音视频片段,单次最多输入 30 张图片、10 段视频和 10 段音频作为参考素材,并提供时间戳级别的音视频定向编辑控制。

    引用ByteDance Seed@ByteDanceSeed_

    Introducing Seedance 2.5, our new-generation video creation model! With advancements in long-form storytelling, multimodal reference, and editing, Seedance 2.5 goes beyond longer single-pass video generation, delivering the journey from idea to finished video with greater control. Key highlights include: 1. Users can generate high-quality, 30-second audio-video clips in a single pass, bringing a complete story to life in one take. 2. Users can input up to 30 images, 10 video clips, and 10 audio clips as reference materials in a single pass. 3. Seedance 2.5 offers timestamp-level control for targeted editing of audio and video content, notably improving efficiency and controllability. Visit project homepage learn more: https://seed.bytedance.com/seedance2_5

    推荐理由:Seedance 2.5 的 API 上线 BytePlus ModelArk,读者可据此了解单次生成 30 秒音视频与多模态参考的能力边界。

7月31日周五
  1. ByteDance Seed78

    字节跳动 Seed 发布新一代视频创作模型 Seedance 2.5,在长叙事、多模态参考和编辑能力上做了升级。该模型支持单次生成 30 秒高质量音视频片段,单次可输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并提供时间戳级控制以对音视频内容做定向编辑。项目主页为 https://seed.bytedance.com/seedance2_5。

    推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。

7月29日周三
6月5日周五
5月28日周四
1月26日周一
  1. 十字路口Crossing26

    视频剪辑的「Cursor 时刻」来了?对谈 ChatCut 创始人李凯文

    ChatCut 创始人李凯文在播客对谈中提出,视频剪辑正迎来自己的「Cursor 时刻」,但他坚持「不生成任何像素」,让 AI 作为剪辑助理工作在编辑器之上,服务「还不是剪辑师」的人群。他认为视频是 token 黑洞,多模态理解尚不足以精确到剪辑层面,Gemini 2.5/3.0 已带来巨大帮助,MG 动画能力很大程度来自 3.0。

12月14日周日
11月28日周五
  1. 张小珺Jùn|商业访谈录40

    对 DeepMind 谭捷的访谈:机器人、跨本体、世界模型与 Gemini Robotics 1.5

    Google DeepMind 机器人团队高级研究科学家谭捷在访谈中介绍了 Gemini Robotics 1.5 的两项关键突破:把 thinking 加入 VLA 模型,以及 cross-embodiment transfer(跨具身迁移),并称 motion transfer 是独门秘诀。他认为机器人智能近年主要依赖多模态大模型,最大瓶颈是数据,未来传统物理仿真会逐步被生成式模型仿真取代。

10月30日周四
  1. 张小珺Jùn|商业访谈录22

    对李想的第二次3小时访谈:CEO大模型、MoE、VLA、记忆与人类的智慧

    张小珺发布与理想创始人兼CEO李想的第二次3小时访谈完整版,录制于2025年4月。李想以“CEO大模型”自比,按MoE架构调用技术、战略、组织三位“专家”,谈及理想自研基座大模型、VLA三阶段训练、每1万公里验证成本从18万降至4000元,以及记忆程序、能量与亲密关系等话题。

10月28日周二
10月22日周三
  1. 十字路口Crossing23

    2025 AI 现场:从 DeepSeek R1 到 Sora 2,十字路口复盘“拐点之年”

    十字路口与庄明浩复盘 2025 年 AI 行业,以“拐点”为年度关键词,梳理从年初 DeepSeek R1 到近期 Sora 2 的模型大战,以及 Manus 引爆的“Agent 元年”。节目还讨论开源生态与人才流向、DeepSeek V3.2 发布后 V4 和 R2 今年或不再出现,并将目光投向资本市场对 AI 的集体狂想。

9月30日周二
  1. 十字路口Crossing34

    京东健康王国鑫谈京医千询2.0与AI医院:垂直大模型如何解决看病难、看病贵

    京东健康探索研究院首席科学家王国鑫介绍「京医千询2.0」大模型与「AI医院」的研发应用,该模型实现三大进化:大量使用合成数据并向行业开放可模拟真实医患对话的Agent、单模型内同时支持CT/MRI/X光等影像理解、从简单推理升级为可追溯证据来源的循证推理。京东健康每天有49万次医疗服务咨询,其底气在于拥有实体医疗机构、药品供应链和30分钟送药上门能力。