跳到正文

#多模态

今日 0 条
9月29日周二
  1. Google Gemini 博客62

    Google 展示开发者用 Gemini 3.8 Flash 做的四个项目

    Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。

    推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。

9月24日周四
  1. Google Gemini 博客71

    Google 发布 Gemini 3.8 Live with Live Avatar

    Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。

9月1日周二
  1. Meta AI Research · Muse74

    Meta 发布 Muse Voice Transcribe 实时语音感知模型

    Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。

    推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。

8月28日周五
  1. Google Gemini 博客76

    Google 发布 Gemini Omni 1.1 Flash,强化生成视频控制能力

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。

    推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。

8月20日周四
  1. Meta AI Research · Muse66

    Meta 发布 Muse Spark 1.2 多模态评测结果

    Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。

    推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。

8月17日周一
  1. Higgsfield Blog62

    MiniMax Hailuo 3.0 上线 Higgsfield:支持 2K、15 秒与原生立体声

    MiniMax Hailuo 3.0 已在 Higgsfield 上线,相比 Hailuo 2.3 分辨率从 1080p 提升到 2K,单次生成时长从 10 秒延长到 15 秒,并首次在同一生成过程中输出原生立体声,包含对白、音效与环境音。

    推荐理由:原文给出 Hailuo 3.0 与 2.3 的分辨率、时长、音频和输入数量对比,可据此判断多参考合成视频的可用边界。

7月31日周五
  1. ByteDance Seed78

    字节跳动 Seed 发布新一代视频创作模型 Seedance 2.5,在长叙事、多模态参考和编辑能力上做了升级。该模型支持单次生成 30 秒高质量音视频片段,单次可输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并提供时间戳级控制以对音视频内容做定向编辑。项目主页为 https://seed.bytedance.com/seedance2_5。

    推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。

7月9日周四
  1. Meta AI Research · Muse85

    Meta 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 预览

    Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,面向智能体任务,在工具与电脑操作、编码和多模态理解上有明显提升。

    推荐理由:Meta 发布面向智能体任务的多模态推理模型,并首次开放 Meta Model API 公共预览,读者可据此了解其能力定位与接入方式。

5月14日周二
  1. Sam Altman Blog88

    OpenAI 发布 GPT-4o,免费向 ChatGPT 用户开放并推出语音视频模式

    OpenAI 发布 GPT-4o,Sam Altman 表示已在 ChatGPT 中免费提供这一模型,且不含广告。他称新的语音与视频模式是自己用过最好的计算机界面,达到接近人类的响应速度和表现力,并提到后续会加入可选个性化、访问用户信息以及代为执行操作等能力。

    推荐理由:OpenAI 官方说明 GPT-4o 免费开放与语音视频模式,读者可了解其能力定位与商业化取舍。