Got early access to Kling 4.0 Flash! One of my first tries. Prompt understanding is awesome. @Kling_ai #Kling4 Prompt ⤵️
#模型发布
#模型发布
今日 2 条
Kling AI@Kling_aiAI 评分2222引用Umesh@umesh_ai
OpenAI@OpenAI精选AI 评分7070OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平。OpenAI 表示,这是目前同等性能下最具成本效率的模型。

推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定位与价格比例,读者可据此判断它在现有模型中的性价比位置。
OpenAI News精选AI 评分8080 OpenAI 发布 GPT-6.1 Sol
OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景。其标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,价格降至 Astra 标准 API 的五分之一,读者可据此判断成本与能力取舍。
Kling AI@Kling_aiAI 评分6262Kling AI 宣布 Kling 4.0 将于今年 10 月发布,Kling 4.0 Flash 已面向 Ultra 年费订阅用户上线。

Google Gemini 博客精选AI 评分7171 Google 发布 Gemini 3.8 Live with Live Avatar
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Google Gemini 博客精选AI 评分7272 Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。
SpaceXAI@SpaceXAIAI 评分5858
Google Gemini 博客精选AI 评分8282 Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。
推荐理由:Google 发布两款实时语音对话模型,给出语音智能体基准成绩与开发者接入渠道,可据此判断语音 Agent 的可用性。
Google Gemini 博客精选AI 评分6060 Google 在 Gemini 中上线 Lyria 3.5 音乐生成模型
Google 在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,官方称其音质表现最好,人声更具表现力、编曲更丰富。Gemini 应用内支持选择或描述曲风、在带人声与纯器乐之间切换,并提供从背景音乐到生日定制曲的模板,还可选择短曲或长曲。
推荐理由:Lyria 3.5 在音质、人声表现和编曲丰富度上的升级,以及它在 Gemini 应用与 API 中的开放范围,可供读者判断音乐生成能力当前所处的位置。
Google Gemini 博客精选AI 评分8585 Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的定价、基准表现和开放入口,可据此判断长程编码与安全场景的选型。
Meta AI Research · Muse精选AI 评分7474 Meta 发布 Muse Spark 1.3,改进智能体与编码任务表现
Meta 发布 Muse Spark 1.3,在智能体与编码任务上性能提升,max reasoning 版本已在 Muse Code 和 Meta Model API 上线。
推荐理由:官方给出智能体与编码任务的改进细节和工具调用、token 消耗降幅,可据此判断长任务工作流的变化。
Google Gemini 博客AI 评分2222 Google 8 月 AI 更新汇总:Gemini 3.7 Flash、Gemini 3.5 Transcribe 与 Pixel 11 系列发布
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,面向编码与智能体,每百万 token 价格为首发时 3.6 Flash 的一半。
Meta AI Research · Muse精选AI 评分7474 Meta 发布 Muse Voice Transcribe 实时语音感知模型
Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。
推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。
Midjourney Updates精选AI 评分6262 Midjourney 开放首个 V8.2 图像编辑模型测试
Midjourney 开始让所有用户测试其首个 V8.2 图像编辑模型,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)与画布扩展(outpainting),并可使用 personalization、moodboards 和 srefs。
推荐理由:官方公布 V8.2 图像编辑模型的首批能力与入口,可据此了解 Midjourney 编辑能力从参考图到局部重绘的覆盖范围。
Google Gemini 博客精选AI 评分7676 Google 发布 Gemini Omni 1.1 Flash,强化生成视频控制能力
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。
Google Gemini 博客精选AI 评分6262 Google 发布 Gemini 3.5 Transcribe 语音转写模型
Google 发布 Gemini 3.5 Transcribe 语音转文字模型,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。
推荐理由:官方给出流式与非流式两档 WER 数字和相对 Chirp 3 的延迟提升,便于判断语音转写在实际管线中的可用性。
Meta AI Research · Muse精选AI 评分6666 Meta 发布 Muse Spark 1.2 多模态评测结果
Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。
推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。
Meta AI Research · Muse精选AI 评分8080 Meta 发布开源智能体模型 Muse Glimmer,30B 参数可在本地设备运行
Meta Superintelligence Labs 发布 Muse Glimmer,一个 30B 参数的开源智能体模型,权重以 Apache 2.0 许可在 Hugging Face 开放下载。
推荐理由:Meta 开源 30B 端侧智能体模型,量化后可在单张消费级 GPU 上运行,读者可据此判断本地智能体的可行边界。
Meta AI Research · Muse精选AI 评分7878 Meta 发布 Muse Code 终端编码智能体与 Muse Spark 1.2 模型
Meta 发布终端编码智能体 Muse Code(beta),由新模型 Muse Spark 1.2 驱动,可在 macOS 或 Linux 安装,面向大型代码仓库的规划、写码与结果验证,并能协调多个常驻子智能体。
推荐理由:官方披露了 Muse Spark 1.2 的编码训练重点与 Muse Code 的运行时设计,可据此判断终端编码智能体的工程取舍。
ByteDance Seed@ByteDanceSeed_精选AI 评分7878
推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。
Ideogram@ideogram_aiAI 评分6262
Google Labs 博客AI 评分5858 Google 发布音乐生成模型 Lyria 3.5,上线 Flow Music
Google 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改善,同时更易控制输出的节奏与时长。
Ideogram@ideogram_aiAI 评分6262引用AMD Data Center@AMDServerEnterprise-grade AI visual design, powered by AMD Instinct. Ideogram just released Ideogram 4.0, a 9.3B-parameter open-weight Diffusion Transformer that outperforms all open-weight image models in LMArena and Design Arena, with a 0.97 X-Omni English OCR text-rendering score (vs. an industry average of 0.30–0.50). The engine behind it? AMD Instinct MI350X GPUs, 288 GB of HBM3 memory and 8 TB/s of bandwidth, delivering the throughput enterprise diffusion workloads demand. Read how @ideogram_ai and AMD are scaling production-grade visual AI from millions to billions of images per month 👉 https://bit.ly/3TosU1m
Midjourney UpdatesAI 评分5050 Midjourney 发布 V8.2 图像模型
Midjourney 发布 V8.2 图像模型,本次更新聚焦美学、图像质量与个性化。官方称图像将更具创意、大胆、精致、前卫和新颖,低质量图像出现的随机情况应会大幅减少。个性化功能将更好地理解用户品味,V8.2 的个性化配置文件拥有更大且更优质的图像池可供选择。
Meta AI Research · Muse精选AI 评分8585 Meta 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 预览
Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,面向智能体任务,在工具与电脑操作、编码和多模态理解上有明显提升。
推荐理由:Meta 发布面向智能体任务的多模态推理模型,并首次开放 Meta Model API 公共预览,读者可据此了解其能力定位与接入方式。
Midjourney Updates精选AI 评分7171 Midjourney 将 V8.1 设为默认模型
Midjourney 在用户测试和反馈后,将默认模型从 V7 更新为 V8.1。V8.1 对详细提示词的遵循更好、文字渲染更强,开启 HD 模式后图像尺寸是 V7 的两倍、分辨率为 4 倍,SD 出图约 4 秒、HD 约 12 秒;风格参考、个性化和美学设置与 V7 保持一致。V7 omni-reference 仍可使用,V8.0 alpha 模型将在两周后弃用。
推荐理由:官方说明 V8.1 成为默认模型并列出速度、分辨率与提示词遵循的变化,可据此判断是否切换工作流。
Google Labs 博客AI 评分2222 Google 2026 年 5 月 AI 动态汇总:Gemini 3.5、Gemini Omni 与 Googlebook 亮相
Google 在 5 月正式发布 Gemini 3.5 与 Gemini Omni,前者主打智能体与编程的前沿智能,后者支持图像、音频、视频和文本输入并生成高质量视频。
Ideogram Blog精选AI 评分7171 Ideogram 4.0 技术细节:9.3B 开源文生图模型发布
Ideogram 发布 9.3B 参数开源权重文生图模型 Ideogram 4.0,采用 34 层单流 DiT,文本编码器为 Qwen3-VL-8B-Instruct,并拼接其 13 个中间层隐状态。
推荐理由:官方披露 9.3B 开源文生图模型的架构与结构化 JSON 提示词方案,可据此判断开源图像模型的设计取舍。
Google Labs 博客精选AI 评分8888 Google I/O 2026:Gemini 3.5 Flash、Gemini Omni 与 Antigravity 2.0 发布
Google 在 I/O 2026 发布 Gemini 3.5 Flash,官方称其对比 3.1 Pro 在几乎所有基准上更好,输出速度是其他前沿模型的 4 倍,价格不到同类前沿模型的一半,即日起在 Google 全线产品与 API 提供,Gemini 3.5 Pro 将于下月推出。
推荐理由:Google 一次性放出 Gemini 3.5 Flash、Gemini Omni 与 Antigravity 2.0,读者可据此判断其智能体产品线的整体走向。
Sam Altman Blog精选AI 评分8888 OpenAI 发布 GPT-4o,免费向 ChatGPT 用户开放并推出语音视频模式
OpenAI 发布 GPT-4o,Sam Altman 表示已在 ChatGPT 中免费提供这一模型,且不含广告。他称新的语音与视频模式是自己用过最好的计算机界面,达到接近人类的响应速度和表现力,并提到后续会加入可选个性化、访问用户信息以及代为执行操作等能力。
推荐理由:OpenAI 官方说明 GPT-4o 免费开放与语音视频模式,读者可了解其能力定位与商业化取舍。