Got early access to Kling 4.0 Flash! One of my first tries. Prompt understanding is awesome. @Kling_ai #Kling4 Prompt ⤵️
全部AI 动态
全部动态
今日 3 条
Kling AI@Kling_aiAI 评分2222引用Umesh@umesh_ai
Kling AI@Kling_aiAI 评分5858引用汗青 HQ@hq4aiSPARE。由 可灵 Kling 4.0 满血版生成的短片。 感谢可灵 AI 的内测邀约。本片使用 可灵 Kling 4.0 满血版全能参考生成。 满血版比 Flash 还是强不少。 - 原生 30 秒直出 - 画面与声音更清晰 - 口型匹配更精准 - 21:9 电影画幅 可灵 Kling 4.0 将于 10 月上线。 中文字幕版:
OpenAI@OpenAI精选AI 评分7070OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平。OpenAI 表示,这是目前同等性能下最具成本效率的模型。

推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定位与价格比例,读者可据此判断它在现有模型中的性价比位置。
Google Gemini 博客精选AI 评分6262 Google 展示开发者用 Gemini 3.8 Flash 做的四个项目
Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。
推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。
Google Gemini 博客精选AI 评分7171 Google 发布 Gemini 3.8 Live with Live Avatar
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Google Gemini 博客精选AI 评分7272 Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。
SpaceXAI@SpaceXAIAI 评分5858
SpaceXAI@SpaceXAIAI 评分5858xAI 发布 Grok Voice Transcribe 2.0,称其为全球最准确的语音转写模型。原文未给出具体准确率数字、支持语言或开放方式等细节。
Google Gemini 博客精选AI 评分8282 Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。
推荐理由:Google 发布两款实时语音对话模型,给出语音智能体基准成绩与开发者接入渠道,可据此判断语音 Agent 的可用性。
Meta AI Research · Muse精选AI 评分7474 Meta 发布 Muse Spark 1.3,改进智能体与编码任务表现
Meta 发布 Muse Spark 1.3,在智能体与编码任务上性能提升,max reasoning 版本已在 Muse Code 和 Meta Model API 上线。
推荐理由:官方给出智能体与编码任务的改进细节和工具调用、token 消耗降幅,可据此判断长任务工作流的变化。
Meta AI Research · Muse精选AI 评分7474 Meta 发布 Muse Voice Transcribe 实时语音感知模型
Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。
推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。
Meta AI Research · Muse精选AI 评分6666 Meta 发布 Muse Spark 1.2 多模态评测结果
Meta 公布 Muse Spark 1.2 的新评测结果与演示,展示其在视觉编码、图表理解、视觉推理和知识密集型任务上的表现,并称多模态提升在模型可调用工具时最明显。该模型支持将图像或视频转为可运行代码、面向机器人的空间智能与音视频理解,已上线 Meta Model API 和 Muse Code,官方同时预览了内部评测 WildArtifactBench 并放出 10 个任务。
推荐理由:官方给出 Muse Spark 1.2 在多模态任务上的新评测与演示,可了解其在视觉编码、机器人和音视频理解上的能力边界。
Meta AI Research · Muse精选AI 评分8080 Meta 发布开源智能体模型 Muse Glimmer,30B 参数可在本地设备运行
Meta Superintelligence Labs 发布 Muse Glimmer,一个 30B 参数的开源智能体模型,权重以 Apache 2.0 许可在 Hugging Face 开放下载。
推荐理由:Meta 开源 30B 端侧智能体模型,量化后可在单张消费级 GPU 上运行,读者可据此判断本地智能体的可行边界。
ByteDance Seed@ByteDanceSeed_精选AI 评分7878
推荐理由:官方给出单次生成时长、参考素材上限和时间戳级编辑三项能力,可据此判断视频创作流程的变化。
Ideogram@ideogram_aiAI 评分6262
Google Labs 博客AI 评分5858 Google 发布音乐生成模型 Lyria 3.5,上线 Flow Music
Google 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改善,同时更易控制输出的节奏与时长。
Ideogram@ideogram_aiAI 评分6262引用AMD Data Center@AMDServerEnterprise-grade AI visual design, powered by AMD Instinct. Ideogram just released Ideogram 4.0, a 9.3B-parameter open-weight Diffusion Transformer that outperforms all open-weight image models in LMArena and Design Arena, with a 0.97 X-Omni English OCR text-rendering score (vs. an industry average of 0.30–0.50). The engine behind it? AMD Instinct MI350X GPUs, 288 GB of HBM3 memory and 8 TB/s of bandwidth, delivering the throughput enterprise diffusion workloads demand. Read how @ideogram_ai and AMD are scaling production-grade visual AI from millions to billions of images per month 👉 https://bit.ly/3TosU1m
Midjourney UpdatesAI 评分5050 Midjourney 发布 V8.2 图像模型
Midjourney 发布 V8.2 图像模型,本次更新聚焦美学、图像质量与个性化。官方称图像将更具创意、大胆、精致、前卫和新颖,低质量图像出现的随机情况应会大幅减少。个性化功能将更好地理解用户品味,V8.2 的个性化配置文件拥有更大且更优质的图像池可供选择。
Midjourney Updates精选AI 评分7171 Midjourney 将 V8.1 设为默认模型
Midjourney 在用户测试和反馈后,将默认模型从 V7 更新为 V8.1。V8.1 对详细提示词的遵循更好、文字渲染更强,开启 HD 模式后图像尺寸是 V7 的两倍、分辨率为 4 倍,SD 出图约 4 秒、HD 约 12 秒;风格参考、个性化和美学设置与 V7 保持一致。V7 omni-reference 仍可使用,V8.0 alpha 模型将在两周后弃用。
推荐理由:官方说明 V8.1 成为默认模型并列出速度、分辨率与提示词遵循的变化,可据此判断是否切换工作流。
Ideogram Blog精选AI 评分7171 Ideogram 4.0 技术细节:9.3B 开源文生图模型发布
Ideogram 发布 9.3B 参数开源权重文生图模型 Ideogram 4.0,采用 34 层单流 DiT,文本编码器为 Qwen3-VL-8B-Instruct,并拼接其 13 个中间层隐状态。
推荐理由:官方披露 9.3B 开源文生图模型的架构与结构化 JSON 提示词方案,可据此判断开源图像模型的设计取舍。
Sam Altman Blog精选AI 评分8888 OpenAI 发布 GPT-4o,免费向 ChatGPT 用户开放并推出语音视频模式
OpenAI 发布 GPT-4o,Sam Altman 表示已在 ChatGPT 中免费提供这一模型,且不含广告。他称新的语音与视频模式是自己用过最好的计算机界面,达到接近人类的响应速度和表现力,并提到后续会加入可选个性化、访问用户信息以及代为执行操作等能力。
推荐理由:OpenAI 官方说明 GPT-4o 免费开放与语音视频模式,读者可了解其能力定位与商业化取舍。