跳到正文

#Google

今日 0 条
9月29日周二
  1. Google Gemini 博客62

    Google 展示开发者用 Gemini 3.8 Flash 做的四个项目

    Google 介绍开发者用 Gemini 3.8 Flash 构建的实验项目,包括卫星与轨道火箭路径模拟、将日本传统青海波纹样转成动态水墨画、用四阶段提示词生成霸王龙骨架,以及从零搭建自动变速箱交互模型。

    推荐理由:官方给出 Gemini 3.8 Flash 相对 3.7 Flash 的能力提升方向,并附四个开发者实测案例,可据此判断它在复杂多步任务上的表现。

9月24日周四
  1. Google Gemini 博客71

    Google 发布 Gemini 3.8 Live with Live Avatar

    Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。

9月23日周三
  1. Google Gemini 博客72

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。

9月16日周三
9月5日周六
  1. Google Gemini 博客60

    Google 在 Gemini 中上线 Lyria 3.5 音乐生成模型

    Google 在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,官方称其音质表现最好,人声更具表现力、编曲更丰富。Gemini 应用内支持选择或描述曲风、在带人声与纯器乐之间切换,并提供从背景音乐到生日定制曲的模板,还可选择短曲或长曲。

    推荐理由:Lyria 3.5 在音质、人声表现和编曲丰富度上的升级,以及它在 Gemini 应用与 API 中的开放范围,可供读者判断音乐生成能力当前所处的位置。

9月2日周三
  1. Google Gemini 博客85

    Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的定价、基准表现和开放入口,可据此判断长程编码与安全场景的选型。

8月28日周五
  1. Google Gemini 博客76

    Google 发布 Gemini Omni 1.1 Flash,强化生成视频控制能力

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延长、首尾帧插值、360p 快速预览和最高 4K 放大等生成视频控制能力,通过 Gemini API 在 Google AI Studio 上线。

    推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。

8月27日周四
7月30日周四
  1. Google Labs 博客58

    Google 发布音乐生成模型 Lyria 3.5,上线 Flow Music

    Google 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改善,同时更易控制输出的节奏与时长。