跳到正文

#语音

今日 0 条
9月29日周二
  1. Tesla34

    在你的 Tesla 里使用 Grok @Bot

    引用Mike P@mikepat711

    I dramatically underestimated the value of Grok Bot in my Tesla. Can you technically do everything you’re able to do with Grok Bot in the Tesla just by launching the app on your phone and going voice mode? Sure. But the magic isn’t in the raw capability itself, it’s in the combination of raw capability and total seamlessness. I often have fleeting thoughts while driving around. Some of these things aren’t significant enough to make me fumble around with my phone while supervising FSD, but when I literally don’t have to lift a finger and can just “Hey Grok” anything computer related into reality, I find myself taking advantage daily. And the little things add up. I’m on my way to work and remembered that I have a few documents on my home computer that I am going to need for work. So I just asked “Hey Grok, can you grab those 4 pdf files from my Mac downloads folder and move them into X folder on my one drive?” Now they’ll be where I need them to be when I get to my desk, and I won’t have to re-download them on my work machine. I have to work on a presentation today for a talk in a few weeks. “Hey grok, go into my sales enablement folder and have Claude Code build me a deck focused on X product for Y industry.” Claude already has my full job context, styling preferences etc and can build a nearly finished deck with a prompt. Now when I get to my desk, instead of building from scratch, I can review and prompt revisions before beginning to dig through my email backlog. Feels insane.

9月24日周四
  1. Google Gemini 博客71

    Google 发布 Gemini 3.8 Live with Live Avatar

    Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。

  2. Higgsfield Blog18

    2026 年 15 款最佳 AI 内容创作平台盘点

    Higgsfield Blog 盘点 2026 年 15 款面向内容创作者的 AI 平台,覆盖策划、生成、剪辑与发布全流程。Higgsfield 以 30+ 模型整合图像、视频与广告制作,起价 $15/mo;Canva 主打日常设计,Descript 与 OpusClip 侧重长视频二次剪辑,HeyGen 与 Synthesia 专注数字人出镜视频。

9月23日周三
  1. Google Gemini 博客72

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。

9月19日周六
9月17日周四
  1. SpaceXAI58

    xAI 的 Grok Voice 已在 fal 上线,可用于构建低延迟、能解决真实客户问题的智能体。该语音模型响应时间为 0.70 秒,可在句子结束前完成工具调用,支持带词级时间戳的转写、25 种以上语言的 30 多种音色文本转语音,并可用两分钟音频进行声音克隆。

    引用fal@fal

    Grok Voice is live on fal. The latest speech model from @SpaceXAI that answers in 0.70 seconds and finishes its tool calls before the sentence ends. Transcription with word-level timestamps, text to speech in 30+ voices across 25+ languages, and cloning from two minutes of audio. Every voice in this video is from Grok Voice.

9月16日周三
9月9日周三
9月5日周六
  1. Google Gemini 博客60

    Google 在 Gemini 中上线 Lyria 3.5 音乐生成模型

    Google 在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,官方称其音质表现最好,人声更具表现力、编曲更丰富。Gemini 应用内支持选择或描述曲风、在带人声与纯器乐之间切换,并提供从背景音乐到生日定制曲的模板,还可选择短曲或长曲。

    推荐理由:Lyria 3.5 在音质、人声表现和编曲丰富度上的升级,以及它在 Gemini 应用与 API 中的开放范围,可供读者判断音乐生成能力当前所处的位置。

9月2日周三
  1. Higgsfield Blog22

    Higgsfield 工作流:如何在一个平台生成图像、语音并编辑 AI 视频

    Higgsfield 提供覆盖图像、视频、音频生成的 30+ 模型创作套件,可在同一账号内完成参考图、配音、视频生成与剪辑全流程。其推荐链路为 Recraft 或 Soul 出图、Seed Audio 1.0 生成音频、Seedance 2.5 生成视频、Genjutsu 做局部修改,单条 10 秒 1080p 视频总成本约 205 credits、10.25 美元。

9月1日周二
  1. Meta AI Research · Muse74

    Meta 发布 Muse Voice Transcribe 实时语音感知模型

    Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。

    推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。

8月27日周四
8月3日周一
7月30日周四
  1. Google Labs 博客58

    Google 发布音乐生成模型 Lyria 3.5,上线 Flow Music

    Google 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改善,同时更易控制输出的节奏与时长。

5月28日周四
1月12日周一
  1. Manus 博客52

    Manus 推出 Meeting Minutes 会议纪要功能

    Manus 推出 Meeting Minutes,可一键录制面对面会议、访谈或独白,自动生成关键要点、与会人员和待办事项的结构化摘要。该功能支持说话人识别、断网续录,并能在同一任务中把会议笔记作为上下文直接生成演示文稿、网站或社交媒体素材,还可邀请他人协作。录制免费,分析和生成笔记消耗积分,现已面向所有 Manus 用户开放,但不适用于在线会议。

5月14日周二
  1. Sam Altman Blog88

    OpenAI 发布 GPT-4o,免费向 ChatGPT 用户开放并推出语音视频模式

    OpenAI 发布 GPT-4o,Sam Altman 表示已在 ChatGPT 中免费提供这一模型,且不含广告。他称新的语音与视频模式是自己用过最好的计算机界面,达到接近人类的响应速度和表现力,并提到后续会加入可选个性化、访问用户信息以及代为执行操作等能力。

    推荐理由:OpenAI 官方说明 GPT-4o 免费开放与语音视频模式,读者可了解其能力定位与商业化取舍。