I dramatically underestimated the value of Grok Bot in my Tesla. Can you technically do everything you’re able to do with Grok Bot in the Tesla just by launching the app on your phone and going voice mode? Sure. But the magic isn’t in the raw capability itself, it’s in the combination of raw capability and total seamlessness. I often have fleeting thoughts while driving around. Some of these things aren’t significant enough to make me fumble around with my phone while supervising FSD, but when I literally don’t have to lift a finger and can just “Hey Grok” anything computer related into reality, I find myself taking advantage daily. And the little things add up. I’m on my way to work and remembered that I have a few documents on my home computer that I am going to need for work. So I just asked “Hey Grok, can you grab those 4 pdf files from my Mac downloads folder and move them into X folder on my one drive?” Now they’ll be where I need them to be when I get to my desk, and I won’t have to re-download them on my work machine. I have to work on a presentation today for a talk in a few weeks. “Hey grok, go into my sales enablement folder and have Claude Code build me a deck focused on X product for Y industry.” Claude already has my full job context, styling preferences etc and can build a nearly finished deck with a prompt. Now when I get to my desk, instead of building from scratch, I can review and prompt revisions before beginning to dig through my email backlog. Feels insane.
#语音
#语音
今日 0 条
Tesla@TeslaAI 评分3434引用Mike P@mikepat711
Google Gemini 博客精选AI 评分7171 Google 发布 Gemini 3.8 Live with Live Avatar
Google 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为对话模型带来近实时的视觉形象。该功能支持精确唇形同步、自然表情与流畅轮次切换,并可在对话中异步调用工具、在后台获取数据。它支持 97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 提供,自定义形象仅限企业白名单申请。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的落地形态与开放范围。
Higgsfield BlogAI 评分1818 2026 年 15 款最佳 AI 内容创作平台盘点
Higgsfield Blog 盘点 2026 年 15 款面向内容创作者的 AI 平台,覆盖策划、生成、剪辑与发布全流程。Higgsfield 以 30+ 模型整合图像、视频与广告制作,起价 $15/mo;Canva 主打日常设计,Descript 与 OpusClip 侧重长视频二次剪辑,HeyGen 与 Synthesia 专注数字人出镜视频。
Google Gemini 博客精选AI 评分7272 Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。
Meta Newsroom · AIAI 评分5858 Meta 为 Ray-Ban Display 推出导航、Hologram 等新功能并扩展至五国市场
Meta 在 Connect 2026 上公布 Ray-Ban Display 的多项更新,包括支持骑行与公交实时导航、用前方实景描述步行路线的语音导航,以及通过 Meta AI 应用自拍生成、由语音驱动表情的 Hologram 通话形象。
Higgsfield BlogAI 评分2222 Higgsfield 如何用 AI 完成视频广告本地化:配音、口型同步与画面重构
Higgsfield 用 Audio、Lipsync Studio 和 Reframe 三步完成视频广告本地化:翻译并重新配音、将新语音与口型同步、再按平台比例重构画面。
Meta AI Research · Muse精选AI 评分8282 Meta 发布 Muse Realtime Avatar 实时数字人技术
Meta 推出 Muse Realtime Avatar,将 Muse Realtime Voice 的语音 token 流转化为可实时对话的虚拟形象,支持面部、手部和全身动作。
推荐理由:Meta 公开了实时数字人系统的蒸馏与推理栈细节,读者可据此了解实时视频生成如何做到亚秒级延迟。
SpaceXAI@SpaceXAIAI 评分5858xAI 发布 Grok Voice Transcribe 2.0,称其为全球最准确的语音转写模型。原文未给出具体准确率数字、支持语言或开放方式等细节。
SpaceXAI@SpaceXAIAI 评分5858引用fal@falGrok Voice is live on fal. The latest speech model from @SpaceXAI that answers in 0.70 seconds and finishes its tool calls before the sentence ends. Transcription with word-level timestamps, text to speech in 30+ voices across 25+ languages, and cloning from two minutes of audio. Every voice in this video is from Grok Voice.
Google Gemini 博客精选AI 评分8282 Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务和多步推理。
推荐理由:Google 发布两款实时语音对话模型,给出语音智能体基准成绩与开发者接入渠道,可据此判断语音 Agent 的可用性。
Manus 博客AI 评分2828 58 岁零编程基础的 Amy 用 Manus 为失声的哥哥构建语音辅助应用 Wally
58 岁、从未写过代码的 Amy 借助 Manus 为因癌症失去发声器官的哥哥 Jamie 构建了语音辅助应用 Wally,以高尔夫为主题包装,内置紧急求助、日常需求和给孙女的短语,一点即通即可替他开口。
Google Gemini 博客精选AI 评分6060 Google 在 Gemini 中上线 Lyria 3.5 音乐生成模型
Google 在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,官方称其音质表现最好,人声更具表现力、编曲更丰富。Gemini 应用内支持选择或描述曲风、在带人声与纯器乐之间切换,并提供从背景音乐到生日定制曲的模板,还可选择短曲或长曲。
推荐理由:Lyria 3.5 在音质、人声表现和编曲丰富度上的升级,以及它在 Gemini 应用与 API 中的开放范围,可供读者判断音乐生成能力当前所处的位置。
Higgsfield BlogAI 评分3838 如何用 Higgsfield 把 Claude 变成完整创意工作室
Higgsfield MCP 让 Claude 通过一次连接直接调用其完整创意管线,在对话内生成图像、视频和音频,并复用历史素材。该连接开放 30+ 模型,包括 Soul、Cinema Studio、Seedance 2.5、Kling,图像最高支持 4K 分辨率,生成消耗现有 Higgsfield 账户积分,无需单独的 MCP 余额或 API key。
Higgsfield BlogAI 评分2222 Higgsfield 工作流:如何在一个平台生成图像、语音并编辑 AI 视频
Higgsfield 提供覆盖图像、视频、音频生成的 30+ 模型创作套件,可在同一账号内完成参考图、配音、视频生成与剪辑全流程。其推荐链路为 Recraft 或 Soul 出图、Seed Audio 1.0 生成音频、Seedance 2.5 生成视频、Genjutsu 做局部修改,单条 10 秒 1080p 视频总成本约 205 credits、10.25 美元。
Google Gemini 博客AI 评分2222 Google 8 月 AI 更新汇总:Gemini 3.7 Flash、Gemini 3.5 Transcribe 与 Pixel 11 系列发布
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,面向编码与智能体,每百万 token 价格为首发时 3.6 Flash 的一半。
Meta AI Research · Muse精选AI 评分7474 Meta 发布 Muse Voice Transcribe 实时语音感知模型
Meta Superintelligence Labs 发布 Muse Voice Transcribe,这是其首款实时音频感知模型,支持流式 ASR、20 人以上说话人分离和端点检测。模型原生支持任意中英混说,训练覆盖 70 多种语言,其中 25 种经过充分验证,并支持超过一小时的长音频输入。官方称其在 Artificial Analysis 流式语音转文字和公开说话人分离基准上排名第一。
推荐理由:Meta 公布实时语音感知模型的技术细节与基准排名,读者可了解流式 ASR 与说话人分离的实现路径。
Google Gemini 博客精选AI 评分6262 Google 发布 Gemini 3.5 Transcribe 语音转写模型
Google 发布 Gemini 3.5 Transcribe 语音转文字模型,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。
推荐理由:官方给出流式与非流式两档 WER 数字和相对 Chirp 3 的延迟提升,便于判断语音转写在实际管线中的可用性。
Manus 博客AI 评分2828 Manus 上线 ElevenLabs 连接器:一次对话生成语音、转录音频并构建音频应用
ElevenLabs 连接器已在 Manus 上线,用户连接已有的 ElevenLabs 账户后,可在同一次对话中生成语音、克隆声音、转录录音并构建语音驱动的应用。
Google Labs 博客AI 评分5858 Google 发布音乐生成模型 Lyria 3.5,上线 Flow Music
Google 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改善,同时更易控制输出的节奏与时长。
Midjourney UpdatesAI 评分1212 Midjourney 网页版更新:对话模式与 V8.1 图像重跑升级
Midjourney 网页版改进对话模式,语音会话启动时可调用 Image Prompts、Style References、侧边栏设置和近期任务,Image Prompts 现可从托盘和侧边栏使用,托盘图片在语音提交间保留。
Manus 博客AI 评分5252 Manus 推出 Meeting Minutes 会议纪要功能
Manus 推出 Meeting Minutes,可一键录制面对面会议、访谈或独白,自动生成关键要点、与会人员和待办事项的结构化摘要。该功能支持说话人识别、断网续录,并能在同一任务中把会议笔记作为上下文直接生成演示文稿、网站或社交媒体素材,还可邀请他人协作。录制免费,分析和生成笔记消耗积分,现已面向所有 Manus 用户开放,但不适用于在线会议。
Sam Altman Blog精选AI 评分8888 OpenAI 发布 GPT-4o,免费向 ChatGPT 用户开放并推出语音视频模式
OpenAI 发布 GPT-4o,Sam Altman 表示已在 ChatGPT 中免费提供这一模型,且不含广告。他称新的语音与视频模式是自己用过最好的计算机界面,达到接近人类的响应速度和表现力,并提到后续会加入可选个性化、访问用户信息以及代为执行操作等能力。
推荐理由:OpenAI 官方说明 GPT-4o 免费开放与语音视频模式,读者可了解其能力定位与商业化取舍。