搜索「实时语音交互」,找到 11 条相关内容
-
谷歌发布Gemini 3.8 Live双模型,实时语音交互瞄准Agent响应延迟难题
谷歌推出两款实时语音模型,其中Gemini 3.8 Live针对语音Agent交互中的沉默与延迟问题,旨在提升对话自然度,推动实时语音AI应用落地。
-
谷歌推出Gemini 3.8 Live及扩展思考版,强化实时语音交互
谷歌推出Gemini 3.8 Live及扩展思考版,前者强化实时语音对话能力,后者面向复杂推理场景,进一步扩展多模态交互与深度思考的产品布局。
-
谷歌Gemini 3.8 Live双模型亮相:语音AI实现边推理边对话
谷歌发布Gemini 3.8 Live双模型,首次实现语音AI边推理边对话,实测得分超越OpenAI与SpaceXAI。该技术将推动语音交互进入低延迟、高理解的新阶段,微软等平台或跟进。
-
谷歌发布Gemini 3.8 Live与扩展思考版,实时语音交互再升级
谷歌推出Gemini 3.8 Live及扩展思考版,前者强化实时语音对话,后者提升复杂推理能力。此举加剧AI助手竞争,推动多模态交互与深度思考融合。
-
谷歌Gemini 3.8 Live亮相:语音AI迈入实时推理新阶段
谷歌推出Gemini 3.8 Live,实现语音对话中边推理边响应,显著降低交互延迟。该升级可能推动语音助手、客服等场景变革,并加剧与微软、AWS等厂商的大模型竞争。
-
谷歌发布两款实时对话模型,97种语言自动切换与推理能力成焦点
谷歌推出Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,前者主打规模部署与成本优化,后者强化多步推理,支持97种语言自动检测切换,并已在多平台开启推送。
-
谷歌推出Gemini 3.8 Live语音模型,实现边说边想实时推理
谷歌发布原生语音大模型Gemini 3.8 Live及扩展推理版本,首次在低延迟语音流中实现多步推理,即日起通过API和AI Studio开放。
-
OpenAI开放GPT-Live-1语音模型API,每分钟0.05美元切入实时交互市场
OpenAI将ChatGPT语音功能背后的GPT-Live-1模型开放给开发者,该模型采用全双工架构,支持实时听取与回应,语音前端定价每分钟0.05美元,后台推理模型另行计费。
-
OpenAI 将 GPT-Live-1 推向 API 市场,实时语音交互迎来全双工新阶段
OpenAI 宣布 GPT-Live-1 正式登陆 API,支持全双工对话、打断处理与电话智能体。前端语音层每分钟 0.05 美元,早期测试中误打断减少近 80%,代码量缩减 80%。
-
GPT-Live架构解析:OpenAI如何实现连续语音交互的低延迟与状态管理
OpenAI发布GPT-Live工程报告,详述实时媒体路径与异步逻辑分离、会话级有状态推理及上下文迁移机制,并基于WebRTC优化连接启动。InfoQ专访揭示架构权衡与静默测试发现的问题,为实时AI系统设计提供参考。