OpenAI扩大实时语音模型能力:GPT-Live-1上线API

发布时间:2026-09-11 12:46

  GPT-Live-1 还支持电话场景,可用于预订餐厅、客户服务等全双工语音智能体。OpenAI 表示,开发者可以将其与 Codex 等工具连接,也可以通过 OpenAI Presence 开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。

  据介绍,GPT-Live-1 将语音理解与语音输出整合在同一模型中,减少传统“语音转文字 — 大语言模型 — 文字转语音”的多次衔接,从而降低延迟。模型还支持将复杂推理和工具调用交由后端文本模型处理。

  OpenAI 表示,GPT-Live-1 支持原生语音识别转写和回复文本,并具备字母数字理解、关键词偏置及轮次检测能力。

  在早期评估中,语言学习平台 Speak 使用 GPT-Live-1 后,学习者思考停顿期间的误打断次数较此前基于轮次的系统减少近 80%。医疗服务平台的联合创始人兼首席技术官 Tony Stoyanov 表示,其团队将代码量减少了 80%,删除约 2.3 万行代码。

  目前,GPT-Live-1 已在 API 中提供,前端语音层价格为每分钟 0.05 美元。按每小时 60 分钟计算,单纯前端语音层的费用约为 3 美元,后端模型和智能体工具的费用另行计算。

排行

精选