快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期五 · 09-11 08:28 约 1 分钟读完

OpenAI 向 API 开放 GPT-Live-1 实时语音模型,支持全双工打断与电话智能体

摘要

OpenAI 于 9 月 11 日将 GPT-Live-1 引入 API,开发者可构建全双工实时语音应用。该模型整合语音理解与输出,支持打断处理、工具调用及电话场景,早期评估中误打断减少近 80%,有团队代码量缩减 80%。

OpenAI 在 9 月 11 日宣布,将实时语音模型 GPT-Live-1 正式引入 API,面向开发者开放。这意味着开发者可以基于该模型构建支持实时语音交互的应用与业务流程,而不再局限于文本层面的调用。

从技术架构看,GPT-Live-1 采用全双工对话设计,能够同时听取和输出语音,并在对话中处理打断、停顿及背景噪声。它将语音理解与语音输出整合进同一模型,替代了传统“语音转文字—大语言模型—文字转语音”的多次衔接流程,从而降低延迟。对于复杂推理和工具调用,模型支持交由后端文本模型处理。

在功能层面,GPT-Live-1 支持电话场景,可用于预订餐厅、客户服务等全双工语音智能体。开发者可将其与 Codex 等工具连接,也能通过 OpenAI Presence 开发查询企业系统、执行获批操作并在必要时转交人工的语音工作。模型还具备原生语音识别转写与回复文本、字母数字理解、关键词偏置及轮次检测能力,并允许通过系统提示词调整语气、语速和对话风格,配置后端模型、工具及智能体框架。

早期评估数据提供了落地参考。语言学习平台 Speak 使用 GPT-Live-1 后,学习者思考停顿期间的误打断次数较此前基于轮次的系统减少近 80%。医疗服务平台的联合创始人兼首席技术官 Tony Stoyanov 表示,其团队将代码量减少了 80%,删除约 2.3 万行代码。这些案例显示,该模型在降低交互延迟和简化工程实现方面具备实际效果。

OpenAIGPT-Live-1实时语音API
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词