OpenAI 上线全双工语音模型 GPT-Live-1,API 定价每分钟 0.05 美元
摘要
OpenAI 在 API 中推出语音模型 GPT-Live-1,支持同时听与说,并可将推理和工具调用委派给 GPT-6 Astra 等后端模型。该模型前端语音层定价为每分钟 0.05 美元,面向开发者开放。
OpenAI 正在把语音交互能力进一步推向开发者。该公司在 API 中正式发布语音模型 GPT-Live-1,其核心特性是支持全双工模式,即在同一时间完成听与说两项任务,而非传统语音方案中轮流进行的半双工流程。
与单纯承担语音识别和合成的方案不同,GPT-Live-1 被设计为前端语音层,可将推理和工具调用等复杂工作委派给后端模型,OpenAI 自家的 GPT-6 Astra 即在其列。这种分层思路意味着语音交互的实时性与后端模型的推理能力可以各自独立演进。
定价方面,GPT-Live-1 前端语音层按每分钟 0.05 美元计费。对希望构建实时语音应用的开发者而言,这一价格提供了明确的成本参照,也反映出 OpenAI 将语音能力作为 API 产品线独立售卖的策略。
目前官方披露的信息集中于模型能力与计费方式,尚未涉及具体的可用区域、并发限制或与既有语音接口的兼容安排。随着全双工语音层进入 API,实时对话类应用的架构选择将多出一个来自 OpenAI 的选项。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗