问题
在 OpenAI realtime/live 语音 API 上构建生产级语音 Agent 的开发者,会在通话中途用 session.instructions.append 注入下一步动作、工具结果和「必说」的法律披露,但该原语不可靠:追加的「say X」指令可能被静默跳过,同时新指令会直接打断模型正在进行的回复。开发者称中途转向是「building real voice agents 最重要的一块原语」,而他们只能靠核对后续轮次转写、在电话层播放固定录音、每个场景跑 30–50 通合成呼叫来人工测算指令遵循率。
目标用户
在 OpenAI realtime/live 语音 API 上构建生产级语音 Agent 的开发者和团队,典型是 AI 电话客服、语音外呼、合规披露类产品(金融、催收、医疗等)的工程团队。属于新兴但增长中的小众开发者群体。
解决方案
一个运行在 realtime 语音 API 与应用之间的「指令保障中间件/SDK」:
- 不打断的指令调度:实现 after_current_utterance 语义,把追加指令排队到当前话语结束后注入,避免切断模型回复;
- 必说内容核验:对后续轮次转写做关键词与语义双重校验,逐条判定 must-say 指令(如法律披露)是否真的被说出;
- 兜底播放:核验失败时触发电话层播放预录固定音频,保证合规内容不会漏说且不被察觉漏说;
- 合成拨测与遵循率报告:一键对每个场景跑批量合成呼叫,输出各指令的遵循率仪表盘,用于上线前回归测试。 AI 在其中承担语义校验(判断「说了没有」)与失败日志的归类分析。
为什么是现在
gpt-live-1 等实时语音 API 刚进入生产落地阶段,开发者开始在真实通话里依赖中途追加指令(工具结果、下一步、法律披露),而平台侧尚无 interrupt: false 这类不打断的投递模式,缺口在生产环境被集中暴露,信号中官方也确认了这是「重要的生产用例」,说明问题真实且当前无官方解。
MVP 范围
第一版:一个可嵌入 Node.js/Python 语音 Agent 的 SDK,包含:1) 会话中追加指令的排队与「当前话语结束后注入」调度;2) 基于转写的关键词+语义校验,判定每条必说指令是否在后续轮次被说出;3) 校验失败时通过电话层播放预录音频兜底,并记录失败日志。明确不做:自己的语音模型、不做 UI 式呼叫后台、不支持 OpenAI realtime 之外的平台。
风险
平台依赖是最大风险:整个机会建立在 OpenAI realtime API 的一个缺口上,官方一旦补上 interrupt: false 和可靠的 append(信号显示官方已在回应这类建议),产品价值可能一夜归零。其次是与官方语义校验能力的竞争,以及法律披露兜底场景的准确率要求极高,误报/漏报都可能让客户失去信任。建议定位为跨平台语音 Agent 的中间层而非 OpenAI 专属补丁。
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
OpenAI 开发者社区 · API9月30日功能请求▲ 0
“Your suggestion for something like: interrupt: false or mode: “after_current_utterance” would address an important production use case: allowing developers to provide new instructions during a call without abruptly cutting off the current response.”
开发者在实时语音 Agent 会话中途追加指令时,模型会打断当前正在进行的回复,缺少一种不打断的追加指令方式。原文
OpenAI 开发者社区 · API9月30日痛点▲ 0
“until append is reliable, here’s how I’d make sure a missed instruction can’t go unnoticed on a live call”
Appended "say X" instructions in live voice API calls are unreliable and may be silently skipped, which is critical for must-say content like legal disclosures.原文
OpenAI 开发者社区 · API9月30日功能请求▲ 32 条评论隐含付费意愿
“This is the most important primitive for building real voice agents. We use it to steer the model mid-call with tool results, next steps, and required disclosures.”
session.instructions.append is unreliable for steering voice agents mid-call, and it interrupts the model mid-speech with no non-interrupting delivery mode原文