实时智能体概述

实时智能体支持基于 OpenAI 语音到语音模型构建低延迟语音界面。SDK 保留了 Realtime API 的心智模型,同时使用 RealtimeAgent、RealtimeSession 和传输辅助工具封装原始事件流,让工具、护栏、交接和会话历史记录更易于使用。
底层仍然采用官方 通过 WebRTC 使用 Realtime API、实时对话和语音活动检测指南中的 Realtime 概念。实时智能体 SDK 在该 API 之上增加了 TypeScript 优先层,让您能够专注于产品逻辑,而不必从头构建传输和事件处理机制。
快速开始 使用 OpenAI Agents SDK,在几分钟内构建您的第一个实时语音助手。
构建实时智能体 了解 SDK 中的会话生命周期、VAD、中断、多模态输入、工具和历史记录的工作方式。
传输机制 在 WebRTC、WebSocket、SIP 或自定义传输之间进行选择,并了解何时需要下沉到原始事件层。
SDK 增强功能
Section titled “SDK 增强功能”- 面向浏览器的 WebRTC 设置,使用临时客户端令牌。
- 服务器端 WebSocket 和 SIP 传输选项。
- 自动处理中断并更新本地对话历史记录。
- 通过实时交接实现多智能体编排。
- 支持函数工具、托管 MCP 工具、审批和委派模式。
- 为实时语音交互提供输出护栏和追踪支持。
| 如果您需要… | 请前往 |
|---|---|
| 使用 WebRTC 和临时令牌安全地连接浏览器客户端 | 快速开始 |
| 了解会话生命周期、VAD、中断、图像输入、工具和历史记录 | 构建实时智能体 |
| 在 WebRTC、WebSocket、SIP 和自定义传输之间进行选择 | 传输机制 |
| 在 Twilio 上运行电话或电信应用体验 | Twilio 上的实时智能体 |
| 从 Cloudflare Workers 或其他 workerd 运行时进行连接 | Cloudflare 上的实时智能体 |
语音到语音的优势
Section titled “语音到语音的优势”语音到语音模型直接处理用户音频,因此无需为每轮交互分别构建语音转文本、文本推理和文本转语音链路。这可以降低延迟,并让中断、文本与语音混合输入以及工具调用在实时应用中显得更加自然。
