跳转到内容

实时智能体概述

实时智能体

实时智能体支持基于 OpenAI 语音到语音模型构建低延迟语音界面。SDK 保留了 Realtime API 的心智模型,同时使用 RealtimeAgentRealtimeSession 和传输辅助工具封装原始事件流,让工具、护栏、交接和会话历史记录更易于使用。

底层仍然采用官方 通过 WebRTC 使用 Realtime API实时对话语音活动检测指南中的 Realtime 概念。实时智能体 SDK 在该 API 之上增加了 TypeScript 优先层,让您能够专注于产品逻辑,而不必从头构建传输和事件处理机制。

  • 面向浏览器的 WebRTC 设置,使用临时客户端令牌。
  • 服务器端 WebSocket 和 SIP 传输选项。
  • 自动处理中断并更新本地对话历史记录。
  • 通过实时交接实现多智能体编排。
  • 支持函数工具、托管 MCP 工具、审批和委派模式。
  • 为实时语音交互提供输出护栏和追踪支持。
如果您需要…请前往
使用 WebRTC 和临时令牌安全地连接浏览器客户端快速开始
了解会话生命周期、VAD、中断、图像输入、工具和历史记录构建实时智能体
在 WebRTC、WebSocket、SIP 和自定义传输之间进行选择传输机制
在 Twilio 上运行电话或电信应用体验Twilio 上的实时智能体
从 Cloudflare Workers 或其他 workerd 运行时进行连接Cloudflare 上的实时智能体

语音到语音模型直接处理用户音频,因此无需为每轮交互分别构建语音转文本、文本推理和文本转语音链路。这可以降低延迟,并让中断、文本与语音混合输入以及工具调用在实时应用中显得更加自然。

语音到语音模型