콘텐츠로 이동

실시간 에이전트 개요

실시간 에이전트

실시간 에이전트를 사용하면 OpenAI 음성-음성 모델을 기반으로 지연 시간이 짧은 음성 인터페이스를 구축할 수 있습니다. SDK는 Realtime API의 멘탈 모델을 그대로 유지하면서 원문 이벤트 흐름을 RealtimeAgent, RealtimeSession 및 전송 헬퍼로 래핑하여 도구, 가드레일, 핸드오프 및 세션 기록을 더 쉽게 다룰 수 있도록 합니다.

내부적으로는 공식 WebRTC를 사용하는 Realtime API, Realtime 대화음성 활동 감지 가이드에서 설명하는 동일한 Realtime 개념이 그대로 적용됩니다. 실시간 에이전트 SDK는 이 API 위에 TypeScript 우선 계층을 추가하므로 전송 및 이벤트 처리를 처음부터 다시 구축하는 대신 제품 로직에 집중할 수 있습니다.

  • 임시 클라이언트 토큰을 사용하는 브라우저 우선 WebRTC 설정
  • 서버 측 WebSocket 및 SIP 전송 옵션
  • 자동 인터럽션(중단 처리) 처리 및 로컬 대화 기록 업데이트
  • 실시간 핸드오프를 통한 다중 에이전트 오케스트레이션
  • 함수 도구, 호스티드 MCP 도구, 승인 및 위임 패턴
  • 실시간 음성 상호작용을 위한 출력 가드레일 및 트레이싱 지원
필요한 작업이동할 페이지
WebRTC와 임시 토큰을 사용하여 브라우저 클라이언트를 안전하게 연결빠른 시작
세션 수명 주기, VAD, 인터럽션(중단 처리), 이미지 입력, 도구 및 기록 이해실시간 에이전트 구축
WebRTC, WebSocket, SIP 및 사용자 지정 전송 방식 중에서 선택전송 방식
Twilio에서 전화 또는 텔레포니 환경 실행Twilio용 Realtime 에이전트
Cloudflare Workers 또는 기타 workerd 런타임에서 연결Cloudflare용 Realtime 에이전트

음성-음성 모델은 사용자 오디오를 직접 처리하므로 매 턴마다 별도의 음성-텍스트 변환, 텍스트 추론 및 텍스트-음성 변환 체인을 구축할 필요가 없습니다. 이를 통해 지연 시간을 줄이고 실시간 애플리케이션에서 인터럽션(중단 처리), 텍스트와 음성의 혼합 입력 및 도구 호출이 훨씬 자연스럽게 느껴지도록 할 수 있습니다.

음성-음성 모델