🤖 기술·AI4분 읽기

OpenAI 웹소켓 도입, AI 코딩 에이전트 40% 빨라지다

OpenAI가 Responses API에 웹소켓 모드를 도입해 AI 코딩 에이전트의 응답 속도를 최대 40% 개선했다. 초당 1,000토큰을 넘어 4,000토큰까지 도달하며, Codex·Cursor·Cline 등 주요 코딩 도구가 즉시 혜택을 받고 있다.

GSEEK AI조회 7

AI 코딩 에이전트, 속도의 벽을 넘다

OpenAI가 자사 Responses API에 WebSocket(웹소켓) 모드를 정식 도입했다. 핵심은 AI 코딩 에이전트가 작업을 수행할 때 발생하는 수십 번의 API 왕복 호출을 영구 연결(persistent connection) 방식으로 전환해, 전체 작업 시간을 최대 40% 단축한 것이다.

기존에는 에이전트가 코드를 분석하고, 파일을 읽고, 수정하고, 테스트를 실행하는 매 단계마다 새로운 HTTP 요청을 보내야 했다. 대화 이력 전체를 매번 재전송하고 재처리하는 구조적 비효율이 있었다. 모델 추론(inference) 속도가 빨라질수록 이 API 오버헤드가 병목으로 부각됐다.

기술적 해법: 연결 유지 + 상태 캐싱

왜 WebSocket인가

OpenAI 팀은 gRPC 양방향 스트리밍과 WebSocket을 비교 검토한 끝에 WebSocket을 선택했다. 이유는 단순하다. 개발자가 기존 Responses API의 입출력 형식을 그대로 사용할 수 있어 통합 비용이 최소화되기 때문이다.

WebSocket 연결이 유지되는 동안 서버는 **연결 범위 인메모리 캐시(connection-scoped in-memory cache)**에 이전 응답 상태를 보관한다. 후속 요청에서 previous_response_id를 전달하면, 전체 대화를 재구성하는 대신 캐시된 상태를 즉시 불러온다.

캐시되는 항목

  • 이전 응답 객체 및 입출력 항목
  • 도구 정의(Tool definitions)와 네임스페이스
  • 이미 렌더링된 토큰(tokenization 재처리 생략)
  • 모델 라우팅 로직

이를 통해 안전성 분류기(safety classifier)와 요청 검증기가 새로 추가된 입력만 처리하게 되었고, 빌링 같은 비차단 후처리 작업은 다음 요청과 병렬 실행된다.

성능 결과: 초당 1,000토큰 돌파

기존 GPT-5, GPT-5.2 모델은 초당 약 65토큰(TPS)이었다. 새로운 GPT-5.3-Codex-Spark 모델은 Cerebras 전용 하드웨어와 WebSocket 최적화가 결합되어 초당 1,000TPS를 달성했고, 피크 시에는 4,000TPS까지 기록했다.

실제 프로덕션 환경에서 확인된 개선 수치는 다음과 같다.

서비스개선 폭
Codex 에이전트전체 작업 최대 40% 단축
Vercel AI SDK지연 시간 최대 40% 감소
Cline 멀티파일 워크플로39% 빨라짐
Cursor 내 OpenAI 모델최대 30% 빨라짐

교육 분야에 미치는 영향

코딩 학습 환경의 질적 변화

AI 코딩 에이전트의 속도 향상은 단순한 편의 개선이 아니다. **학습 피드백 루프(feedback loop)**가 빨라진다는 의미다. 학생이 코드를 작성하고 AI에게 리뷰나 디버깅을 요청할 때, 응답까지 수 분씩 기다리던 것이 수십 초 단위로 줄어든다. 이는 시행착오 기반 학습에서 **몰입(flow state)**을 유지하는 데 결정적이다.

에이전트 기반 교육 도구의 가능성

이번 발표에서 주목할 점은 WebSocket 모드가 에이전트 워크플로 전반에 적용된다는 것이다. 코딩 에이전트뿐 아니라, 파일을 읽고 → 분석하고 → 피드백을 생성하는 모든 다단계 AI 작업이 혜택을 받는다. 교육용 AI 튜터가 학생의 프로젝트 전체를 스캔하고 맞춤형 피드백을 주는 시나리오에서, 이 속도 향상은 실시간 대화형 교육을 현실적으로 만든다.

학생 활용법

Cursor, Cline 같은 AI 코딩 도구를 사용 중이라면 최신 버전으로 업데이트하는 것만으로 WebSocket 모드의 속도 향상을 체감할 수 있다. 코딩 프로젝트에서 AI 에이전트에게 멀티파일 리팩토링이나 테스트 생성을 맡기는 실습을 해보면, 에이전트 기반 개발 워크플로를 직접 경험할 수 있다.

앞으로의 방향

OpenAI는 이번 WebSocket 모드를 "Responses API 출시 이후 가장 중요한 신규 기능"으로 평가했다. 모델 추론 속도가 계속 빨라지는 상황에서, 추론을 둘러싼 인프라 계층의 최적화가 사용자 체감 성능을 좌우한다는 점을 보여준 사례다. 아이디어에서 프로덕션 배포까지 단 몇 주 만에 이뤄졌다는 점도, API 팀과 Codex 팀의 긴밀한 협업 모델로서 주목할 만하다.

#OpenAI#AI 코딩#WebSocket#개발자 도구#에이전트 AI

출처

공유

관련 글

댓글

댓글은 관리자 승인 후 공개됩니다. 닉네임과 비밀번호를 입력해주세요. 비밀번호는 수정/삭제 시 필요합니다 (10자 이내).

불러오는 중...

0/500