OpenAI Agents API 공개 베타, Codex 하네스를 API로 쓰는 조건

한눈에 결론

  • 2026년 9월 10일 OpenAI는 OpenAI Agents API를 공개 베타로 열었습니다. Codex가 쓰던 에이전트 하네스를 관리형 API로 제공하는 제품입니다.
  • API 자체 수수료는 없습니다. 선택한 모델 토큰, 내장 도구, OpenAI 호스티드 샌드박스의 컨테이너 요금만 냅니다.
  • 공식 문서 기준 데이터 레지던시는 미국만 지원하고, Zero Data Retention은 지원하지 않습니다. 자체 샌드박스를 붙여도 ZDR이 되지는 않습니다.
  • 긴 세션, 컨텍스트 압축, 서브에이전트, MCP, 코드 실행이 필요한 팀에 맞습니다. 루프와 상태를 앱 안에서 직접 통제해야 하면 Agents SDK나 Responses API가 남습니다.
  • 같은 날 GPT-Live-1도 API에 올라왔습니다. 음성 프론트엔드이며 Agents API와는 계층이 다릅니다.

Fact Check

항목 현재 판정 근거
2026-09-10 Agents API 공개 베타 사실 openai.com 공식 발표, 개발자 문서
모든 개발자에게 베타 개방 사실 공식 발표 “available in public beta today to all developers”
API 추가 수수료 없음 사실 공식 발표·개요 문서. 토큰·도구·컨테이너는 별도
데이터 레지던시 미국만 사실 개발자 문서 Agents API overview
ZDR 미지원, 자체 샌드박스로도 해소 불가 사실 같은 공식 문서
고객사 평가 점수 0.71→0.85, 비용 60% 감소 협력업체 주장 공식 발표에 실린 Ciridae·SafetyKit 인용. 독립 검증 아님
일반 이용자가 ChatGPT 앱에서 바로 쓰는 기능 거짓 개발자 API. ChatGPT 소비자 기능이 아님
GPT-Live-1 API 동시 공개, 분당 0.05달러 사실 공식 발표와 모델 카탈로그

확인일: 2026-09-12. 1차 출처는 OpenAI 제품 발표와 developers.openai.com 문서입니다. 고객 인용 수치는 회사 발표문에 실린 협력사 발언입니다.


9월 10일에 열린 것은 새 모델이 아니라 하네스다

이번 주 검색에서 OpenAI Agents API를 찾는 이유는 단순합니다. GPT-6 Astra 다음 모델인가, 아니면 Codex를 앱에 붙이는 방법인가를 가리기 위해서입니다. 공식 발표의 답은 후자입니다. 2026년 9월 10일 OpenAI는 Codex가 이미 쓰던 에이전트 하네스를 관리형 API로 열었습니다.

회사가 말하는 하네스는 모델 그 자체가 아닙니다. 모델 호출, 도구 사용, 컨텍스트 정리, 실패 후 재개, 서브에이전트 조율을 한 루프로 돌리는 운영 계층입니다. 개발자 문서는 이 계층을 “managed Codex harness”라고 적습니다. 앱은 과제와 도구, 실행 환경을 넘기고, OpenAI가 세션을 유지합니다.

핵심 단위는 세 가지입니다. Agent는 모델·지시문·도구·MCP 서버 설정입니다. Environment는 파일을 열고 명령을 실행하는 선택적 샌드박스입니다. Session은 그 설정으로 실제로 일을 이어 가는 지속 세션입니다. 퀵스타트 예시는 모델로 gpt-6-astra를 쓰고, 요청 헤더는 OpenAI-Beta: agents=v1입니다. SDK를 쓰면 헤더는 자동으로 붙습니다.

일반 이용자가 ChatGPT 화면에서 켜는 스위치가 아닙니다. 플랫폼 API 키와 api.agents.read, api.agents.write, 추론용 api.responses.write 권한이 필요합니다. 키는 샌드박스 안에 넣지 말라고 문서가 따로 적습니다.

어두운 책상의 모니터와 노트북, 에이전트 API를 앱에 붙이기 전에 검토하는 개발 환경
Agents API는 앱이 아니라 OpenAI가 에이전트 루프를 돌립니다. 사진은 작업 환경 연출입니다.

Agents API와 Agents SDK, Responses API를 언제 고르나

같은 주 문서에 OpenAI는 세 경로를 표로 나눠 둡니다. 이름이 비슷해서 혼동하기 쉽지만, 루프를 누가 돌리는지가 갈립니다.

구분 루프를 도는 곳 상태가 남는 곳 적합한 경우
Agents API OpenAI 관리형 Codex 하네스 세션 설정·턴·항목을 서비스가 보관 몇 시간~며칠 가는 작업, 재개와 압축이 필요할 때
Agents SDK 내 애플리케이션 내 저장소 또는 SDK 세션 도구·승인·배포를 앱 정책에 맞춰야 할 때
Responses API 내 코드 직접 히스토리 또는 Conversations 모델을 직접 호출하거나 에이전트를 처음부터 짤 때

문서가 에이전트 API에 묶어 둔 기능은 자동 컨텍스트 압축, 멀티에이전트, 프로그램 방식 도구 호출, MCP 서버 연결입니다. 샌드박스는 OpenAI 호스티드, 자체 호스팅, 또는 없음 중에서 고릅니다. 코드 실행이 필요 없는 질의만이면 environment type을 none으로 둘 수 있습니다.

이미 Agents SDK로 루프를 안정화한 팀은 옮겨야 할 이유가 자동으로 생기지 않습니다. 이득은 “세션 복구와 압축을 직접 안 짜도 된다”는 쪽에 있습니다. 대가로 세션 상태가 OpenAI 쪽에 남고, 베타 헤더와 미국 레지던시 제약을 받습니다.

실무에서 자주 섞이는 오해도 세 가지입니다. 첫째, Agents API가 ChatGPT 에이전트 모드를 기업 계정에 풀어 주는 기능이라는 해석입니다. 문서는 플랫폼 API와 베타 헤더를 전제로 합니다. 둘째, 호스티드 샌드박스를 쓰면 데이터가 안 남는다는 해석입니다. 샌드박스는 코드가 도는 자리이고, 세션 상태는 API가 보관합니다. 셋째, gpt-6-astra를 고르면 자동으로 최고 성능이 나온다는 해석입니다. 모델은 Agent 설정의 한 칸일 뿐이고, 도구 권한과 환경이 결과를 더 자주 가릅니다.


요금은 API 수수료가 없고 토큰·도구·컨테이너다

공식 발표는 “Agents API 사용에 대한 추가 요금은 없다”고 적습니다. 개요 문서도 같습니다. 청구 항목은 세 갈래입니다.

  • 모델 토큰: 고른 모델의 기존 API 단가. 문서 예시 모델 gpt-6-astra는 공개 요금표 기준 입력 100만 토큰당 10달러, 캐시 입력 1달러, 출력 50달러입니다. 긴 컨텍스트 구간은 더 높습니다.
  • 내장 도구: 웹 검색, 파일 검색 등 기존 도구 단가.
  • 호스티드 샌드박스: 컨테이너 요금. 요금표는 Hosted Shell·Code Interpreter와 같은 줄을 씁니다. 20분 세션 기준 1GB 0.03달러, 4GB 0.12달러, 16GB 0.48달러, 64GB 1.92달러입니다. 분 단위 청구와 세션당 5분 최소가 적혀 있습니다.

자체 샌드박스나 파트너 환경을 쓰면 컨테이너 줄은 빠지고, 그 인프라 비용은 해당 공급자 쪽으로 갑니다. 모델 토큰은 그대로입니다. 베타라고 토큰이 할인된다는 문구는 없습니다.

비용이 한쪽으로 쏠리는 지점은 토큰보다 긴 세션입니다. 에이전트가 파일을 읽고 명령을 반복하면 출력 토큰과 도구 호출이 같이 늘어납니다. 웹 검색은 요금표 기준 1,000회당 10달러에 검색 내용 토큰이 추가됩니다. 호스티드 컨테이너는 메모리 티어를 올리면 20분 단가가 그대로 배수로 커집니다. 짧은 검증은 1GB로 시작하고, 패키지 설치와 산출물 크기를 본 뒤에 올리는 편이 안전합니다.

견적을 낼 때는 “에이전트 하나”가 아니라 “세션 길이 × 동시 세션 × 도구 횟수”로 보는 것이 맞습니다. 발표문의 Nash.ai 인용처럼 수천 개 에이전트가 몇 시간에서 며칠을 가면, 모델 단가보다 유휴 컨테이너와 재시도가 먼저 보입니다. 반대로 하루 몇 건의 보고서 생성만 있으면 호스티드 쪽이 운영 인력을 줄입니다.

발표문에 실린 고객 수치를 원가로 읽으면 안 됩니다. Ciridae는 평가 점수 0.71에서 0.85, 서브에이전트 지연 4분의 1을 말했고, SafetyKit은 건당 비용 60% 감소를 말했으며, Hypha는 실패 응답 86% 감소를 말했습니다. 모두 공식 페이지에 인용된 협력사 발언입니다. 워크로드가 같다는 독립 측정은 없습니다.

유리 캐비닛 안의 서버 랙이 늘어선 데이터센터 통로, OpenAI 호스티드 샌드박스 개념
호스티드 샌드박스는 OpenAI가 리눅스 작업 공간을 만들고, 자체 샌드박스는 이미지와 네트워크를 직접 고릅니다.

미국 데이터만, ZDR은 샌드박스를 바꿔도 안 된다

개발자 개요 문서의 제한은 짧고 분명합니다. Agents API의 데이터 레지던시는 현재 미국만 지원합니다. Zero Data Retention은 지원하지 않습니다. 자체 샌드박스를 붙여도 ZDR 대상이 되지 않습니다.

이 한 줄이 도입 여부를 가릅니다. EU 또는 한국 리전 처리를 계약으로 못 박은 서비스, 대화·파일·도구 결과를 보관하지 않아야 하는 워크로드는 베타 대상이 아닙니다. 코드만 파트너 VPC에서 돌려도 세션 상태와 하네스 로그는 API 쪽에 남습니다.

호스티드 샌드박스 문서는 작업 디렉터리를 /workspace로 적습니다. Python, Node.js, 명령줄 도구가 있는 리눅스 작업 공간입니다. 패키지 목록을 넣을 수 있고, 네트워크 접근을 끌 수도 있습니다. 자체 이미지, 특정 GPU, 사설망이 필요하면 self-hosted로 넘기라고 안내합니다.

공식 발표가 1차 연동으로 적은 이름은 Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop, Vercel입니다. 관리형 환경, VPC 배포, 파일·시크릿 저장, CPU·GPU·메모리 조합을 고르는 용도입니다. 파트너 이름이 적혀 있다고 해서 각 업체의 한국 리전 지원까지 확인된 것은 아닙니다. 그 부분은 해당 공급자 문서를 따로 봐야 합니다.

스위치에 꽂힌 여러 색 이더넷 케이블, 에이전트가 도구와 외부망에 연결되는 구조 개념
도구와 MCP, 샌드박스 네트워크 권한은 세션 설정에서 나뉩니다. 사진은 네트워크 장비입니다.

누구에게 필요하고, 굳이 지금 넣을 필요는 없는가

맞는 팀부터 보면 이렇습니다. 이미 Codex 방식으로 코드를 돌리고, 같은 루프를 제품 백엔드에 옮기려는 개발 조직. 세션이 몇 시간을 넘기고, 중간에 끊겨도 이어서 파일을 만들어야 하는 지원·물류·리서치 워크플로. 서브에이전트로 일을 나눈 뒤 결과를 한곳에 모으고 싶은 소규모 팀. 이 경우에는 오케스트레이션을 직접 유지하는 비용이 베타 리스크보다 클 수 있습니다.

지금 넣지 않는 편이 나은 경우도 분명합니다. 개인정보·결제·의료처럼 ZDR 또는 미국 외 처리가 계약 조건인 서비스. 승인 게이트와 감사 로그를 자사 IAM에만 두고 싶은 보안 조직. 모델만 바꾸고 루프는 이미 SDK로 안정된 팀. 챗봇 한 턴을 음성으로 바꾸고 싶은 기획. 마지막 경우는 아래 GPT-Live-1이 더 가깝습니다.

조건 Agents API를 보는 쪽 SDK·직접 구현에 남는 쪽
작업 길이 몇 시간~며칠, 재개가 필요 짧은 요청-응답
데이터 처리 미국 처리가 계약상 가능 EU·한국 리전 또는 ZDR 필수
운영 인력 오케스트레이션을 직접 유지하기 부담 루프·감사를 이미 갖춤
실행 환경 호스티드 또는 파트너 샌드박스로 충분 특수 이미지·망분리 필수
제품 단계 내부 파일럿·비민감 워크로드 규제 대상 상용 경로

한국에서 바로 막히는 조건도 문서에 있습니다. 개인정보 국외 이전 동의와 처리 위탁 범위를 계약서에 미국만으로 적을 수 있는지, 로그에 고객 파일 내용이 남는지, 삭제 요청이 세션·산출물·도구 캐시까지 덮는지입니다. 이 세 칸을 내부에서 답하지 못하면 데모 이상으로 올리지 않는 것이 맞습니다.

베타에서 먼저 확인할 항목은 다섯입니다.

  1. 대상 워크로드의 데이터가 미국 처리로 계약·내부 규정에 걸리는지.
  2. 세션 보관 기간과 삭제 API를 운영 절차에 넣을 수 있는지.
  3. 호스티드 컨테이너 최소 5분과 메모리 단가가 작업 길이에 맞는지.
  4. 도구 권한을 읽기/실행/네트워크로 나눠 켰는지. API 키가 샌드박스에 들어가지 않는지.
  5. 실패 시 Agents SDK로 되돌릴 경로를 남겨 뒀는지.

같은 날 열린 GPT-Live-1 API는 별개 계층이다

같은 9월 10일 OpenAI는 GPT-Live-1을 API에 올렸습니다. ChatGPT 음성에 쓰이던 전이중 음성 모델을 앱에 붙이는 프론트엔드입니다. 들으면서 말하고, 끼어들기를 한 모델이 처리합니다. 깊은 추론과 도구 호출은 백엔드 모델이나 에이전트에 넘깁니다.

공식 가격은 음성 계층 분당 0.05달러, 초 단위 청구입니다. 백엔드 모델과 도구는 따로 계산됩니다. 모델 카탈로그는 이미지·영상을 지원하지 않고, 동시 세션 한도는 티어별로 25에서 500입니다. Free 티어는 지원하지 않습니다.

회사 발표 기준 Full Duplex Bench에서 GPT-Realtime-2.1 대비 30%포인트 향상이 있고, gpt-6-astra 중간 추론과 짝을 이루면 Tau3에서 1위라고 적었습니다. 개발자 포럼 안내에는 Tau3 첫 시도 83.6% 대 이전 모델 45.7%, 턴 전환 0.798초 대 1.41초가 나옵니다. 모두 회사 또는 포럼에 게시된 수치입니다.

음성 상담 앱을 만드는 일과, 며칠 가는 코드·파일 에이전트를 돌리는 일은 같은 제품이 아닙니다. 음성이 필요하면 Live 세션을 앞에 두고, 긴 작업이 필요하면 Agents API 세션을 뒤에 두는 식의 조합은 문서가 안내하는 위임 구조와 맞습니다. 다만 Live가 Agents API 베타 제약을 없애 주지는 않습니다.


베타에서 확인하고 나서 결정할 일

공개 베타는 모든 개발자에게 열려 있습니다. 일반 제공 일정은 발표문에 없습니다. 피드백을 받아 GA로 간다는 수준입니다. 헤더와 엔드포인트가 베타인 만큼, 필드명과 권한 범위는 바뀔 수 있다고 보는 편이 맞습니다.

실무 순서는 짧습니다. 기밀이 아닌 과제로 호스티드 샌드박스 세션을 하나 띄워 토큰과 컨테이너 청구를 확인합니다. 그다음 자체 또는 파트너 샌드박스로 같은 과제를 한 번 더 돌려 네트워크와 시크릿 경로를 봅니다. 미국 처리와 보관이 통과되면 내부 도구 권한을 최소로 열고, 통과되지 않으면 SDK에 남깁니다.

흔한 실패는 권한을 넓힌 채로 데모를 시작하는 것입니다. 네트워크를 연 호스티드 환경에 고객 원본을 넣고, 웹 검색과 MCP를 한꺼번에 켜면 어디서 데이터가 나갔는지 나중에 재구성하기 어렵습니다. 문서 예시처럼 합계를 구하는 로컬 CSV부터 시작하고, 외부 호출은 도구 단위로 추가하는 순서가 사고 범위를 줄입니다.

관찰도 미리 정해야 합니다. 세션 이벤트 스트림에서 도구 호출, 서브에이전트 분기, 압축 시점을 남기지 않으면 비용과 실패 원인을 같은 로그에서 볼 수 없습니다. 베타 단계에서는 성공 여부보다 “한 세션이 무엇을 호출했고 어디에 파일을 남겼는가”를 재현할 수 있는지가 더 중요합니다.

모델 성능 발표를 에이전트 인프라 발표로 읽으면 선택이 빗나갑니다. 9월 10일 글의 핵심은 gpt-6-astra의 벤치마크가 아니라, 루프와 상태를 어디에 둘지입니다.

0 0 votes
Article Rating
Subscribe
Notify of
guest
0 Comments
Oldest
Newest Most Voted
0
Would love your thoughts, please comment.x
()
x