실습 노트

GPT-5.6 에이전트 비용 최적화: 모델 선택보다 먼저 바꿀 4가지

GPT-5.6 공식 빌더 가이드가 제시한 추론 보존·컨텍스트 압축·병렬 에이전트·프로그램형 도구 호출을 에이전트 설계 순서로 정리합니다.

보일러플레이트GPT-5.6 · AI 에이전트 · 컨텍스트 엔지니어링 · 에이전트 비용

에이전트 비용을 줄일 때 작은 모델로 교체하는 것만 먼저 보면 놓치는 부분이 있습니다. OpenAI의 GPT-5.6 빌더 가이드는 모델 선택과 함께 추론 상태 재사용, 컨텍스트 압축, 병렬 분해, 프로그램형 도구 호출을 설계해야 한다고 설명합니다.

핵심은 모델이 모든 중간 결과를 다시 읽고 판단하게 하지 않는 것입니다. 판단이 필요한 일과 데이터를 옮기고 가공하는 일을 분리하면 비용과 지연 시간을 함께 줄일 여지가 생깁니다.

1. 추론 상태 재사용과 컨텍스트 압축

긴 작업을 매번 처음부터 재구성하면 같은 설명과 도구 결과가 반복해서 컨텍스트에 들어갑니다. GPT-5.6 가이드는 이전 턴의 추론을 보존하고, 긴 대화는 네이티브 compaction으로 압축하는 방식을 제시합니다.

OpenAI API 문서의 서버 측 압축은 입력이 설정한 compact_threshold를 넘을 때 동작합니다. 압축 결과는 다음 턴에 필요한 상태를 전달하지만 사람이 읽는 요약문이 아니라 암호화된 compaction item입니다. 따라서 애플리케이션은 이 항목을 임의로 해석하기보다 문서가 안내한 체이닝 방식으로 그대로 이어야 합니다.

긴 실행 → 임계값 도달 → 컨텍스트 압축 → 필요한 상태 유지 → 다음 단계 실행

이 방식은 긴 코딩 작업이나 여러 단계의 조사처럼 이전 상태가 중요한 흐름에 맞습니다. 짧은 단발성 요청에는 압축 로직 자체가 복잡도만 늘릴 수 있습니다.

2. 병렬화할 수 있는 일만 나눈다

서로 의존하지 않는 작업은 여러 에이전트에 나누고, 마지막에 주 에이전트가 결과를 종합할 수 있습니다. 예를 들어 문서 세 개의 독립적인 사실 확인은 병렬화할 수 있지만, 첫 번째 결과를 읽어야 다음 검색어를 정하는 작업은 순차 흐름에 가깝습니다.

주 에이전트: 작업 분해
  ├─ 하위 에이전트 A: 자료 수집
  ├─ 하위 에이전트 B: 코드 확인
  └─ 하위 에이전트 C: 테스트 실행
주 에이전트: 결과 종합

OpenAI는 멀티 에이전트 동작이 자동으로 결정될 수 있지만, 언제 하위 에이전트를 만들지 지침으로 조정할 수 있다고 설명합니다. 병렬화는 항상 비용을 낮추는 기능이 아닙니다. 하위 호출과 최종 종합에 드는 토큰이 독립 작업의 시간 절약보다 크면 단일 에이전트가 낫습니다.

3. 데이터 가공은 코드로 옮긴다

도구가 반환한 결과를 모델의 컨텍스트에 전부 넣은 뒤 필터와 합계를 맡기면 중간 데이터가 판단 영역을 차지합니다. 프로그램형 도구 호출은 JavaScript 같은 코드로 독립 도구를 실행하고, 결과를 필터·집계한 뒤 모델에는 판단에 필요한 결과만 전달하는 구조입니다.

도구 100회 호출 → 코드로 필터·집계 → 의미 있는 후보만 모델에 전달 → 판단

이 경계는 검색 결과, 로그, 파일 목록, 거래 기록처럼 데이터 양이 커지는 작업에서 특히 중요합니다. 다만 필터 조건 자체가 모호하거나 결과의 의미를 해석해야 한다면 모델의 판단 단계로 남겨야 합니다. 결정론적인 변환과 의미 판단을 같은 층으로 섞지 않는 것이 기준입니다.

4. 캐시와 추론 강도를 함께 조정한다

GPT-5.6 빌더 가이드는 반복되는 프롬프트 접두사를 캐시하고, 작업 난이도에 맞춰 reasoning effort를 조정하는 방법도 다룹니다. 고정된 시스템 지침과 도구 정의가 반복되는 요청이라면 캐시 경계를 일정하게 유지하고 prompt_cache_key를 적절히 사용하는 편이 유리할 수 있습니다.

추론 강도도 모든 단계에서 높게 둘 필요는 없습니다. 문서 분류나 형식 변환처럼 반복적이고 기준이 명확한 단계는 낮은 강도로 실행하고, 최종 판단이나 예외 처리처럼 오류 비용이 큰 단계에 더 많은 추론을 배정하는 방식입니다.

적용 순서

처음부터 네 가지를 모두 켜기보다 다음 순서로 비교하는 편이 안전합니다.

  1. 같은 작업의 성공 조건과 품질 기준 고정
  2. 중간 도구 결과 중 반복·결정론적 가공 구간 표시
  3. 입력·출력 토큰, 시간, 재시도, 사람의 수정 횟수 기록
  4. 컨텍스트 압축 또는 프로그램형 도구 호출을 하나씩 적용
  5. 독립 작업에만 병렬화를 추가하고 종합 품질 확인
  6. 단계별 reasoning effort와 캐시 효과를 별도로 비교

OpenAI 공식 가이드에는 ARC-AGI-3에서 추론 보존과 압축을 적용한 예시가 나오지만, 그 수치를 다른 작업의 비용 절감률로 그대로 옮길 수는 없습니다. 모델, 도구, 입력 길이, 성공 기준이 다르면 결과도 달라집니다.

참고