2026년 8월 14일 · 4² AI 뉴스레터
GPT-5.6로 구축하는 AI 에이전트의 혁신 가이드
OpenAI
파이랩 정리
GPT‑5.6: 가격 대비 성능의 새로운 기준
GPT‑5.6 모델 패밀리는 최첨단 에이전트 성능을 더욱 저렴하게 제공하며, 동시에 가능한 것의 경계를 확장합니다. 이 가이드에서는 스타트업들이 더 스마트한 모델 선택과 새로운 API 제어를 사용하여 추론 지속성, 다중 에이전트 조정, 프로그래밍 도구 호출을 통해 더 빠르고 능력 있는 에이전트를 구축하는 방법을 설명합니다. 이 모든 것이 비용의 일부만으로 가능합니다.
향상된 기본 제공 경험
GPT‑5 이후, 각 모델 세대는 더 적은 토큰으로 장기적인 작업을 처리하려고 노력해왔습니다. GPT‑5.6은 이 궤적을 계속 이어가며, 더 강력한 에이전트 성능과 낮은 비용을 최소한의 하네스 변경으로 제공합니다. 비용 효율성의 개선은 낮은 추론 노력에서도 정확도가 증가하면서 더욱 두드러집니다. 예를 들어, GPT‑5.6 Sol은 '낮은' 추론에서 GPT‑5.5의 '높은' 추론을 능가했습니다. 스타트업들은 이전 기본값에서 추론 노력을 줄임으로써 다양한 워크플로우에서 상당한 비용 개선을 보고하고 있습니다.
모델 선택
역사적으로, 가장 높은 추론을 제공하는 플래그십 모델로 업그레이드하는 것이 장기적인 사용 사례에 가장 좋은 옵션이었습니다. 이는 주로 이러한 모델들이 더 긴 컨텍스트와 도구 호출을 처리하는 데 있어 비용 최적화 모델보다 훨씬 더 능력이 있었기 때문입니다. 그러나 5.6 패밀리에서는 테스트 시 더 많은 컴퓨팅을 통해 Luna와 Terra가 GPT‑5.4 및 5.5와 유사한 성능을 제공하면서도 훨씬 저렴합니다.
- BrowseComp에서의 작업을 고려해보세요. 이 검색 기반 벤치마크는 모델의 희귀 사실 검색 능력을 테스트합니다. 3개월 전, GPT‑5.5 (Extra High)는 이 벤치마크에서 84.36%를 기록했으며 총 비용은 $33.27이었습니다. 출시 당시, GPT‑5.6 Luna (Extra High)는 84.04%의 성능을 $1.33의 비용으로 제공합니다. 이후 가격을 더 인하했습니다.
- 5.6 패밀리의 작은 모델들은 대량 작업, 지연 민감 상호작용 및 에이전트 워크플로우 내 반복 단계에 적합합니다. 예를 들어, 법률 기술 스타트업이 에이전트 분석 전에 손으로 쓴 메모를 파싱한다면, 전체 사용 사례에 프론티어 모델을 사용하는 대신 Terra 또는 Luna를 사용하여 추출하고 상당한 비용 절감을 얻을 수 있습니다.
효율적인 에이전트 설계를 위한 Responses API의 진화
GPT‑5.6의 기본 성능을 향상시키는 것 외에도, 추가적인 이득을 얻기 위해 Responses API에 새로운 프리미티브를 도입했습니다. GPT‑5.6은 에이전트가 더 효율적으로 작동할 수 있도록 하는 세 가지 보완적인 아키텍처 개입으로 엔드 투 엔드로 훈련되었습니다.
- 이미 수행된 작업 재사용: 모델 턴 간에 추론을 지속하고 긴 대화를 압축하는 네이티브 컴팩션을 사용하여, 모델은 긴 작업 지평에서 혼란스럽지 않고 일관성을 유지할 수 있습니다.
- 적절한 경우 병렬 분해: 네이티브 다중 에이전트 조정을 사용하여 여러 에이전트를 병렬 작업 스트림에서 조정하여 복잡한 작업을 더 빠르게 완료할 수 있습니다.
- 결정론적 작업을 코드로 이동: 프로그래밍 도구 호출을 사용하여 모델의 컨텍스트 창 외부에서 도구 출력을 필터링, 집계 및 조정하여 판단을 위한 모델 토큰을 예약하고 비용, 지연 및 컨텍스트 손실을 줄입니다.
이들을 함께 사용하면 차이가 극적일 수 있습니다. 예를 들어, ARC-AGI-3에서 GPT‑5.6 Sol은 표준 하네스로 13.3%를 기록했습니다. 그러나 유지된 추론과 압축을 활성화한 후, 점수는 38.3%로 뛰어올랐으며, 출력 토큰은 약 6배 적게 사용되었습니다. 모델 변경 없이 성능이 거의 세 배 향상되었습니다.
프로그래밍 도구 호출
에이전트 워크플로우는 종종 두 가지 유형의 작업을 포함합니다:
- 판단이 필요한 작업
- 주로 데이터를 이동, 필터링 및 결합하는 작업
에이전트가 100개의 서류를 검색하고 날짜별로 필터링하며 관련 거래를 식별할 때, 모델은 컨텍스트 창에서 모든 중간 결과를 추론할 필요가 없습니다. 프로그래밍 도구 호출은 GPT‑5.6이 JavaScript를 작성하여 도구를 조정하고, 독립적인 호출을 병렬로 실행하며, 그 출력을 컨텍스트 창 외부에서 처리할 수 있게 합니다. 모델은 판단을 적용하는 데 집중할 수 있습니다.
다중 에이전트
복잡하고 병렬화 가능한 작업에서는 여러 에이전트 작업 스트림에 작업과 추론을 분산시켜 더 빠른 작업 완료와 더 높은 지능을 달성할 수 있습니다. 이러한 설정에서 주 에이전트는 하위 에이전트를 조정하고 작업을 위임하는 역할을 합니다. 하위 에이전트는 병렬로 목표를 추구하고 최종적으로 주 에이전트에게 출력을 전달하여 최종 합성을 수행합니다. 팀은 Responses API에서 다중 에이전트를 활성화하여 다중 에이전트를 본격적으로 활용할 수 있습니다. 이는 ChatGPT의 초능력 설정이 작동하는 방식이기도 합니다.
GPT‑5.6은 적절한 하위 에이전트 수와 생성 시점을 잘 파악하고 있지만, 다중 에이전트 행동은 매우 조정 가능합니다. 하위 에이전트를 호출할 시점을 모델에 지시하면 추가 토큰 지출이 더 나은 성능을 가져올 상황에서만 에이전트를 생성할 가능성을 높일 수 있습니다.
프롬프트 캐싱
모델 전체에서 프롬프트 캐시 TTL은 최소 30분으로 연장되었으며, 캐시 중단점은 모델의 컨텍스트 창 내에서 결정론적으로 설정할 수 있습니다. 이를 통해 스타트업은 캐시 적중률을 크게 개선할 수 있었습니다.
캐시 중단점을 설정하는 것 외에도 적절한 프롬프트 캐시 키를 계속 사용하면 이전에 동일한 접두사를 제공한 추론 엔진에 요청이 도달할 가능성이 높아져 지연을 줄일 수 있습니다.
결론
이 예시들에서 두드러지는 점은 에이전트 구축의 경제성이 얼마나 변화했는가입니다. 한때 모든 단계에서 프론티어 모델이 필요했던 사용 사례가 이제는 더 작은 모델을 사용하고, 추론 노력을 조정하며, 효율적인 아키텍처 선택을 통해 비용의 일부만으로 유사하거나 더 나은 결과를 달성할 수 있습니다. 여러분이 무엇을 구축할지 기대됩니다!