7월 30일 (목) 뉴스 보기

2026년 7월 30일 · 4² AI 뉴스레터

GPT-5.6, 효율과 지능의 최전선 융합

OpenAI

파이랩 정리

GPT-5.6: 최전선의 지능과 효율성 융합

GPT-5.6 모델 패밀리는 다양한 작업에서 능력과 비용을 균형 있게 조정하기 위해 설계되었습니다. 주력 모델인 GPT-5.6 Sol은 인공지능 분석 코딩 에이전트 지수에서 Claude Fable 5보다 뛰어난 성능을 보이며, 비용은 절반 이하입니다. Terra는 지능 벤치마크에서 GPT-5.5와 동일한 성능을 보이면서도 가격은 절반이며, Luna는 가장 빠르고 저렴한 모델로 Sol의 비용보다 80% 저렴합니다. 이러한 효율성을 제공하기 위해 연구 및 기술 팀은 스택의 모든 주요 계층에서 상당한 최적화를 이루었습니다. 이러한 개선 사항은 모델, 추론(모델을 실행하여 출력을 생성하는 방법), 그리고 Codex와 ChatGPT Work에서 사용하는 에이전틱 하네스에 걸쳐 있습니다.

지난 4년 동안 10억 명의 활성 사용자와 200만 개 이상의 기업으로 모델을 확장하면서 효율성은 지능의 혜택을 모두에게 배포하는 데 중심이 되었습니다. 우리의 사명은 인공지능이 인류 전체에 이익이 되도록 하는 것입니다. 이러한 기간 동안 우리는 스택 전반에 걸쳐 더 큰 최적화를 지속적으로 해제하여 비용-지능 곡선의 모든 지점에서 가장 성능이 뛰어난 모델을 제공하고자 했습니다. 우리는 GPT-5.6을 통해 토큰당 가장 높은 지능 효율성을 달성했습니다. 이 모델은 토큰당 더 많은 작업을 수행하도록 훈련되었습니다. 훈련 과정에서 우리는 작업 성공과 효율성을 모두 최적화하여 모델이 작업을 수행하는 데 더 직접적인 경로를 따르도록 형성했습니다.

이 글에서는 모델을 넘어 스택의 두 가지 주요 부분에서 효율성을 설계한 방법을 공유합니다. 첫 번째는 추론으로, 로드 밸런싱, 추측 디코딩, 캐싱, 커널 최적화와 같은 프로세스를 최적화하여 동일한 하드웨어에서 더 많은 출력을 얻는 방법입니다. 두 번째는 에이전틱 하네스로, 컨텍스트 팽창 관리, 도구 사용, 반복 작업을 더 잘 관리하는 방법입니다. 또한 GPT-5.6 Sol이 이러한 이득을 자율적으로 달성하는 데 어떤 역할을 했는지도 공유할 것입니다. 개별적인 개선이 제한적으로 보일 수 있지만, 이러한 승리는 지능과 효율성의 최전선에서 성과를 제공할 수 있게 해줍니다.

GPT-5.6 Sol을 통한 추론 가속화

모델 수요가 용량보다 빠르게 증가하는 컴퓨팅 제한 세계에서 효율성은 모든 시스템 설계의 핵심입니다. 이는 특히 훈련된 모델을 실행하여 응답을 생성하는 추론 스택에서 더욱 그렇습니다. 우리의 주요 목표는 동일한 하드웨어로 더 많은 토큰을 제공하면서 사용자들이 기대하는 지능, 지연 시간, 가용성, 신뢰성을 유지하는 것입니다.

이를 달성하려면 전체 시스템을 최적화해야 합니다. 모델이 독립적으로 매우 효율적일 수 있지만, 요청이 잘못 분배되거나 하드웨어가 유휴 상태이거나 데이터 이동이 계산을 느리게 하면 여전히 비용이 많이 들 수 있습니다. 모든 계층에서의 개선은 누적되며, 라우팅(요청이 보내지는 위치), 스케줄링(요청이 보내지는 시간), 커널(GPU에서 실행되는 소프트웨어), 캐싱(저장 및 재사용 작업), 모델 구현(GPU 코드의 순서)에서의 최적화에서 이득이 발생합니다. Codex의 GPT-5.6 Sol은 이러한 모든 최적화에서 중요한 역할을 했습니다.

첫 번째 중요한 예는 로드 밸런싱입니다. 전 세계적으로 우리는 지리, 가용 용량, 가속기 유형(모델을 실행하는 GPU 또는 특수 칩 유형)과 같은 요소를 기반으로 요청을 라우팅합니다. 클러스터 내에서는 로드, 컨텍스트 길이, 캐시 가용성, 기타 요청 속성을 기반으로 모델 인스턴스 간에 작업을 분배합니다. 각 인스턴스 내에서는 가속기, 모델의 서브 네트워크, 컴퓨팅 코어 간에 작업을 효율적으로 분할해야 합니다. Codex의 GPT-5.6 Sol은 생산 트래픽을 분석하고, 이전에 간과된 불균형의 원인을 식별하고, 새로운 라우팅 전략을 테스트하며, 이러한 휴리스틱을 지속적으로 조정하는 데 도움을 줍니다. 이러한 로드 밸런싱 개선만으로도 모델 제공 비용을 크게 줄였습니다.

또한 우리는 GPT-5.6 Sol을 사용하여 모델의 전방 패스를 최적화했습니다. 이는 입력을 다음 토큰 예측으로 변환하는 계산입니다. 개별 작업이 빠르더라도 과도한 메모리 이동, 동기화, 비효율적인 데이터 레이아웃은 GPU를 유휴 상태로 만들 수 있습니다. 이를 피하기 위해 GPT-5.6 Sol은 사전 계산할 수 있거나 피할 수 있거나 병렬화할 수 있는 작업을 찾았습니다. Codex와 함께 GPT-5.6 Sol은 생산 커널을 자율적으로 다시 작성하고 최적화했습니다. 이는 모델을 구성하는 수학적 작업을 실행하는 핵심 코드입니다. 이는 부분적으로 우리가 GPT-5.6을 TritonGluon이라는 두 개의 오픈 소스 GPU 프로그래밍 언어에서 커널을 작성하고 개선하는 데 효과적이도록 훈련했기 때문에 가능했습니다. 이러한 노력은 GPT-5.6 Sol의 더 넓은 커널 발전과 결합되어, 종단 간 제공 비용을 20% 줄였습니다. 우리는 또한 GPT-5.6 Sol이 작성한 커널의 정확성을 검증하는 데 도움을 주는 오픈 소스 도구 FpSan과 같은 검증 도구에 많이 투자했습니다.

추측 디코딩은 속도와 효율성을 개선하는 또 다른 수단입니다. 이 기술은 주 모델과 함께 더 작은 초안(또는 "추측자") 모델을 실행하여 주 모델이 병렬로 확인할 여러 토큰을 제안하는 것입니다. 이러한 제안이 수락되면 시스템은 단일 주 모델 패스에서 여러 출력 토큰을 생성할 수 있어 비싼 순차 계산의 양을 줄입니다. GPT-5.6 Sol은 아키텍처에 대한 수백 가지 실험을 설계하고 실행하여 자체 초안 모델을 개선했습니다. 크기, 구조, 기능의 변화를 테스트했습니다. 또한 GPT-5.6 Sol은 하드웨어 오류와 훈련 불안정성을 포함한 문제가 발생했을 때 자율적으로 개입하여 추측자 훈련 과정을 시작하고 모니터링했습니다. 결과적으로 토큰 생성 효율성이 15% 이상 증가했습니다.

캐시되지 않은 입력 토큰을 처리할 때 모델은 계산 집약적인 패스에서 키-값(KV) 캐시를 구축하고, 출력을 생성할 때 반복적으로 해당 캐시를 읽고 확장합니다. 배칭, 샤딩, KV 관리와 같은 최적의 제공 구성은 작업 부하에 크게 의존합니다. 프롬프트 및 출력 길이, 배치 크기, 캐시 적중률, 쿼리 특성 등이 포함됩니다. 그러나 구성 공간이 너무 커서 체계적으로 조정할 수 없었기 때문에 엔지니어들은 광범위한 휴리스틱에 의존해야 했습니다. Codex의 GPT-5.6 Sol을 통해 우리는 생산 작업 부하를 분석하고, 후보 구성을 생성하고 평가하며, 엔진과 모델이 각 시나리오에 맞게 구성되는 방식을 초최적화할 수 있었습니다. 이는 새로운 수준의 작업 부하별 최적화를 실현 가능하게 하여 동일한 하드웨어에서 더 많은 유용한 추론을 추출합니다.

추론 최적화는 지속적인 피드백 루프입니다. 우리는 생산 행동을 측정하고, 가장 큰 격차를 식별하고, 변경 사항을 구현하며, 전체 시스템을 개선하는지 확인합니다. GPT-5.6 Sol과 Codex는 이 루프의 모든 부분을 가속화합니다. 이는 팀이 더 많은 아이디어를 탐색하고, 변화하는 작업 부하에 더 빠르게 대응하며, 사용자에게 더 낮은 지연 시간, 더 많은 용량, 더 낮은 비용을 제공하는 추론 스택을 만들 수 있음을 의미합니다.

에이전틱 하네스가 반복 작업을 간소화하는 방법

ChatGPT Work와 Codex는 일련의 모델 요청과 도구 호출을 통해 복잡한 작업을 완료합니다. 사용자 요청에서 최종 응답까지의 단일 턴에서 Codex는 소스 코드를 검사하고, 배포 기록을 검색하고, 사고 보고서를 읽고, 파일을 편집하고, 테스트를 실행할 수 있습니다. 각 단계는 요청이 필요할 수 있습니다.

컨텍스트 준비, 데이터 전송, 추론 실행, 도구 호출, 프로세스 시작은 모두 시간과 계산을 필요로 합니다. 작업에 30개의 모델 요청이 필요한 경우 요청당 1초가 추가되면 시간이 누적됩니다. 전체 성능을 개선하려면 시스템 전반에서 반복 작업을 줄이는 것이 중요합니다. 단순히 모델을 더 빠르게 만드는 것만으로는 충분하지 않습니다.

사용자 턴 하나에 여러 모델 및 도구 반복이 포함될 수 있습니다. 반복 영역 내의 모든 비용은 여러 번 지불될 수 있습니다.

이러한 배수는 모델, 도구, 사용자 환경을 연결하는 Rust 오케스트레이션 레이어인 에이전틱 하네스를 설계하는 데 영향을 미쳤습니다. 다음으로, 컨텍스트 팽창을 피하고, 도구를 로드하고, 작업을 재사용하여 각 요청을 더 효율적으로 만드는 방법을 다루겠습니다.

컨텍스트 팽창 피하기

에이전트가 더 많은 도구, 기술, 플러그인, 대화 기록에 액세스할 수 있게 되면 컨텍스트 창이 쉽게 확장될 수 있습니다. 이는 비용을 증가시키고, 모델을 산만하게 하며, 불필요한 추론을 유발합니다. 하네스는 필요한 경우에만 통합, 사용자 정의 MCP 도구, 기술, 플러그인을 노출하여 이러한 오버헤드를 줄일 수 있습니다. 하네스는 또한 개별 도구와 MCP 통합이 예상치 않게 컨텍스트 창을 소비하지 않도록 방지합니다. 도구 출력은 기본적으로 10,000 토큰으로 제한되며, 모델이 다른 제한을 요청하지 않는 한 그렇습니다.

프롬프트 캐싱을 위한 정확한 접두어 유지

앞서 언급했듯이 에이전트 루프는 동일한 지침, 대화 기록, 도구 정의, 이전 결과를 단일 턴 내에서 여러 번 GPU로 보낼 수 있습니다. 이러한 반복 입력을 처리하는 것은 비용이 많이 들기 때문에 프롬프트 캐싱은 이전에 처리된 프롬프트 접두어와 관련된 계산을 재사용합니다. 해당 접두어를 보존하기 위해 하네스는 모든 모델 가시적 기록을 추가 전용으로 처리합니다. 새로운 메시지, 도구 결과, 환경 업데이트는 이전 컨텍스트에 삽입되는 대신 끝에 추가됩니다. 도구는 또한 결정론적 순서로 제공되며, 승인 정책과 같은 런타임 설정은 도구 정의에 포함되지 않고 실행 중에 적용됩니다. 이러한 설계 선택은 Codex와 ChatGPT Work의 높은 전체 프롬프트 캐시 적중률에 기여합니다.

증분 전송은 네트워크를 가로지르는 것을 변경합니다. 프롬프트 캐싱은 모델이 재계산을 피할 수 있는 것을 변경합니다. 너비는 개념적이며 추가 압축 레이어는 표시되지 않습니다.

지능 곡선 전반의 효율성

GPT-5.6을 통해 제공된 효율성 향상은 연구, 추론, 에이전틱 하네스를 아우르는 스택 전반에 걸친 수년간의 누적된 개선의 결과입니다. 이러한 개선을 제공하는 데 있어 GPT-5.6의 역할은 최적화 속도가 가속화될 것이라는 낙관적인 전망을 제공합니다. 우리는 커널 최적화와 같은 영역에서 더 큰 최적화를 계속 진행할 것이며, 스택에 대한 기본적인 개선도 함께 진행할 것입니다. 이러한 지속적인 내부 개선을 사용자와 고객에게 더 널리 사용 가능한 비용 효율적인 지능의 형태로 다시 제공할 수 있기를 기대합니다.

이 글에 기여한 기술 직원인 Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson, Steve Coffey에게 특별히 감사드립니다.

이메일만 수집하며, 광고·스팸 없이 뉴스레터 발송에만 사용합니다.