7월 30일 (목) 뉴스 보기

2026년 7월 30일 · 4² AI 뉴스레터

GPT-5.6, 단 두 설정으로 성능 3배 향상 비결 공개

OpenAI

파이랩 정리

GPT-5.6 Sol의 성능 향상 비결

GPT-5.6 Sol은 ARC-AGI-3 벤치마크에서 2D 퍼즐 게임을 해결하는 데 있어 뛰어난 성과를 보여주었습니다. 이 벤치마크는 AI 에이전트가 새로운 2D 게임을 탐색하고 명시적인 지침 없이 게임의 규칙을 추론하는 능력을 측정합니다. GPT-5.6 Sol은 수학의 오랜 난제를 해결하고, 포켓몬 파이어레드와 같은 게임을 이긴 경험이 있지만, ARC-AGI-3에서는 초기 성적이 7.8%에 불과했습니다. GPT-5.5는 0.4%로 더욱 저조했습니다.

성능 향상의 핵심: 두 가지 설정

ARC-AGI-3 벤치마크는 AI 모델의 학습 및 추론 능력을 평가하기 위해 설계되었습니다. 이 벤치마크는 도구나 특별한 기능 없이 단순한 하네스를 사용하여 모델의 단점을 더 명확하게 드러내고, 모델 간의 비교를 공정하게 만듭니다. 하지만 GPT-5.6 Sol이 성능을 발휘하지 못한 이유는 모델 자체의 한계가 아니라 하네스의 설정 때문이었습니다.

문제점 발견

  1. 추론 유지의 부재: 게임의 각 행동 후에 모든 개인적인 추론이 삭제되었습니다. 이는 GPT-5.6 Sol이 매번 게임을 새롭게 이해해야 했음을 의미합니다. 과거의 움직임과 간단한 메모는 볼 수 있었지만, 그에 이르는 계획이나 통찰은 볼 수 없었습니다.

  2. 롤링 트렁케이션: 하네스는 롤링 트렁케이션 윈도우를 사용하여 오래된 행동이 기록에서 사라지게 했습니다. 이는 GPT-5.6 Sol이 과거의 행동을 기억하지 못하게 만들었습니다.

이 두 가지 문제는 GPT-5.6 Sol이 시간이 지남에 따라 학습하는 데 어려움을 겪는 이유를 설명했습니다.

해결책: 추론 유지와 압축

우리의 모델은 응답이나 도구 호출을 출력하기 전에 개인적인 추론 메시지를 사용하여 생각하도록 훈련되었습니다. 이러한 추론 메시지는 대화 기록의 일부로 유지됩니다. 대화가 너무 길어지면 요약하여 계속 진행합니다. 이는 ChatGPT와 Codex에서 사용되는 방식입니다.

ARC-AGI-3 하네스를 우리의 Responses API로 구현하여 이러한 설정을 반영했습니다. 이 API는 컨텍스트 관리를 쉽게 해주며, 이전 응답 ID를 전달함으로써 도구 호출과 턴 간에 추론을 유지할 수 있습니다.

  • 추론 유지: 이전의 생각을 기억할 수 있게 되면서, GPT-5.6 Sol은 매번 게임을 처음부터 해석할 필요가 없어졌습니다. 이는 시간이 지남에 따라 더 나은 학습과 일관된 전략 사용을 가능하게 했습니다.

  • 압축 사용: 롤링 트렁케이션 대신 압축을 사용하여, GPT-5.6 Sol은 각 게임에 대해 배운 내용을 더 잘 보존할 수 있었고, 더 적은 출력 토큰으로 더 높은 점수를 얻었습니다.

이 두 가지 설정을 통해 GPT-5.6 Sol은 약 3배의 점수를 얻었고, 출력 토큰 수는 6배 줄었습니다.

결론 및 권장 사항

이 실험은 평가가 모델 자체만을 측정하는 것이 아니라, API 설정, 하네스 디자인, 프롬프트와 같은 덜 보이는 선택들도 측정한다는 점을 상기시켜 줍니다. API 개발자라면 성능을 극대화하기 위해 다음 설정을 사용하는 것을 추천합니다:

  • Responses API 사용
  • 추론 유지
  • 압축 사용

모델을 비교할 때는 이러한 설정을 사용하는 평가를 신뢰하는 것이 좋습니다. 이는 ChatGPT와 Codex의 실제 사용과 가장 잘 맞습니다.

ARC의 AGI 평가에 대한 창의적인 작업과 분석에 감사드립니다. 이는 우리가 이 문제를 더 면밀히 살펴보는 계기가 되었습니다.

이메일만 수집하며, 광고·스팸 없이 뉴스레터 발송에만 사용합니다.