2026년 8월 12일 · 4² AI 뉴스레터
GPT-5.6 Sol, 금융 업무 효율화에 도전
OpenAI
파이랩 정리
GPT-5.6 Sol, 금융 업무 효율화에 도전
금융 분석은 고객이나 고위 의사 결정자 앞에 서기 전에 증거를 조정하고, 파일을 작성 및 포맷하며, 모든 숫자를 확인하고 각 주장을 그 출처에 연결하는 까다로운 마지막 과정을 거쳐야 합니다. 완성된 PowerPoint 프레젠테이션이나 Excel 워크북은 편집 가능하고 검토 준비가 되어 있어야 합니다.
Model ML의 공동 창업자이자 형제인 Arnie와 Chaz Englander는 두 번의 성공적인 사업 매각 후 개인 가족 사무소를 통해 투자하면서 이러한 작업이 얼마나 많은 노력을 요구하는지 알게 되었습니다. 그들은 이를 돕기 위해 소프트웨어를 개발하기 시작했습니다.
이 소프트웨어에서 발전한 Model ML의 에이전트는 금융 전문가들이 초기 요청부터 연구, 분석, 최종 프레젠테이션 또는 워크북까지의 워크플로우를 수행할 수 있도록 돕습니다. 중심에는 핵심 에이전트가 작업을 계획하고, 적절한 도구를 선택하며, 증거를 조정하고, 계산을 수행하며 각 단계를 가장 적합한 모델로 라우팅합니다. 이 과정에서 주로 사용되는 모델은 GPT-5.6 Sol입니다. Model ML의 자체 문서 도구는 추적 가능한 출처를 가진 네이티브 PowerPoint 및 Excel 파일을 생성합니다.
"이전 모델은 분석가의 작업을 수행할 수 있었지만, 사용자는 작업을 명확히 분해하고 출력이 어떻게 보이기를 원하는지를 구체적으로 설명해야 했습니다. GPT-5.6 Sol을 사용하면 에이전트가 최종 출력에 훨씬 더 가까워지는 것을 발견했습니다." —Chaz Englander, Model ML 공동 창업자 겸 CEO
금융 업무의 마지막 마일 해결
Model ML은 금융 워크플로우를 처음부터 끝까지 자동화하여 금융 팀을 지원합니다. 간단한 설명과 출처 자료로부터 에이전트는 연구와 모델링을 거쳐 고객이나 거래 팀을 위한 완성된 자료로 과제를 수행할 수 있습니다. 금융 전문가는 가정을 확인하고, 출처를 검토하며, 메시지를 점검한 후 작업을 공유합니다.
Model ML은 이 제품을 "표면 무관"이라고 부릅니다. 금융 전문가는 이메일이나 Model ML 앱에서 과제를 시작하고, Microsoft Office 플러그인에서 계속 진행할 수 있으며, 다시 설명할 필요가 없습니다.
이러한 연속성은 완성된 작업에도 적용됩니다. 투자 위원회 프레젠테이션의 경우, Model ML은 간단한 설명과 출처 자료를 편집 가능한 PowerPoint로 변환할 수 있습니다. Excel 작업의 경우, 에이전트는 클라이언트 템플릿이나 빈 워크북으로 시작하여 필요한 데이터를 수집하고, 여러 탭에 걸쳐 수식과 논리를 구축한 후 금융에 특화된 포맷을 적용하여 완성된 스프레드시트나 금융 모델을 생성합니다.
Model ML의 Composite, 금융 서비스에서 AI를 평가하는 회사의 벤치마크에서 GPT-5.6 Sol은 Excel 워크플로우에서 Opus 5보다 36% 적은 토큰을 사용했습니다.
"사용자는 분석을 다시 구축하는 것이 아니라 가정을 세밀하게 조정하거나 메시지를 날카롭게 하는 판단에 집중해야 합니다." —Chaz Englander, Model ML 공동 창업자 겸 CEO
이 마지막 마일을 통해 작업을 수행함으로써 에이전트는 개별 전달물에 소요되는 시간을 절약하고, 대량의 출처 자료를 처리하는 데 도움을 줄 수 있습니다. 한 글로벌 자산 관리 회사에서는 맞춤형 티어시트가 분석가에게 약 1시간이 걸리던 것이 이제 약 5분 만에 완료됩니다. 다른 워크플로우에서는 Model ML 에이전트가 100,000개 이상의 행과 수백 개의 파일을 포함하는 가상 데이터 룸을 한 번에 처리했습니다.
GPT-5.6 Sol, 더 적은 토큰으로 검토 준비가 된 금융 전달물 제공
Model ML은 다양한 금융 워크플로우에서 GPT-5.6 Sol을 다른 주요 모델과 함께 평가했습니다. Composite 평가는 초기 금융 설명에서 연구와 계산을 거쳐 편집 가능한 프레젠테이션이나 스프레드시트로 이어지는 과제를 따라가며, 숫자, 출처, 수식, 구조뿐만 아니라 프레젠테이션의 시각적 품질을 검사합니다.
PowerPoint의 경우, Model ML의 Composite 평가는 실제 워크플로우를 포함하며, 수백 개의 생성된 프레젠테이션을 자세한 평가 기준으로 평가합니다.
GPT-5.6 Sol은 PowerPoint 워크플로우를 100%의 테스트 사례에서 완료했으며, Opus 5는 76%를 기록했습니다. 또한, Model ML의 전문성 준비 게이트를 43.3%의 사례에서 통과했으며, Opus 5는 26.7%였습니다. 프레젠테이션 품질, 설명 준수, 계층 구조 및 일관성 면에서도 Opus 5를 앞섰습니다.
네이티브 PowerPoint 생성 모델 벤치마크, Model ML의 Composite 평가
| 지표 | GPT 5.6 Sol | Δ Sol–O5 | Opus 5 | Fable 5 | Opus 4.8 | GPT 5.6 Terra | GPT-5.5 |
|---|---|---|---|---|---|---|---|
| 프레젠테이션 품질 — 전체 점수, 준비 게이트 | 59.9% | +3.2 | 56.7% | 59.3% | 58.7% | 52.5% | 44.4% |
| 전달 가능성 — 전문성 준비율 (게이트) | 43.3% | +16.6 | 26.7% | 32.0% | 17.3% | 17.3% | 16.0% |
| 생성된 프레젠테이션 — .pptx로 생성된 항목 | 100.0% | +24.0 | 76.0% | 82.0% | 80.0% | 80.0% | 74.0% |
| 설명 준수 — 지시 사항 준수 | 78.8% | +0.9 | 77.9% | 78.5% | 78.4% | 74.1% | 79.6% |
| 시각적 품질 — 시각적 평가 집계 | 77.9% | −1.4 | 79.3% | 78.9% | 75.1% | 74.4% | 68.5% |
| 레이아웃 — 레이아웃 및 구성 | 75.9% | −2.9 | 78.8% | 78.7% | 76.2% | 76.1% | 67.8% |
| 계층 구조 — 시각적 계층 구조 | 87.2% | +0.5 | 86.7% | 85.5% | 85.5% | 85.6% | 83.7% |
| 데이터 시각화 — 차트 가독성 | 78.8% | −4.3 | 83.1% | 79.7% | 73.3% | 74.6% | 68.4% |
| 일관성 — 디자인 일관성 | 97.8% | +4.5 | 93.3% | 95.8% | 97.5% | 75.0% | 90.0% |
| 효율성 — 프레젠테이션당 토큰 수 (낮을수록 좋음) | 1.10M | +144K | 953K | 1.40M | 1.16M | 720K | 1.01M |
Model ML의 네이티브 PowerPoint 생성 벤치마크는 GPT-5.6 Sol과 Opus 5 및 다른 주요 모델을 비교합니다.
네이티브 Excel 생성 모델 벤치마크, Model ML의 Composite 평가
| 지표 | GPT 5.6 Sol | Δ Sol–O5 | Opus 5 | Fable 5 | Opus 4.8 | GPT 5.6 Terra | GPT-5.5 |
|---|---|---|---|---|---|---|---|
| 주요 출력 정확성 — 골든 모델 대비 헤드라인 정확성 | 83.3% | +0.5 | 82.8% | 80.6% | 74.4% | 82.2% | 83.3% |
| 완전한 모델 — 모든 주요 출력이 올바른 항목 | 50.0% | −10.0 | 60.0% | 60.0% | 40.0% | 53.3% | 60.0% |
| 출력 위치 — 워크북에서 예상 출력 찾기 | 100.0% | ±0 | 100.0% | 100.0% | 92.2% | 98.9% | 100.0% |
| 워크북 계약 — 구조 / 오류 없음 / 자리 표시자 없음 게이트 | 100.0% | ±0 | 100.0% | 100.0% | 100.0% | 100.0% | 100.0% |
| 효율성 — 워크북당 토큰 수 (낮을수록 좋음) | 2.44M | −1.40M | 3.83M | 2.59M | 2.91M | 1.64M | 1.16M |
| 시간 소요 — 워크북당 분 (낮을수록 좋음) | 7.0 min | −0.5 min | 7.5 min | 8.4 min | 11.5 min | 4.2 min | 3.9 min |
Model ML의 네이티브 Excel 생성 벤치마크는 GPT-5.6 Sol과 Opus 5 및 다른 주요 모델을 비교합니다.
위의 Composite 결과를 종합해 보면, Model ML은 GPT-5.6 Sol을 생산에 확장할 근거를 제공받았으며, 이전에 Opus 4.8이 처리하던 일부 워크플로우도 포함되었습니다. PowerPoint 워크플로우의 경우, GPT-5.6 Sol은 경쟁력 있는 프레젠테이션 품질과 Opus 5 및 Fable 5보다 높은 완료율을 결합하면서 Fable 5보다 약 21% 적은 토큰을 사용했습니다.
"실제 작업 준비가 되었다는 것은 사용자가 실제 검토로 바로 이동할 수 있다는 것을 의미합니다,"라고 Englander는 말합니다. "숫자는 추적 가능하고, 워크북은 재계산되며, 슬라이드는 편집 가능합니다."
검토에 견디는 투자 프레젠테이션 생성
PowerPoint는 GPT-5.6 Sol이 실제 작업 준비가 되었는지를 시험하는 까다로운 테스트를 제공했습니다. 프레젠테이션은 외관상 깔끔해 보일 수 있지만, 숫자가 잘못되었거나 추적할 수 없거나, 차트가 평평해졌거나, 슬라이드를 공유하기 전에 다시 만들어야 한다면 검토에서 실패할 수 있습니다.
Model ML은 에이전트 하네스 내에서 모델을 실행하여, 에이전트가 편집 가능한 그래프와 테이블로 슬라이드를 생성할 수 있는 문서 생성 및 편집 도구와 결합했습니다. 작업 중에 원래 설명을 문맥에 유지한 후, 파일을 반환하기 전에 모든 슬라이드를 시각적으로 검토합니다.
아래 예시는 GPT-5.5에서 GPT-5.6 Sol로 Model ML의 PowerPoint 출력이 어떻게 개선되었는지를 보여줍니다. 여기에는 더 명확한 계층 구조와 더 일관된 슬라이드 디자인이 포함됩니다.
오늘날, Model ML의 하네스는 에이전트에게 데이터 통합, 문서 편집 도구 및 기술, 코드 실행 환경에 접근할 수 있는 툴킷을 제공합니다. 이는 에이전트가 집중할 수 있도록 하며, 사용자 문서와 작업하는 데 필요한 도구를 정확히 제공합니다.
Model ML은 OpenAI와의 현장 세션을 통해 이 설정에 도달했습니다. 팀은 에이전트가 프레젠테이션을 계획하고, 도구를 선택하며, 문맥을 유지하는 방법을 추적한 후, 이러한 발견을 사용하여 에이전트의 지침을 세밀하게 조정하고 각 툴킷이 로드되어야 할 시점을 결정했습니다.
변화하는 금융 업무를 위한 구축
Model ML의 고객들은 모델과 그 뒤의 출처 자료에 연결된 상태로 유지되는 브라우저 기반 출력으로 이동하고 있습니다.
Model ML의 플랫폼은 보안적이고 상호작용 가능한 출력을 생성할 수 있으며, 이는 지속적으로 업데이트되거나 특정 시점에 고정될 수 있습니다. 검토자는 투자 요약을 열고, 수치 뒤의 금융 모델로 클릭하여 같은 페이지에서 에이전트와 작업할 수 있습니다.
"PowerPoint, Excel, Word는 지식 작업을 수동으로 생성하던 세계를 위해 설계되었습니다,"라고 Englander는 말합니다. "AI는 그 가정을 바꾸었습니다. 소프트웨어 자체도 곧 변할 것입니다."