7월 29일 (수) 뉴스 보기

2026년 7월 29일 · 4² AI 뉴스레터

9B 모델의 $500 강화 학습, 선두 모델 능가

fermisense.com

파이랩 정리

지능 소유의 부상: 작업 훈련된 오픈 소스 모델 vs 최첨단 모델

비용과 품질: 카탈로그 무결성

같은 카탈로그 검토 워크플로우에서 동일한 도구, 이미지, 평가자를 사용하여, 9B 오픈 소스 모델의 GRPO 미세 조정이 모든 최첨단 구성보다 우수한 성능을 보였습니다. 비용은 1,000개의 목록당 $0.50로, 가장 저렴한 최첨단 설정보다 40배, 가장 비싼 설정보다 약 340배 저렴합니다.

Part I: 모두가 같은 질문을 던지다

ChatGPT가 2022년에 출시된 이후, 기업 리더들은 AI가 우리에게 무엇을 할 수 있는지에 대해 질문해왔습니다. 초기에는 문서 요약, 이메일 초안 작성, 인간이 편집할 초안 생성과 같은 저위험 작업부터 시작했습니다. 이후 소프트웨어 개발, 콘텐츠 생성과 같은 고부가가치 인지 작업으로 빠르게 확장되었고, AI 회사의 두뇌를 구축하려는 시도와 같은 야심 찬 프로젝트로 발전했습니다. 많은 시간과 에너지가 AI 채택에 투자되었지만, 측정 가능한 결과는 대규모로 거의 달성되지 않았습니다. 그러나 일부 기업은 AI 우선 전략을 채택하여 생산성, 수익, 비용에서 엄청난 이익을 보았고, 다른 기업들은 뒤처지거나 조직 변화를 충분히 이루지 못해 높은 ROI를 달성하지 못했습니다.

최근 기업 지출 관리 플랫폼 Ramp의 데이터에 따르면, AI에 투자한 상위 25%의 기업은 2022년 11월부터 2025년 12월까지 수익이 두 배 이상 증가한 반면, AI에 전혀 지출하지 않은 기업은 15% 증가에 그쳤습니다.

AI 채택의 성공 요인

AI가 일부 기업에 큰 성과를 가져다준 이유는 여러 가지가 있지만, 연구는 주로 다섯 가지 방향을 가리킵니다.

  1. 프로세스 재설계: AI 우선이 되기 위해서는 작업 구조를 재고해야 하며, 사람 중심의 워크플로우에 모델을 단순히 추가하는 것만으로는 충분하지 않습니다.

  2. 실험 장려: 모델, 도구, 모범 사례는 매주 변화하므로, 실험과 실패 보고에 대한 보상이 필요합니다.

  3. 맞춤형 비즈니스 컨텍스트 제공: 프롬프트 엔지니어링과 검색을 통해 비즈니스 컨텍스트를 주입할 수 있지만, 이를 잘 수행하는 것은 자체 엔지니어링 프로그램입니다.

  4. 사용 및 영향 측정: AI의 모든 라인 항목은 결국 CFO의 질문에 직면합니다. 변화가 무엇이었고, 그것이 가치가 있었는지에 대한 답변이 필요합니다.

  5. 명확한 비즈니스 목표 설정: AI는 대부분의 기업이 익숙하지 않은 가격 모델을 가져왔습니다. 사용량에 따라 비용이 증가하므로 비용 계획을 세우거나 내부 작업의 자본 효율성을 추정하기가 어렵습니다.

Part II: 승리하는 기업의 차별점

AI 경쟁에서 앞서 나가는 대부분의 기업은 지능을 소유하는 것이 성능과 비용 모두에서 이점을 제공한다는 사실을 발견했습니다. 특정 환경에서 특정 워크플로우를 완료하도록 훈련된 모델은 일반적인 목적의 모델보다 우수할 가능성이 높습니다. 또한, 특정 환경에서 작동하도록 설계된 모델은 일반적인 기능을 많이 포함할 필요가 없으므로, 운영 비용이 훨씬 저렴한 작은 모델로도 충분합니다.

지능을 소유한다는 것은 ChatGPT나 Claude 구독을 취소하는 것을 의미하지 않습니다. 대부분의 워크플로우 자동화는 최첨단 모델로 시작하며, 이는 기술적으로 가능한 것의 기준을 설정하고, 각 호출이 후속 모델 훈련에 필요한 데이터를 생성하기 때문입니다. 자동화가 프로토타입 단계를 벗어나면, 비용과 대량 성능이 우선시되며, 이때 오픈 소스 모델의 강화 학습을 통한 미세 조정이 중요해집니다.

Part III: 사례 연구 - 카탈로그 무결성 에이전트

전자상거래 플랫폼 운영의 중심 과제 중 하나는 제품 카탈로그의 신뢰성을 유지하는 것입니다. 모든 목록은 플랫폼의 분류 체계의 올바른 카테고리에 속해야 하며, 검색, 필터, 추천 및 하위 작업을 지원하는 속성은 이미지와 설명에서 정확하게 추출되어야 합니다.

  • 정확성 향상: 미세 조정된 9B 오픈 소스 모델은 테스트한 최첨단 모델보다 전자상거래 제품 목록을 15% 더 정확하게 검토합니다.
  • 비용 절감: 미세 조정된 모델이 검토를 수행할 때 목록당 비용이 68배 저렴합니다.

Part IV: 모델이 연습할 수 있는 디지털 트윈

모델은 실제로 수행하고 실패하며 재시도할 수 있는 워크플로우만 연습할 수 있습니다. 따라서 우리는 전자상거래 플랫폼의 디지털 트윈으로 카탈로그 워크플로우를 재구축했습니다. 이 환경은 실제와 동일한 목록, 도구, 위험을 포함합니다.

이 디지털 트윈 내에서 모델은 분석가가 하는 방식으로 작업합니다. 약 13,000개의 카테고리로 구성된 분류 체계를 검색하고, 브랜드가 등록 및 보호되었는지 확인하며, 선택한 카테고리에 필요한 속성을 검색합니다. 그런 다음 카테고리, 속성, 정책 결정을 커밋합니다. 모든 에피소드는 정확한 출력에 대해 보상을 받습니다.

이메일만 수집하며, 광고·스팸 없이 뉴스레터 발송에만 사용합니다.