8월 6일 (목) 뉴스 보기

2026년 8월 6일 · 4² AI 뉴스레터

Mistral의 3B 오픈 모델, 멀티모달 모더레이션 지원

mistral.ai

파이랩 정리

Shieldstral 소개

Mistral AI는 새로운 멀티모달 안전 분류기인 Shieldstral을 발표했습니다. 이 모델은 3B 오픈 가중치를 사용하며, 최대 7배 큰 모델보다 뛰어난 성능을 보입니다. Shieldstral은 콘텐츠 모더레이션을 정책 적응형 질문-응답 작업으로 프레이밍하여, 전통적인 가드레일 모델과는 달리 추론 시점에서 평문 정책을 수용합니다. 이를 통해 텍스트와 이미지의 안전 평가를 통합하며, 재훈련 없이도 작동합니다. Apache 2.0 라이선스 하에 공개된 이 모델은 다양한 벤치마크에서 조정된 안전 점수를 제공하며, 단일 16GB NVIDIA GPU에서 효율적으로 실행됩니다.

멀티모달 모더레이션의 새로운 기준

Shieldstral은 텍스트 안전성에서 최대 7배 큰 모델과 맞먹는 성능을 보이며, 멀티모달 모더레이션에서 새로운 기준을 세웠습니다. "이 콘텐츠가 보호 그룹에 대한 폭력을 조장하는가?" "이 이미지는 미성년자에게 보여주기에 안전한가?"와 같은 질문에 대한 답변은 제품, 청중, 그리고 상황에 따라 달라질 수 있습니다. 대부분의 가드레일 모델은 고정된 해악 범주를 가중치에 내장하고 있어, 새로운 배포 환경에 맞추려면 재훈련이 필요합니다. 그러나 Shieldstral은 추론 시점에 평문 질문으로 정책을 작성하고, 모델이 조정된 안전 점수를 반환하는 방식을 채택합니다. 재훈련이 필요 없으며, 텍스트와 이미지 모두에 대해 하나의 인터페이스로 결과를 제공합니다.

콘텐츠 모더레이션을 질문으로 프레이밍

Shieldstral은 콘텐츠 모더레이션을 이진 질문-응답 작업으로 프레이밍합니다. 각 요청은 세 부분으로 구성됩니다:

  1. <Instruct>: 평가 맥락, 엄격성, 그리고 (선택적으로) 안전하지 않은 콘텐츠의 정의
  2. <Query>: 예/아니오 질문, 예를 들어 "이 콘텐츠가 물리적 폭력을 조장하는가?"
  3. <Document>: 판단할 콘텐츠: 프롬프트, 응답, 프롬프트-응답 쌍, 또는 텍스트가 포함된 이미지

추론 시 모델은 예와 아니오 로짓만 읽어들이고, 이를 소프트맥스 정규화하여 연속적인 안전 점수로 변환합니다. 이 간단한 방식은 프롬프트 분류, 응답 모더레이션, 거부 감지, 독성 감지를 하나의 문제로 통합하며, 정책을 프롬프트에 완전히 포함시켜 배포 시점에 새로운 정책에 적응할 수 있게 합니다.

주요 특징

  • 강력한 성능: 텍스트 안전성, 거부 감지, 정책 적응성, 멀티모달 벤치마크에서 최대 7배 큰 오픈 가드 모델과 맞먹거나 뛰어난 성능을 보입니다.
  • 적응적이고 유연함: 하나의 자연어 인터페이스가 텍스트, 이미지, 텍스트+이미지 콘텐츠를 프롬프트, 응답, 프롬프트-응답 쌍에 걸쳐 다룹니다. 정책은 자유 형식의 쿼리로 제공되며, 재훈련 없이 추론 시점에 재타겟팅됩니다.
  • 작고 다양한 소스로 훈련됨: 3B 모델은 단일 16GB GPU에서 실행되며, 다양한 레이블 형식과 분류 체계를 가진 실제 및 합성 데이터로 훈련되었습니다.
  • 연속적인 안전 점수: 단일 포워드 패스에서 조정된 예/아니오 확률을 반환하여, 이산 레이블에 의존하지 않고 신뢰도에 따라 임계값을 설정하거나 순위를 매길 수 있습니다.
  • 오픈: Apache 2.0 가중치로 제공됩니다.

벤치마크

Shieldstral은 텍스트 안전성, 거부 감지, 정책 적응성, 멀티모달 안전성의 네 가지 축에서 최대 7배 큰 오픈 가드 모델과 비교 평가되었습니다. 모든 평가 샘플은 훈련에서 제외되었습니다.

개발 과정

작은 모델이 더 큰 모델을 이길 수 있는 핵심은 데이터의 정확성입니다. 이를 위해 다음 네 가지 문제를 해결했습니다:

  1. 이질적인 데이터 통합: 공공 안전 데이터셋은 분류 체계, 레이블, 주석 규칙에서 불일치합니다. 우리는 모든 데이터셋을 동일한 지시–쿼리–문서 형식으로 변환하고, 지시문, 쿼리, 프롬프트–응답 구분자의 표현을 다양화하여 모델이 특정 스타일에 과적합되지 않고 일반화할 수 있도록 했습니다.
  2. 기억이 아닌 구별 학습: 고정된 정책 레이블 세트로 훈련된 모델은 주어진 정책의 정확한 경계를 추론하기보다는 미리 정의된 정책을 분류하는 데 그칩니다. 대신, 의도적으로 유사하고 혼동하기 쉬운 정책 세트를 구성하고, LLM을 사용해 안전한 텍스트를 대조 쌍으로 다시 작성하도록 요청했습니다.
  3. 이미지에서의 안전성 기반: 텍스트와 달리 LLM으로 생성할 수 없는 안전하지 않은 이미지를 위해, 제한된 모더레이션 데이터셋을 보완하기 위해 일반 목적의 이미지 데이터셋을 고품질 부정 사례로 사용했습니다.
  4. 보완적인 체크포인트 결합: LoRA로 미세 조정하고, 공공 데이터에 맞춰 조정된 체크포인트, 생성된 데이터에서 세밀한 정책 구별을 추가한 체크포인트, 그리고 기본 지시 모델을 SLERP를 통해 병합했습니다.

앞으로의 계획

Shieldstral은 고정된 분류 체계를 강요하지 않고 맥락에 적응하는 모더레이션을 위한 첫걸음입니다. 우리는 다국어 지원, 긴 문서의 견고성, 더 넓은 멀티모달 안전성을 계속해서 발전시킬 예정이며, 커뮤니티가 이를 기반으로 구축하는 것을 기대합니다.

이메일만 수집하며, 광고·스팸 없이 뉴스레터 발송에만 사용합니다.