7월 28일 (화) 뉴스 보기

2026년 7월 28일 · 4² AI 뉴스레터

오픈소스 AI 모델 Kimi-K3, HuggingFace에 등장

Hugging Face

파이랩 정리

모델 소개

Kimi K3는 오픈소스 가중치를 가진 네이티브 멀티모달 에이전트 모델로, 현재까지 가장 강력한 모델입니다. 이 모델은 Kimi Delta Attention (KDA)와 Attention Residuals (AttnRes)를 기반으로 구축되었으며, 네이티브 비전 기능과 100만 토큰의 컨텍스트 윈도우를 지원합니다. 세계 최초의 오픈 3T 클래스 모델로서, 장기적인 코딩, 지식 작업, 추론을 위한 최첨단 지능을 제공합니다.

주요 기능

  • 새로운 아키텍처: Kimi K3는 Kimi Delta Attention (KDA)와 Attention Residuals (AttnRes)를 기반으로 하고 있으며, Stable LatentMoE 프레임워크를 통해 MoE 희소성을 확장합니다. 이는 Kimi K2 대비 약 2.5배의 전체 스케일링 효율성을 제공합니다.
  • 장기 코딩: 최소한의 인간 감독으로 장기 엔지니어링 세션을 유지하고, 대규모 저장소를 탐색하며, GPU 커널 최적화 및 컴파일러 개발부터 비전 기반 게임 개발, CAD, 칩 설계까지 다양한 터미널 도구를 조정합니다.
  • 에이전트 지식 작업: Kimi K3는 네이티브 멀티모달 아키텍처를 통해 인터랙티브 시각화, 위젯 및 대시보드, 모션 디자인 및 비디오 편집을 포함한 심층 연구를 수행합니다.
  • 네이티브 멀티모달 및 긴 컨텍스트: Kimi K3는 텍스트, 이미지, 비디오를 동일한 모델 내에서 이해하며, 100만 토큰의 컨텍스트 윈도우를 지원합니다.
  • 오픈 프론티어 가중치: Kimi K3 모델의 전체 가중치를 Kimi K3 라이선스 하에 공개하여 연구, 배포 및 추가 혁신을 위한 프론티어 지능을 제공합니다.

모델 요약

  • 아키텍처: Mixture-of-Experts (MoE)
  • 총 파라미터 수: 2.8T
  • 활성화된 파라미터 수: 104B
  • 레이어 수: 93
  • 밀집 레이어 수: 1
  • 어텐션 레이어 구성: 69 KDA + 24 Gated MLA
  • 숨겨진 차원: 7168
  • 어텐션 헤드 수: 96
  • 잠재 MoE 차원: 3584
  • MoE 숨겨진 차원 (전문가당): 3072
  • 전문가 수: 896
  • 토큰당 선택된 전문가 수: 16
  • 공유 전문가 수: 2
  • 어휘 크기: 160K
  • 컨텍스트 길이: 1048576
  • 어텐션 메커니즘: KDA & Gated MLA
  • 활성화 함수: SiTU-GLU
  • 비전 인코더: MoonViT-V2
  • 비전 인코더 파라미터: 401M
  • 양자화: MXFP4 가중치 / MXFP8 활성화 (양자화 인식 훈련)
  • 모달리티: 텍스트, 이미지

평가 결과

Kimi K3는 다양한 벤치마크에서 다른 모델들과 비교하여 평가되었습니다. 주요 결과는 다음과 같습니다:

  • 추론 및 지식: GPQA Diamond에서 93.5, CritPt에서 23.4, AA-LCR에서 74.7, HLE-Full에서 43.5/56.0을 기록했습니다.
  • 코딩: DeepSWE에서 67.5, ProgramBench에서 77.8, Terminal-Bench 2.1에서 88.3, FrontierSWE에서 81.2를 기록했습니다.
  • 에이전트: BrowseComp에서 91.2, DeepSearchQA (F1)에서 95.0, ResearchRubrics에서 76.2를 기록했습니다.
  • 비전: WorldVQA ForceAnswer에서 51.0, OmniDocBench에서 91.1, PerceptionBench에서 58.5를 기록했습니다.

네이티브 MXFP4 양자화

Kimi K3는 SFT 단계부터 양자화 인식 훈련을 적용하여 MXFP4 가중치와 MXFP8 활성화를 사용하여 광범위한 하드웨어 호환성을 제공합니다.

배포

Kimi K3의 API는 https://platform.kimi.ai에서 사용할 수 있으며, OpenAI/Anthropic 호환 API도 제공합니다. 현재 Kimi K3는 다음 추론 엔진에서 실행하는 것이 권장됩니다:

  • vLLM
  • SGLang
  • TokenSpeed

모델 사용법

Kimi K3는 항상 사고가 활성화되어 있으며, reasoning_content를 반환합니다. 사고 노력은 "low", "high", "max" (기본값 "max")를 지원하는 top-level reasoning_effort 요청 필드로 구성됩니다. Kimi K3는 보존된 사고 기록 모드에서 훈련되었습니다. 다중 턴 대화 및 도구 호출의 경우, API에서 반환된 전체 어시스턴트 메시지를 reasoning_content 및 tool_calls를 포함하여 메시지로 다시 전달해야 합니다.

라이선스

코드 저장소와 모델 가중치는 Kimi K3 라이선스 하에 공개되었습니다.

문의

질문이 있는 경우 support@moonshot.ai로 문의하십시오.

이메일만 수집하며, 광고·스팸 없이 뉴스레터 발송에만 사용합니다.