8월 4일 (화) 뉴스 보기

2026년 8월 4일 · 4² AI 뉴스레터

코딩과 협업의 새로운 기준, Qwen3.8-Max 등장

qwen.ai

파이랩 정리

Qwen3.8-Max: 코딩과 협업의 새로운 기준

오늘 우리는 Qwen 패밀리 중 가장 강력한 모델인 Qwen 3.8-Max를 공식적으로 출시합니다. 이번 출시에서는 처음으로 Qwen-Max 클래스 모델의 가중치를 오픈 소스로 공개할 예정이며, 다음 주에 공개됩니다. Qwen 3.5의 아키텍처를 기반으로 구축된 Qwen 3.8-Max는 2.4조 개의 매개변수로 확장되어 코딩, 작업, 연구 및 장기 과제 전반에 걸쳐 포괄적인 개선을 제공합니다. 이 모델은 더 어려운 질문에 답할 수 있을 뿐만 아니라, 복잡한 작업을 처음부터 끝까지 보다 신뢰성 있게 수행하여 신뢰할 수 있는 결과물을 제공합니다.

  • Qwen3.8-MaxQwenCloud에서 이용 가능:

    • 2.4조 매개변수 (95B 활성), 다음 주에 오픈 가중치 공개
    • 코딩, 작업, 연구 및 장기 과제 전반에 걸친 포괄적 개선
    • 복잡한 작업의 종단 간 및 신뢰할 수 있는 전달
  • QwenCloud에서 API를 통해 호출 가능

코딩

최고의 모델에게 코딩은 단순히 요청에 따라 함수를 작성하는 것을 넘어, 빈 폴더에서 시작하여 최종 결과물까지 스스로 완성하는 실제 다일 프로젝트를 의미합니다. Qwen3.8-Max는 세 가지 도전 과제에서 테스트되었으며, 모든 결과는 인간의 도움 없이 실제로 코드 작성 및 실행을 통해 얻어졌습니다. 이 세 가지 사례에서 공통적으로 나타나는 점은 Qwen3.8-Max가 고정된 계획을 따르는 것이 아니라, 피드백 루프를 통해 스스로 발전한다는 것입니다.

10일 이상의 자율 코딩: 셀프-에볼빙 하네스 구축

이 경우, Qwen3.8-Max는 oh-my-cli 프로젝트를 처음부터 생성하고, 10일 이상의 장기 자율 코딩 실행을 통해 셀프-에볼빙 하네스를 구축하라는 요청을 받았습니다. 이 과정에서 사용자 피드백, 고급 커뮤니티 관행, 모델의 자체 테스트 결과를 하나의 엔지니어링 루프로 통합합니다. 요구 사항은 이슈로 정규화되어 에이전트에 의해 자동으로 클레임되고, 코드, 테스트, 미리보기 및 로그를 통해 지속적으로 반복됩니다. 전체 프로젝트 추적은 GitHub 저장소 qwen-code-dev-bot/oh-my-cli에서 공개적으로 제공됩니다.

자율 코딩 하네스의 주요 구현 세부 사항:

  • 루프 엔지니어링 설정: 작업 상태, 디스패치 및 복구. Qwen3.8-Max는 이슈 상태 머신, 디스패처, 모니터 및 워치독을 하나의 실행 루프로 결합합니다. 새로운 요구 사항이 GitHub Issues에 들어오면 에이전트가 상태 머신을 통해 클레임하고 ready → leased → active로 이동합니다. 구현이 완료되면 E2E 테스트와 CI 검사가 트리거되며, 통과 후 PR이 병합됩니다.
  • 자체 테스트: 제품 자체 테스트 및 유지 관리. 각 업데이트 후, 모델은 빌드, 유닛 테스트, E2E 및 데스크톱 라이프사이클 검증을 트리거합니다. 비정상 상태는 관련 이슈/PR로 다시 라우팅되어 수정 및 재검증됩니다.
  • 다중 소스 진화: 여러 수요 신호에서 제품 업그레이드. 커뮤니티 경험과 사용자/개발자 피드백을 실행 가능한 작업으로 변환하여 하네스는 /goal, /resume, 동적 워크플로우, 세션 재생, 데스크톱 및 기타 기능을 지속적으로 발전시킵니다.

2026년 7월 30일 기준, 약 16일의 완전 자율 AI 운영 후, 저장소는 265개의 커밋, 127개의 PR, 151개의 이슈를 축적하여 지속적으로 발전하는 자율 코딩 능력을 보여줍니다.

연구 논문 재현 및 개선

Qwen3.8-Max에게 최근 연구 논문인 “Unified Data Selection for LLM Reasoning”을 제공하고, 논문의 실험을 코드로 재현한 후 개선을 시도하라고 요청했습니다. 이 논문은 AI 훈련에서 매우 실용적인 질문을 다룹니다: 훈련할 수 있는 데이터보다 훨씬 많은 데이터를 가지고 있을 때, 어떤 예제가 실제로 보존할 가치가 있는가? 논문의 답변은 **“어려운 결정 지점”**이 가득한 예제를 중시하는 것입니다.

Qwen3.8-Max는 논문과 GPU 세트 외에는 아무것도 없이 시작했습니다. 데이터 처리 스크립트, 훈련 코드, 평가 설정 등 모든 것을 처음부터 설계하고 작성해야 했습니다. 이는 숙련된 엔지니어가 며칠간 걸리는 작업입니다.

약 5일 동안 (~125시간의 연속 노력) Qwen3.8-Max는 약 7,600줄의 코드를 작성하고, 1,100번 이상의 작업을 수행했으며, 33회의 GPU 훈련을 실행했습니다. 처음에는 논문의 전체 파이프라인을 0에서 재구축하는 데 약 37시간을 소비하고, 논문의 6가지 주요 발견을 재현했습니다. 데이터 선택을 통해 Qwen3-8B 모델을 미세 조정하고, 어려운 수학 벤치마크에서 이득을 확인했습니다 (예: 논문의 선택 방법은 무작위로 데이터를 선택하는 것보다 AIME24에서 +7.7% 우수합니다).

그 후, 재현을 자체 진화로 전환했습니다. 다음 약 88시간 동안 자체 개선 연구 루프를 실행하여 가설을 형성 → 코드를 작성 → GPU에서 실행 → 분석 → 다시 시도 하며 18개의 개선 아이디어를 4라운드에 걸쳐 발명하고 테스트했습니다. 각 라운드의 결과는 다음 라운드의 가설에 피드백을 제공하며, 각 시도의 문제점을 진단하여 최종적으로 논문의 접근 방식을 능가하는 새로운 방법을 개발했습니다. 이는 경쟁 수준의 수학 벤치마크 AIME24에서 +2.7포인트의 이득을 가져왔습니다.

24시간 내에 수백 개의 인간 팀을 이기다

다음으로 우리는 Qwen3.8-Max를 실제 온라인 대회에 참가시켰습니다 — WWW2025 멀티모달 대화 의도 인식 챌린지, Alibaba Cloud의 Tianchi 플랫폼에서 개최된 대회로, 526개의 인간 팀이 경쟁하고 있었습니다. 과제는 고객 서비스 채팅 — 텍스트와 스크린샷 모두 —을 읽고 고객이 원하는 것을 정확히 파악하는 것입니다.

Qwen3.8-Max는 완전히 독립적으로 24시간의 엄격한 시간 제한 내에서 대회 규칙을 읽고 전체 솔루션을 코드로 구축했습니다. 텍스트 측면에서는 여러 중국어 모델 — BERT, MacBERT, RoBERTa를 미세 조정하고 앙상블했습니다. 제품 스크린샷의 경우, 비전-언어 모델 Qwen2.5-VL-7B를 미세 조정하고, 메인 모델이 확신하지 못하는 이미지에 대해 Chinese-CLIP 모델을 지원했습니다. 그런 다음 모든 것을 단일 가중치 투표 시스템으로 결합하여 각 모델의 투표가 얼마나 중요하게 고려되어야 하는지를 교차 검증을 통해 조정하고, 동점일 때 추가 이미지 투표자를 추가했습니다. 45회의 제출을 통해 — 각 라운드의 피드백이 다음 라운드의 미세 조정 및 재가중치를 이끌며 — 정확도가 0.60에서 최종 0.853까지 꾸준히 상승하여 526개 인간 팀 중 458개 팀(87%의 필드)을 이겼습니다.

이 세 가지 사례는 Qwen3.8-Max의 뛰어난 점을 보여줍니다: 이 모델은 며칠 동안 어려운, 개방형 목표에 집중할 수 있으며, 자신의 아이디어를 내고 이를 작동 가능한 결과로 전환할 수 있습니다 — 인간의 개입 없이도.

이메일만 수집하며, 광고·스팸 없이 뉴스레터 발송에만 사용합니다.