Qwen, Max 계열 최초로 가중치를 공개하는 2.4T 규모 플래그십 모델 Qwen3.8-Max 출시 및 공개 예정

Qwen3.8-Max 소개

Qwen 팀이 2026년 8월 3일 새로운 플래그십 모델 Qwen3.8-Max 를 공개했습니다. 전체 2.4조(2.4T) 파라미터 가운데 토큰당 950억(95B) 개를 활성화하는 MoE 구조이며, 지난 Qwen3.5의 아키텍처를 토대로 규모를 키웠습니다. 코딩과 실무 작업, 리서치, 그리고 며칠에 걸쳐 이어지는 장기 과제(Long-Horizon Task) 전반에서 개선되었다는 것이 발표의 요지입니다.

그런데 이번 발표에서 성능 수치보다 먼저 눈에 들어오는 것은 배포 방식입니다. Qwen 팀은 이번이 Max 급 모델의 가중치를 공개하는 첫 사례라고 밝혔습니다. 그동안 Qwen 은 가중치를 공개하는 모델군과 API로만 제공하는 최상위 Max 급을 나눠 운영해 왔는데, 그 경계가 이번에 처음 열리는 것입니다. 공개 시점은 다음 주로 예고되었고, 배포처는 Hugging FaceModelScope입니다. 최근 Kimi K3의 2.8T 규모 가중치 공개에 이어, 조 단위 파라미터를 가진 모델을 직접 내려받아 다룰 수 있는 선택지가 하나 더 늘어나는 셈입니다.

달라진 Qwen3.8-Max 출시 블로그의 구성도 눈에 띕니다. 벤치마크 표는 글의 뒷부분에 있고, 앞부분은 전부 Qwen3.8-Max 모델이 사람의 개입 없이 며칠씩 돌린 실제 작업 기록으로 채워져 있습니다. 16일간 스스로 저장소를 운영하며 만든 CLI 도구(oh-my-cli)를 비롯하여, 논문 하나만 받아서 재현한 뒤 그 방법을 넘어선 연구 루프, 24시간 만에 526개 팀이 겨루던 대회에 참가한 기록, 500턴에 걸쳐 게이트 수를 12분의 1로 줄인 칩 설계가 그 예입니다. 요청 하나에 답을 잘 쓰는 능력이 아니라, 목표 하나를 며칠 동안 붙들고 결과물까지 끌고 가는 능력을 전면에 내세운 발표입니다.

Qwen3.8-Max 모델의 주요 사양을 정리하면 다음과 같습니다:

  • 모델 규모: 전체 2.4T 파라미터, 토큰당 활성 파라미터 95B의 MoE 구조. Qwen3.5의 아키텍처를 기반으로 확장했습니다.

  • 가중치 공개: Max 급 최초로 오픈 웨이트 배포 예정. 블로그에서는 다음 주(8/10~16) 중 Hugging FaceModelScope에 공개 예정이라고 밝혔습니다.

  • 컨텍스트 길이: 100만 토큰(공식 설정 파일 기준, 유효 컨텍스트는 그중 95%로 표기).

  • 추론 강도 제어: reasoning_effortxhigh(기본값), medium, low 세 단계로 지정해 비용과 정확도를 조절합니다. preserve_thinking 은 기본 활성화입니다.

  • API 호환성: QwenCloud를 통해 OpenAI 규격의 Chat Completions 및 Responses API와 Anthropic 호환 API를 모두 제공합니다.

며칠 동안 혼자 코딩하기: 세 가지 시험대

Qwen 팀은 코딩 능력을 함수 하나를 요청받아 작성하는 일이 아니라, 빈 폴더에서 시작해 여러 날짜에 걸친 프로젝트를 혼자 완성하는 일로 정의하고 세 가지 과제를 걸었습니다. 세 사례를 관통하는 공통점은 고정된 계획을 따르는 대신 피드백 루프를 통해 스스로 방법을 바꿔 나간다는 점입니다.

16일 동안 스스로 진화한 하네스, oh-my-cli

첫 번째 과제는 oh-my-cli 프로젝트를 맨바닥에서 만들면서, 자기 자신을 개선하는 하네스(harness)까지 함께 구축하는 것이었습니다. 사용자 피드백과 커뮤니티의 활용 사례, 모델 자신의 자체 테스트 결과가 하나의 엔지니어링 루프로 들어옵니다. 구조는 이슈 상태 기계와 작업 분배기(dispatcher), 모니터, 워치독을 하나의 실행 루프로 묶은 형태입니다. 요구사항은 GitHub 이슈로 정규화되고, 에이전트가 상태 기계를 통해 ready → leased → active 순서로 이슈를 점유해 실행하며, 구현이 끝나면 E2E 테스트와 CI 검사가 자동으로 돌고 통과한 PR이 병합됩니다. 업데이트마다 빌드, 단위 테스트, E2E, 데스크톱 생애주기 검증이 실행되고, 이상 상태는 관련 이슈나 PR로 되돌려 보내 다시 검증합니다.

2026년 7월 30일 기준으로 약 16일간의 완전 자율 운영을 거쳐 이 저장소에는 커밋 265개, PR 127개, 이슈 151개가 쌓였고, 그 과정에서 /goal, /resume, Dynamic Workflow, Session Replay, 데스크톱 지원 같은 기능이 커뮤니티 피드백을 재료로 추가되었습니다. 전체 작업 기록이 공개 저장소에 그대로 남아 있어 사람이 직접 확인할 수 있다는 점이 이 사례의 가장 큰 강점입니다.

논문을 재현한 뒤, 그 방법을 넘어서기

두 번째 과제는 최근 논문 한 편(Unified Data Selection for LLM Reasoning)을 주고 코드로 재현한 다음 더 잘해 보라고 요구한 것입니다. 이 논문은 학습에 쓸 수 있는 양보다 데이터가 훨씬 많을 때 어떤 예제를 남길지를 다루며, 풀이 과정에서 모델이 다음 선택을 진짜로 망설였던 어려운 결정 지점이 많은 예제를 우선한다는 답을 제시합니다.

모델에게 주어진 것은 논문과 GPU뿐이었습니다. 시작 코드도, 준비된 파이프라인도 없이 데이터 처리 스크립트와 학습 코드, 평가 환경을 모두 직접 설계하고 작성해야 했습니다. 약 5일(연속 125시간) 동안 혼자 작업하며 코드 약 7,600줄을 쓰고 1,100회 이상의 행동을 수행했으며 GPU 학습을 33회 돌렸습니다. 먼저 37시간을 들여 논문의 파이프라인을 처음부터 재구성하고, 자신이 선별한 데이터로 Qwen3-8B 모델을 반복 미세조정해 어려운 수학 벤치마크에서 개선을 확인하는 방식으로 주요 결과 6가지를 재현했습니다. 여기에는 논문의 선별 기법이 무작위 선별보다 AIME24에서 7.7% 앞선다는 결과도 포함됩니다.

이후 88시간은 가설 수립 → 코드 작성 → GPU 실행 → 분석 → 재시도의 자기 개선 루프에 쓰였습니다. 4라운드에 걸쳐 자신이 떠올린 개선 아이디어 18개를 시험했고, 각 라운드의 실패 원인을 진단해 다음 라운드의 가설로 넘기는 방식으로 결국 논문의 방법보다 나은 결과에 도달했습니다.

라운드 해당 라운드의 최선 아이디어 AIME24 점수 기준선 대비
기준선 논문의 방법을 재현 49.58% 기준
1 선별 전에 난이도별로 데이터 분할 50.42% +0.84
2 엔트로피와 점수의 격차로 예제 가중치 부여 51.67% +2.09
3 선별 폭(width) 조정 51.25% +1.67
4 어려운 결정 지점의 개수 세기(nhighgate) 52.29% +2.71

24시간 만에 526개 팀 중 상위 13%

세 번째 과제는 실제 온라인 대회였습니다. Alibaba Cloud Tianchi 플랫폼에서 526개 팀이 참가한 WWW2025 멀티모달 대화 의도 인식 챌린지에, 24시간 제한을 걸고 모델 혼자 참가시켰습니다. 고객 상담 대화의 텍스트와 스크린샷을 함께 읽고 고객의 의도를 맞히는 과제입니다.

모델은 대회 규정을 읽고 해법을 코드로 구성했습니다. 텍스트에는 BERT, MacBERT, RoBERTa 를 미세조정해 앙상블했고, 상품 스크린샷에는 Qwen2.5-VL-7B를 미세조정한 뒤 확신이 낮은 이미지에는 Chinese-CLIP을 보조로 붙였습니다. 이 모델들을 교차 검증으로 가중치를 조정한 가중 투표 체계로 합치고, 동점을 깨기 위한 이미지 투표자를 추가했습니다. 45회 제출을 거치며 정확도는 0.60에서 최종 0.853까지 올라 526개 팀 중 458개 팀(전체의 87%)을 앞섰습니다.

실무 작업으로 넓힌 능력: 환경과 컴퓨트를 함께 키운 강화학습

코딩 다음으로 발표문이 비중을 둔 축은 여러 단계와 여러 도구가 얽힌 실무 작업입니다. Qwen 팀은 강화학습(Reinforcement Learning) 환경과 컴퓨트를 함께 확장해 여러 하네스에서 고르게 능력을 끌어올렸다고 설명하며, QwenWork, Claude Code, Codex, OpenClaw, Hermes 를 검증 대상으로 들었습니다. 여기에는 서로 맞물린 세 가지 과제가 있었습니다.

  • 분리된 실제 환경의 지속적 확장: 과제(단일 과제 → 다중 과제 → 여러 날짜에 걸친 과제), 작업 공간(여러 파일 → 계층적 폴더 → 복잡한 이종 폴더), 하네스(종류, 버전, 스킬)를 각각 독립된 축으로 두어, 환경이 조합적으로 늘어나도 매번 별도 통합 작업이 필요하지 않도록 했습니다.
  • 보편 보상 시스템(Universal Reward System): 실행 기반 검증, 텍스트와 렌더링된 시각 결과물에 대한 채점 기준 판정, 에이전트 기반 검사처럼 성격이 다른 검증 방식을 자동 확장 가능한 채점 기준 아래 하나의 보상 체계로 통합했습니다. 과제별 검증기를 따로 유지할 때 생기는 불일치를 없애는 것이 목적입니다.
  • 온라인 데이터 밸런서: 매 배치의 과제, 난이도, 작업 공간, 하네스 분포를 균형 있게 맞춰 배치 간 그래디언트 분산을 억제하고, 강화학습 컴퓨트를 계속 늘려도 학습이 안정적으로 유지되도록 했습니다.

수백 개 직군에서 확인한 실무 폭

Qwen 팀은 경제적 가치가 높은 수백 개 직군의 고빈도 업무를 대상으로 결과물 품질을 시험했다고 밝히며, 대표 사례 여섯 가지를 공개했습니다. 각 사례에 붙은 기존 소요 시간은 Qwen 팀이 제시한 비교값입니다.

  • 기업 법무 담당: 문서 수백 건 규모의 자료에서 관련 조항 1,284개를 한 번에 찾아내 한 시간 안에 검토를 마쳤습니다. 법무 보조 인력이 팀으로 붙어 약 일주일 걸리는 작업으로 소개됩니다.
  • UI/UX 디자이너: 디지털 뱅킹 앱 NOVA 의 고충실도 인터랙티브 프로토타입을 일관된 디자인 시스템을 갖춘 8개 화면으로 한 번에 만들었고, 사람의 수정 요청은 0회였습니다. 통상 3~5회의 수정 라운드가 필요한 작업입니다.
  • 외식업 브랜드 창업자: 식재료 공급 자료 100건 이상을 읽고 26가지 요리로 구성된 메뉴를 한 번에 완성했습니다. 각 요리에 평균 열량과 식재료 원산지를 표기하고 식자재 원가율은 33.8%로 유지했습니다.
  • 구조 엔지니어: 도면 한 세트만 받아 30층 오피스 빌딩의 내진 구조 모델을 브라우저에서 재구성했고, 고유 주기와 밑면 전단력, 층간 변위비를 마우스 조작으로 실시간 확인할 수 있게 만들었습니다.
  • 재활 치료사: 2차원 종이 평가지를 시야각을 자유롭게 돌릴 수 있는 3차원 인터랙티브 데모로 바꾸고, 해부학 레이어를 단계별로 겹쳐 환자가 부상 위치와 회복 경과를 직접 볼 수 있게 했습니다.
  • 스포츠 데이터 분석가: 선수당 약 8,400회의 공수 상황을 파싱해 선수 전술 프로필과 코칭 리포트를 수십 분 만에 만들었습니다.

대화 한 번으로 돌린 리서치 루프

발표문에서 병렬 규모가 가장 큰 사례는 Dynamic Workflows 기능을 이용해 대화 한 번을 자동화된 리서치 루프로 바꾼 것입니다. 한 줄짜리 과제 설명에서 시작해 모델이 스스로 워크플로우를 설계하고 몇 시간에 걸쳐 데이터 체계를 구축하며, 백테스트 결과를 분석해 방향을 수정했다고 합니다. Qwen 팀은 이 과정에서 모델이 고정된 스크립트가 아니라 관측된 증거에 따라 움직였다고 설명합니다. 설계 구간과 검증 구간의 지표가 어긋나는 과적합 신호를 보면 스스로 요인을 라운드마다 잘라냈고, 여러 경로가 같은 신호에 수렴하는 것을 발견하면 다중 시드 합집합 검증을 추가했으며, 앙상블이 소규모 표본에서 덜 견고하다고 판단하면 다른 프레임워크로 전환했다는 것입니다.

폭 쪽에서는 6개의 짧은 설명에서 출발해 각각을 50개 연구 방향으로 분해하고, 약 330개의 서브 에이전트를 띄워 약 6,000회의 백테스트를 돌렸습니다. Qwen 팀은 이렇게 선택된 요인들이 0.64에서 1.48 사이의 초과 샤프 지수0.010에서 0.014 사이의 IC 값을 기록했다고 보고합니다. 이 수치는 과거 데이터를 대상으로 한 백테스트 결과이며, 오케스트레이션 논리를 재현 가능한 프로그램으로 고정할 수 있다는 점을 보여주기 위한 사례로 제시된 것입니다.

장기 과제: 500턴의 칩 설계와 365일의 매장 운영

게이트 수를 8,298개에서 678개로 줄인 자율 칩 설계

가장 구체적으로 검증 가능한 사례는 디지털 칩 설계입니다. 대상은 모듈러 거듭제곱과 모듈러 곱셈을 포함한 GCD/RSA 암호 하드웨어 가속기로, cocotb 기반 무작위 검증 환경에서 4비트, 6비트, 8비트, 16비트 설정 모두에 대해 비트 단위로 정확한 동작을 유지하면서 합성 후 게이트 수를 최소화하는 것이 목표였습니다. 면적 성능은 16비트(WIDTH = 16) 설정을 기준으로 평가했습니다. 면적과 정확성 사이의 고전적인 트레이드오프를 정면으로 다루는 과제입니다.

모델은 시뮬레이션(Icarus Verilog), 합성(Yosys), 물리 설계(OpenROAD)가 통합된 샌드박스에서 작업했습니다. 주어진 것은 과제 설명과 빈 모듈 템플릿만 있는 RTL 작업 공간, 그리고 평가 스크립트뿐이었고 정답 설계는 제공되지 않았습니다. 한 번의 연속 실행에서 약 500턴과 71회 평가, 13개의 주요 이정표를 거치며 처음 동작한 설계의 8,298 게이트를 678 게이트까지 줄였습니다. 발표문에 함께 실린 비교 도표에는 같은 과제에서 GPT-5.5 가 749, Opus 4.8 이 870, GLM 5.2 가 1107, DeepSeek V4 Pro 가 1450 게이트를 기록한 것으로 표시되어 있습니다.

  • 알고리즘 재작성 (8,298 → 2,010 게이트, 22턴): modular_multiplier 안의 값비싼 16비트 하드웨어 모듈러 제산기를 반복 시프트 감산 구조로 교체해 한 번에 6,288 게이트를 줄였습니다. 전체 면적 감소의 80% 이상이 이 한 걸음에서 나왔습니다.
  • 중복 제거와 비트폭 축소 (2,010 → 1,304 게이트, 35~48턴): 호출자의 사전 조건을 파악해 REDUCE 단계를 안전하게 우회하고, 독립된 두 축소 모듈을 하나로 병합하고 출력 경로를 조합 논리로 바꿨습니다.
  • 레지스터와 제어 FSM 정리 (1,304 → 907 게이트, 60~113턴): 불필요한 레지스터와 플립플롭을 제거하고 짝수에 대한 조기 종료 경로를 넣었으며, 감산기의 최상위 비트를 비교기로 재사용했습니다.
  • 모듈 융합과 논리 공유 (907 → 765 게이트, 170~252턴): 모듈 경계를 허물어 곱셈기를 모듈러 거듭제곱 FSM 안으로 인라인하고 세 개의 하위 모듈을 병합해 감산기 하나를 전역으로 공유했습니다.
  • 게이트 수준 정제 (765 → 678 게이트, 443~500턴): 공유 NOR 게이트 트리와 절대차 감산 분할 같은 국소 최적화로 마지막 중복을 제거했습니다.

이 최적화가 물리 구현까지 이어지는지 확인하기 위해 OpenROAD(Nangate45 PDK)로 배치와 배선을 돌린 결과, 처음 106×106 µm²였던 다이는 46×46 µm²로 줄었고 총 배선 길이는 33,369 µm에서 4,187 µm로 감소했으며, 처음 -4.46 ns였던 음의 슬랙은 500 MHz에서 +0.66 ns로 타이밍을 만족했습니다. 면적 기준으로는 81% 감소입니다. 수백 턴이 지난 뒤에도 구조적 돌파가 계속 나왔다는 점, 즉 초반의 손쉬운 개선 이후 정체되지 않았다는 점이 이 사례에서 강조됩니다.

365일 동안 매장을 운영하는 시뮬레이션

E-Commerce Bench 는 365일 주기의 이커머스 운영을 시뮬레이션하는 벤치마크로, Taobao 와 Tmall 의 비식별 거래 데이터를 바탕으로 매장 유형 12종, 상품 카테고리 60종, 공급업체 약 600곳, 상품 7,000개 규모의 생태계를 재현합니다. 모델은 10만 위안의 초기 자본으로 여러 온라인 매장을 동시에 운영하면서 상품 선정과 공급망 협상, 재고 관리, 동적 가격 결정, 반품 처리까지 전 과정을 스스로 결정해야 합니다. 계절 수요 변동과 돌발 사건, 정산 체계에서 오는 현금 흐름 압박이 함께 걸립니다. 평가 기준이 연말 총 잔고이기 때문에 자본 배분 전략도 함께 시험됩니다. 성장을 위해 언제 적극적으로 투자할지 판단해야 하는 동시에, 주기가 끝나기 전에 재고와 영업 이익을 현금으로 바꿔 놓아야 합니다. 장부에 남은 미회수 자산은 최종 성적을 깎기 때문입니다.

가격 협상에는 게임 이론에 기반한 공급업체 행렬이 들어가 각 업체가 서로 다른 성향과 양보 전략을 갖고, 모델은 여러 차례의 자연어 대화로 협상해야 합니다. Qwen 팀은 Qwen3.8-Max 가 같은 업체와 같은 상품을 두고 반복 협상하며 조달 가격을 단계적으로 낮췄고 그 경험을 유사 상품으로 일반화한 반면, 다른 모델들은 중반에 협상 효율이 정체됐다고 설명합니다. 약 600곳의 공급업체 가운데 152곳은 회비 함정, 저가 미끼, 상품 불일치 같은 전형적인 사기 패턴을 숨긴 업체로 심어 두어 위험 관리 능력까지 함께 시험합니다.

Qwen 팀은 이 모델이 운영 초반에 자본을 가장 많이 투입해 자리를 잡았고 그 덕분에 이후 자산 증가 곡선이 빨라졌다고 설명하며, 연말 대형 프로모션 기간의 순이익이 10만 위안을 넘어 2위인 GLM 5.2 의 약 2.4배였다고 밝혔습니다. 결과적으로 Qwen3.8-Max 는 연말 기준 총 잔고 41만 6,252위안(4.16배)으로 2위인 GLM 5.2 보다 38% 앞섰고, 이전 세대 플래그십인 Qwen3.7-Max 대비로는 152% 개선이라고 보고되었습니다. 2,000회가 넘는 상호작용을 거치며 초기에 학습한 전략을 고집하지 않고 거래 피드백에 맞춰 조정했다는 점을 근거로 제시합니다.

멀티모달 에이전트: 보는 눈에서 고치는 눈으로

멀티모달 쪽에서 이번 발표가 강조하는 것은 입력 이해가 아니라 작업 전체를 관통하는 시각 능력입니다. 200쪽이 넘는 재무 보고서와 복잡한 PDF 를 다룰 때 여러 페이지에 걸친 텍스트와 차트, 문서 레이아웃을 함께 이해해 구조화된 보고서나 웹 결과물로 바꿉니다. 100시간이 넘는 영상에서는 특정 장면을 찾는 데 그치지 않고 인물과 사건, 타임스탬프, 장면을 영상 메모리 그래프(Video Memory Graph) 로 정리해 사건의 전개와 인물 관계를 재구성합니다.

여기서 한 걸음 더 나아간 부분이 시각을 피드백 경로로 쓰는 방식입니다. 실행 중에 자신이 만든 중간 결과물을 계속 관찰하면서 페이지 레이아웃과 사물의 방향, 공간 관계, 애니메이션 품질을 점검하고, 텔레비전이 엉뚱한 방향을 보고 있거나 인터페이스 정렬이 어긋난 것처럼 의도와 다른 결과를 발견하면 계획을 수정해 스스로 고칩니다. 시각이 입력 단계의 한 가지 양식이 아니라 계획, 실행, 검증, 반복을 잇는 고리가 되는 셈입니다. 이를 활용해 개인 영상을 브이로그로 편집하거나, 질문 하나를 몰입형 교육 애니메이션으로 바꾸거나, 인터페이스 스크린샷 한 장에서 프론트엔드 프로젝트를 복원하거나, 평면도를 Blender 기반 3차원 실내 시각화로 바꾸거나, 자연어 요청만으로 인터랙티브 게임과 애플리케이션을 만드는 작업도 함께 소개되었습니다.

코드 작성과 GUI 조작을 함께 쓰는 하이브리드 에이전트 능력도 별도로 다룹니다. 코드는 무거운 작업을 대량으로 처리하고, GUI 조작은 사람이 보고 만질 수 있는 영역에 닿으면서 실제로 돌아가는 시스템에서 무슨 일이 일어나는지 되돌려 준다는 설명입니다. 이를 측정하기 위해 Ubuntu, macOS, Windows, Android, 웹의 다섯 플랫폼에 걸친 애플리케이션 재현 벤치마크 RecreationBench 를 새로 공개했습니다. 모델은 실행 중인 애플리케이션을 소스 코드도 인터넷 접근도 없이 블랙박스로만 관찰하고, 상호작용과 피드백만으로 파악해 전체를 처음부터 다시 만들어야 합니다.

기존 에이전트 시스템에 이런 능력을 붙일 수 있도록 하네스 확장 라이브러리 Qwen-MM-Plugins 도 함께 발표되었습니다. 이미지와 영상 처리, 멀티모달 메모리, 동적 해상도 지원, 시각 도구 사용, 그리고 영상 편집이나 Blender, CAD 같은 특화 작업 기능을 제공합니다.

먼저 써 본 파트너들이 남긴 평가

발표문에는 정식 공개 전에 이 모델을 써 본 파트너와 사용자들의 평가가 인용 카드 형태로 실려 있습니다. Qwen 팀이 직접 선별해 배치한 인용이므로 긍정적인 내용만 모여 있다는 점은 감안해야 하지만, 발화자와 소속이 밝혀져 있고 자체 측정 수치가 함께 제시된 항목이 있어 참고할 만합니다.

기업용 협업 도구를 만드는 QwenWork 팀은 사내 평가 결과를 경쟁 모델과 비교해 언급했습니다.

현재 Qwen3.8 프리뷰 버전은 QwenWork 의 내장 모델로 통합되어 첫 기업 사용자들에게 제공되고 있습니다. QwenWork 내부 테스트셋 평가에서는 프로세스 품질과 작업 수행 정확도, 토큰 소비, 작업 소요 시간 등 여러 항목에서 Opus4.8 을 앞섭니다.

Shu Junliang, QwenWork Product & R&D Lead

코딩 도구 Qoder 팀은 품질보다 토큰 효율과 속도를 앞세웠습니다.

Qwen3.8-Max 는 Qoder Bench 평가와 온라인 코드 유지율, 도구 오류율 등 여러 지표에서 Opus4.8 을 앞섭니다. 또한 중국어 지원이 더 강해서 이중 언어 상황에서는 토큰 효율이 Opus4.8 보다 60% 앞서고, 동등한 추론 속도 기준으로는 28% 더 빠릅니다.

Chen Xin, Qoder R&D Lead

오픈소스 코딩 에이전트 Crush 를 만드는 Charm 은 이 모델 하나만으로 인프라를 구축했다고 밝혔습니다.

Hyper 인프라의 핵심 부분을 Qwen3.8-Max 단일 모델로 구축했습니다. 우리가 가진 가장 큰 엔지니어링 작업들을 던져 봤는데, 다른 대부분의 모델이라면 어려워했을 까다롭고 복잡한 작업을 처리해냈습니다.

Charm

반도체와 AI 인프라 분석으로 알려진 SemiAnalysis는 속도를 짚었습니다.

Qwen3.8-Max-Preview 를 테스트했습니다. Breakout 클론을 한 번에 만들어냈고, 인상적이었습니다. 그런데 정말 빠릅니다. Kimi3 보다 빠릅니다.

SemiAnalysis

에이전트 플랫폼 Alice 의 개발자는 프로덕션 도입을 결정한 근거로 캐시 적중률을 들었습니다.

익명 테스트 기간에 사용자당 평균 4,790만 토큰을 사용했고 캐시 적중률은 87% 였습니다. 높은 캐시 적중률과 이미 경쟁력 있는 가격이 대규모 프로덕션 투입에 대한 확신을 줬습니다.

Xu Yicheng, Developer on Alice

이 밖에 지식재산권 분야 법무법인 파트너는 근거 추적이 가능하고 확신이 낮은 부분을 추측 대신 표시해 준다는 점을, 중국과학원대학교(UCAS) 연구자는 미세전자기계 칩 설계에서 문헌 정리부터 파라미터 추출, 구조 재구성, 시뮬레이션, 이상 진단까지 전체 파이프라인을 이어서 수행했다는 점을 언급했습니다.

벤치마크로 본 Qwen 3.8 Max의 성능

발표문의 전체 표에서 코딩과 일반 에이전트 항목 일부를 옮기면 다음과 같습니다.

벤치마크 Qwen3.8-Max Qwen3.7-Max Opus 4.8 Fable 5 GPT-5.6 Sol (max)
Terminal Bench 2.1 86.6 74.5 84.6 84.6 88.8
SWE-bench Pro 67.7 60.6 69.2 80.0 64.6
FrontierSWE 73.5 40.7 70.0 88.8 미공개
PaperBench 93.0 64.8 80.3 88.8 90.5
CoWorkBench 74.8 64.6 72.3 75.9 71.5
JobBench 53.4 31.3 48.4 57.4 45.4
IFBench 82.8 79.1 62.2 63.5 72.7
GPQA Diamond 92.6 92.4 92.0 92.6 94.1
HLE 43.6 41.4 45.7 53.3 47.2

표를 그대로 읽으면 Qwen3.8-Max 는 논문 재현 능력을 보는 PaperBench 93.0 과 지시 이행을 보는 IFBench 82.8 에서 비교 대상 중 가장 높지만, Terminal Bench 2.1 과 SWE-bench Pro, HLE 처럼 Fable 5 나 GPT-5.6 Sol 이 앞서는 항목도 분명히 있습니다. 직전 세대인 Qwen3.7-Max 와 비교하면 FrontierSWE 40.7 에서 73.5, PaperBench 64.8 에서 93.0 처럼 격차가 큰 항목이 많아, 세대 간 개선폭이 프론티어 모델과의 격차 축소보다 크게 나타납니다.

다만 표를 볼 때 주의할 점이 있습니다. Terminal Bench 2.1 의 경우 Qwen3.8-Max 는 Claude Code 하네스에서 10회 평균으로 측정했고, 다른 모델은 공개된 여러 하네스 중 가장 높은 점수를 가져왔습니다. Qwen 팀은 각주에서 Fable 5 결과에는 폴백이 포함될 수 있다고 밝히고 있으며, QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench, QwenBlenderBench 등은 자체 제작 벤치마크입니다. 멀티모달 쪽에서는 컴퓨터 사용(OSWorld-Verified) 86.1, 시각 인식 항목인 Dense200 87.0, Parametric CAD Bench 91.5 가 비교군에서 가장 높고, 새로 공개한 RecreationBench 는 51.7 로 Fable 5 의 56.1 에 뒤집니다.

API와 코딩 도구에서 사용하기

Qwen3.8-Max 는 QwenCloud를 통해 지금 바로 호출할 수 있습니다. OpenAI 규격과 호환되므로 기존 openai 클라이언트를 그대로 쓰면서 모델명과 base URL 만 바꾸면 됩니다.

from openai import OpenAI
import os

api_key = os.environ.get("DASHSCOPE_API_KEY")
client = OpenAI(
    api_key=api_key,
    base_url=os.environ.get(
        "DASHSCOPE_BASE_URL",
        "https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
    ),
)

messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    extra_body={
        "enable_thinking": True,
        # "preserve_thinking": True,
    },
    reasoning_effort="xhigh",  # supported levels are xhigh, medium, and low
    stream=True,
)

엔드포인트는 베이징(dashscope.aliyuncs.com), 싱가포르(dashscope-intl.aliyuncs.com), 미국 버지니아(dashscope-us.aliyuncs.com) 세 곳이 제공되며, 자세한 사용법은 QwenCloud API 문서에 정리되어 있습니다.

Anthropic API 프로토콜도 지원하므로 Claude Code에서 환경 변수만 바꿔 바로 붙일 수 있습니다.

npm install -g @anthropic-ai/claude-code

export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<your_api_key>

claude

Codex는 OpenAI Responses 프로토콜을 통해 ~/.codex/model-catalog.local.json~/.codex/config.toml 에 provider 를 추가하는 방식으로 연결하고, Qoder CLI, Qwen Code, OpenClaw 도 각각 설치 후 DASHSCOPE_API_KEY 를 지정해 사용할 수 있습니다. OpenClaw 는 연동 문서~/.openclaw/openclaw.json 설정 예시가 함께 정리되어 있습니다. 모델을 직접 써 보려면 Qwen Chat에서도 사용할 수 있습니다.

정리: 조 단위 규모의 가중치가 열린다는 것

Qwen3.8-Max 발표에서 커뮤니티 입장에서 가장 중요한 대목은 벤치마크 표가 아니라 다음 주로 예고된 가중치 공개입니다. 2.4T 규모 모델을 직접 내려받아 돌릴 수 있는 환경을 갖춘 곳은 많지 않겠지만, Max 급 모델의 가중치가 공개되면 양자화와 서빙 최적화, 도메인 적응 연구의 대상이 프론티어 급으로 한 단계 올라갑니다.

발표문에 실린 사례들은 대부분 Qwen 팀이 직접 설계한 환경에서 나온 결과이므로, 공개 가중치로 재현 가능한 부분과 그렇지 않은 부분을 구분해서 볼 필요가 있습니다. 다만 16일간의 자율 운영 기록이 남은 공개 저장소나 526개 팀이 참가한 대회 순위처럼 외부에서 확인할 수 있는 근거가 함께 제시된 사례도 있어, 장기 자율 작업 능력을 어떻게 검증할지에 대한 참고 자료로도 읽을 만합니다. 다음 주 가중치가 공개되면 이 사례들 가운데 어디까지가 모델의 능력이고 어디까지가 하네스와 환경의 힘인지도 조금 더 분명해질 것입니다.

:scroll: Qwen3.8-Max: A New Bar for Coding and Cowork 소개 블로그

더 읽어보기




이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. :hugs:

이 글이 유용하셨다면 아래:down_right_arrow:쪽 좋아요:+1:를 눌러주세요 — :pytorch:파이토치 한국 사용자 모임:south_korea:이 새로운 소식을 정리하고 공유하는 데 힘이 됩니다! :star_struck: