Google, 토큰 효율을 높인 Gemini 3.6 Flash와 3.5 Flash-Lite 출시

Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 소개

Google가 2026년 7월 21일, Gemini의 효율 중심 계열인 Flash 제품군(Flash series)을 한 번에 세 종류로 확장했습니다. Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, 그리고 사이버 보안에 특화된 Gemini 3.5 Flash Cyber입니다. 세 모델을 관통하는 하나의 주제는 토큰 효율(token efficiency) 입니다. 같은 작업을 더 적은 출력 토큰과 더 적은 추론(reasoning) 단계로 끝내면서도 품질은 오히려 올린다는 것이 이번 발표의 핵심입니다.

이 방향은 최근 AI 개발의 무게 중심이 단발성 질의응답에서 에이전트(agent) 워크플로로 옮겨간 흐름과 맞닿아 있습니다. 에이전트는 하나의 작업을 끝내기 위해 모델을 수십 번에서 수백 번씩 반복 호출합니다. 이때 모델 한 번의 호출이 조금만 더 장황하거나 도구 호출을 한 단계 더 거치면, 그 비용과 지연 시간이 전체 파이프라인에서 눈덩이처럼 불어납니다. Google이 Flash 계열을 "효율과 품질의 스위트 스팟"이라고 표현하는 이유가 여기에 있습니다. 프런티어급 지능을 대규모로 굴리려면 가장 똑똑한 모델 한 대가 아니라, 충분히 똑똑하면서도 싸고 빠르게 반복 호출할 수 있는 일꾼(workhorse) 모델이 필요하기 때문입니다.

이번 발표는 지난 Gemini 3.5 Flash 출시에서 받은 개발자와 고객의 피드백을 직접 반영한 결과이기도 합니다. Google은 세 모델과 별개로 Gemini 3.5 Pro 가 현재 파트너들과 함께 테스트 중이며 준비되는 대로 폭넓게 공개할 계획이라고 밝혔고, 나아가 지금까지 중 가장 야심 찬 사전학습(pre-training)에 해당하는 Gemini 4 학습을 이미 시작했다고 덧붙였습니다.

3.6 Flash: 더 적은 토큰으로 더 나은 품질

Gemini 3.6 Flash 는 이번 제품군의 중심에 있는 일꾼 모델입니다. 이전 세대인 3.5 Flash 대비 코딩과 지식 노동(knowledge work), 멀티모달 성능을 모두 끌어올리면서도, 그 일을 더 적은 토큰으로 해냅니다. Artificial Analysis Index 기준으로 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 적게 소비하며, Datacurve의 DeepSWE 같은 일부 벤치마크에서는 그 절감폭이 최대 65%까지 벌어집니다. 다단계 워크플로를 완수하는 데 필요한 추론 단계와 도구 호출 횟수 자체가 줄었기 때문입니다.

아래 차트는 이 효율 개선을 단적으로 보여줍니다. 작업당 평균 출력 토큰이 DeepSWE v1.1에서 27만 6천 개에서 9만 7천 개로, Artificial Analysis Intelligence Index에서는 2만 8천 개에서 2만 3천 개로 줄었습니다.

효율만 좋아진 것이 아니라 벤치마크 점수도 함께 올랐습니다. 장기 호흡의 소프트웨어 엔지니어링을 측정하는 DeepSWE v1.1에서 49%(3.5 Flash 37%)를, 머신러닝 엔지니어링을 측정하는 MLE-Bench에서 63.9%(3.5 Flash 49.7%)를 기록했습니다. 지식 노동을 재는 GDPval-AA v2에서는 1,421점(3.5 Flash 1,349점), 컴퓨터 사용(computer use) 능력을 재는 OSWorld-Verified에서는 83.0%(3.5 Flash 78.4%)를 달성했습니다. 특히 컴퓨터 사용은 이제 Gemini API와 Gemini Enterprise에서 클라이언트 측 내장 도구(built-in tool)로 제공됩니다.

아래 영상은 OSWorld 검증 작업에서 3.6 Flash가 3.5 Flash보다 장황함을 줄이고 토큰을 더 효율적으로 쓰는 모습을 나란히 비교한 데모입니다.

이 모든 개선이 3.5 Flash보다 낮은 가격과 함께 제공됩니다. 3.6 Flash의 가격은 입력 100만 토큰당 1.50달러, 출력 100만 토큰당 7.50달러로, 출력 단가가 3.5 Flash(9.00달러)보다 낮아졌습니다. 문서 파싱, 차트 및 데이터 분석, 보고서 초안 작성 같은 멀티모달 작업에서 특히 유용하다는 것이 HebbiaHarvey 같은 초기 고객들의 평가입니다.

한편 3.6 Flash는 화학, 생물, 방사능, 핵(CBRN)과 사이버 공격 오용 영역에서 강화된 프런티어 안전(Frontier Safety) 프레임워크 안전장치를 적용해 출시됩니다. 이 안전장치는 모델을 탈옥(jailbreak)에 훨씬 강하게 만드는 동시에, 유익한 용도에 대해서는 불필요한 거부(refusal)를 최소화하도록 학습되었습니다. 자세한 내용은 3.6 Flash 모델 카드에서 확인할 수 있습니다.

3.5 Flash-Lite: 대규모 에이전트 워크플로를 위한 속도

Gemini 3.5 Flash-Lite 는 저지연(low-latency) 작업과, 에이전트 검색이나 문서 처리처럼 높은 처리량(throughput)이 관건인 작업을 위해 설계된 모델입니다. Artificial Analysis 측정 기준으로 초당 350개의 출력 토큰을 생성하는, 3.5 계열에서 가장 빠른 모델입니다. 가격은 입력 100만 토큰당 0.30달러, 출력 100만 토큰당 2.50달러로, 이전 세대인 3.1 Flash-Lite보다 훨씬 나은 품질을 훨씬 낮은 단가에 제공합니다.

3.5 Flash-Lite의 강점은 사고 수준(thinking level) 을 조절할 수 있다는 데 있습니다. 개발자는 대량 처리 작업에서는 최소(minimal), 낮음(low) 수준으로 지연과 비용을 최소화하고, 다단계 서브에이전트(subagent) 작업에서는 더 높은 사고 수준을 켜서 정확도를 높이는 식으로 워크로드에 맞춰 모델을 구성할 수 있습니다. 3.6 Flash와 마찬가지로 컴퓨터 사용도 내장 도구로 지원합니다. 나아가 3.6 Flash를 마스터 에이전트로, 3.5 Flash-Lite를 서브에이전트로 조합하면 상위 모델이 작업을 지휘하고 하위 모델이 대량의 하위 작업을 빠르게 처리하는 계층형 에이전트 구성도 만들 수 있습니다.

이전 세대 대비 개선폭은 큽니다. 에이전트 터미널 코딩을 재는 Terminal-Bench 2.1에서 54%(3.1 Flash-Lite 31%)를, 장문 맥락 처리를 재는 GDM-MRCR v2에서 72.2%(3.1 Flash-Lite 60.1%)를, 실제 업무 수행을 재는 GDPval-AA v2에서 1,140점(3.1 Flash-Lite 642점)을 기록했습니다.

더 인상적인 지점은, 여러 에이전트 및 코딩 평가에서 3.5 Flash-Lite가 상위 모델인 3 Flash 마저 앞선다는 것입니다. 다양한 에이전트 코딩 작업을 재는 SWE-Bench Pro에서 54.2%(3 Flash 49.6%)를, 컴퓨터 사용을 재는 OSWorld-Verified에서 74.0%(3 Flash 65.1%)를 달성했습니다. 2.5 Flash나 3 Flash로 돌리던 워크로드를 더 빠르고 더 저렴하게 대체할 수 있다는 의미입니다.

아래 영상은 3.5 Flash-Lite가 대량 작업을 3.5 Flash보다 낮은 지연 시간으로 처리하는 모습을 비교한 데모입니다.

빠른 속도와 지능, 비용 효율의 조합 덕분에 Palo Alto NetworksRamp 같은 초기 고객들이 에이전트 워크플로와 데이터 처리 작업을 대규모로 확장하는 데 활용하고 있습니다. 모델의 자세한 사양은 3.5 Flash-Lite 모델 카드에서 확인할 수 있습니다.

3.5 Flash Cyber: CodeMender와 함께 취약점을 찾고 고치다

AI 모델은 이미 현재의 시스템이 취약점을 고치는 속도보다 더 빠르게 보안 취약점을 찾아낼 수 있는 수준에 이르렀습니다. 공격 쪽 능력이 방어 쪽 능력을 앞지르는 이 비대칭을 해소하려면, 높은 성능과 높은 효율을 동시에 갖춘 접근이 필요합니다. Flash 계열의 성능과 효율은 코드 보안 이슈를 대규모로 탐지, 검증, 패치하기에 이상적인 토대가 됩니다.

Gemini 3.5 Flash Cyber는 3.5 Flash 위에서 사이버 보안 취약점을 찾고 고치는 데 특화되도록 미세조정(Fine-tuning)된 모델로, 더 큰 모델보다 낮은 토큰 단가로 이 작업을 수행합니다. 이 모델은 단독으로 쓰이기보다 Google의 코드 보안 에이전트인 CodeMender 안에서 여러 개의 3.5 Flash Cyber 에이전트가 협업해 하나의 통합 보고서를 만들어내는 방식으로 동작합니다. 이 구성에서 3.5 Flash Cyber는 수백 개의 실제 소프트웨어 취약점을 다루는 대표적 벤치마크 CyberGym에서 훨씬 큰 모델들과 견줄 만한 경쟁력 있는 성능(83.2%)을 보였습니다.

여기서 작은 모델을 택한 이유는 탐색 공간(search space) 문제에 있습니다. 코드 깊숙이 숨은 결함을 찾으려면 방대한 실행 경로를 탐색해야 하는데, 거대한 모델을 한 번 비싸게 호출하는 방식은 오히려 병목이 됩니다. 저렴하고 빠른 3.5 Flash Cyber를 여러 번 호출하면 훨씬 많은 코드 경로를 훑을 수 있고, 그 결과를 서브에이전트들이 하나의 고품질 보고서로 합칩니다. 실제로 Google은 복잡하기로 유명한 V8 자바스크립트 엔진을 대상으로 한 테스트에서 3.5 Flash Cyber가 55개의 고유 취약점을 찾아 메인라인 3.5 Flash(47개)와 Claude Opus 4.6(36개)을 앞섰으며, 여기에는 다른 두 모델이 놓친 10개가 포함된다고 밝혔습니다.

다만 이 기술의 이중 용도(dual-use) 성격 때문에, Google은 배포에 신중한 태도를 취했습니다. 3.5 Flash Cyber는 CodeMender를 통해 정부와 신뢰할 수 있는 파트너에게만 제한적으로 제공되는 파일럿 프로그램 형태로 곧 공개됩니다. 방어자에게는 중요한 취약점을 공격자보다 먼저 찾아 고칠 시간을 벌어 주면서도, 광범위한 오용은 억제하려는 의도입니다. AI 시대의 소프트웨어 보안이라는 주제는 Anthropic이 주도한 Project Glasswing 같은 산업 차원의 움직임과도 맞물려 점점 더 중요해지고 있습니다.

경쟁 모델과의 성능 비교

아래는 Google이 공개한 3.6 Flash 중심의 비교표입니다. 같은 세대의 3.5 Flash 및 3.1 Pro는 물론, GPT-5.6 Luna, Grok 4.5, Claude Sonnet 5 등 경쟁 프런티어 모델과 함께 배치되어 있습니다. 가격 단위는 100만 토큰당 미국 달러입니다.

항목 3.6 Flash 3.5 Flash 3.1 Pro GPT-5.6 Luna Grok 4.5 Claude Sonnet 5
입력 가격 (USD/1M) 1.50 1.50 2.00 1.00 2.00 3.00
출력 가격 (USD/1M) 7.50 9.00 12.00 6.00 6.00 15.00
SWE-Bench Pro 58.7% 55.1% 54.2% 62.7% 64.7% 63.2%
DeepSWE v1.1 49% 37% 12% 67% 54% 54%
Terminal-Bench 2.1 78.0% 76.2% 73.8% 84.7% 83.3% 80.4%
MLE-Bench 63.9% 49.7% 42.6% 47.6% 43.2% 66.9%
OSWorld-Verified 83.0% 78.4% 76.2% 72.6% - 81.2%
GDPval-AA v2 (Elo) 1421 1349 965 1584 1535 1607
CharXiv Reasoning 85.2% 84.2% 83.3% 82.7% 81.6% 77.0%
GDM-MRCR v2 (1M) 54.0% 26.6% 26.3% - - -

표에서 드러나는 3.6 Flash의 위치는 분명합니다. GPT-5.6 Luna나 Grok 4.5, Claude Sonnet 5 같은 최상위 모델들이 SWE-Bench Pro나 GDPval-AA v2 같은 절대 성능 지표에서 앞서는 경우가 있지만, 3.6 Flash는 출력 100만 토큰당 7.50달러라는 가격대에서도 컴퓨터 사용(OSWorld-Verified 83.0%)과 복잡한 차트 해석(CharXiv Reasoning 85.2%)에서는 표에 오른 경쟁 모델을 모두 앞섭니다. 초장문 맥락 처리(GDM-MRCR v2 1M 구간)에서도 54.0%로, 같은 세대의 3.5 Flash(26.6%)나 3.1 Pro(26.3%)를 두 배 이상 앞서는 세대적 도약을 보여줍니다. 즉, 가장 똑똑한 모델을 겨루는 자리가 아니라 성능당 비용을 겨루는 자리에서 강점을 갖는 모델입니다. Artificial Analysis가 공개한 코딩 에이전트 벤치마크에서 지적하듯, 실제 에이전트 성능은 모델 자체뿐 아니라 이를 감싸는 하네스(harness)의 조합으로 결정되므로, 반복 호출이 잦은 워크로드일수록 이런 효율 지표가 중요해집니다.

가격과 사용 방법

3.6 Flash와 3.5 Flash-Lite는 발표 당일부터 바로 사용할 수 있습니다. 3.5 Flash Cyber만 앞서 설명한 대로 CodeMender를 통한 제한적 파일럿으로 제공됩니다.

API에서 3.6 Flash는 gemini-3.6-flash 모델 코드로 호출하며, 입력 100만 토큰과 출력 6만 4천 토큰의 컨텍스트, 텍스트, 이미지, 비디오, 오디오, PDF 입력을 지원하고 함수 호출(function calling), 도구로서의 검색(search as a tool), 컴퓨터 사용을 도구로 사용할 수 있습니다.

:scroll: Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 소개 블로그

:house: Gemini 3.6 Flash 모델 페이지

:rocket: Google Antigravity의 Gemini 3.6 Flash 소개

:shield: Gemini 3.5 Flash Cyber 소개 블로그

더 읽어보기




이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. :hugs:

:pytorch:파이토치 한국 사용자 모임:south_korea:이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일:love_letter:로 보내드립니다! 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. :smiley:

:wrapped_gift: 아래:down_right_arrow:쪽에 좋아요:+1:를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ :star_struck: