글 목록으로
2026년 8월 16일
10분 소요

Grok 4.6은 한 달 만에 +5점, Gemini 3.7 Flash는 3주 만에 나왔다 — 갈아타기 전에 확인할 것들

8월 둘째 주에 새 모델이 둘 나왔다. 12일에 Grok 4.6, 13일에 Gemini 3.7 Flash. 벤치마크 표는 각자 화려한데, 갈아타는 입장에서 진짜 확인할 건 표 바깥에 있다. Gemini의 반값 가격은 12월 31일까지고 1월 1일부터는 3.6 Flash와 같은 가격으로 돌아온다. Grok은 기본 단가를 동결했다고 보도됐지만 캐시 읽기 단가가 67% 올랐고, 이 모델이 겨냥한 장시간 에이전트 워크로드가 바로 캐시 읽기를 제일 많이 쓰는 워크로드다. 직전 버전 대비 뭐가 좋아졌는지, 모델명을 바꾸기 전에 코드와 요금표에서 뭘 점검해야 하는지 — xhigh의 조용한 작동 개시, 사라진 minimal, 200K 요금 경계, 지워야 할 파라미터 다섯 개까지 정리했다.

새 모델이 나오면 따져보는 시리즈의 다섯 번째다. Fable 5(#21), GPT-5.6 삼형제(#31), Kimi K3(#33), Opus 5(#40)에 이어 이번엔 둘을 한 번에 본다. 8월 12일에 나온 Grok 4.6, 그다음 날 나온 Gemini 3.7 Flash.

둘을 묶어 보는 이유는 출시일이 겹쳐서만은 아니다. 두 회사 모두 새 파운데이션 없이 점수를 올렸다. xAI는 베이스 모델을 새로 만드는 대신 학습 레시피를 바꿔 한 달 만에 +5점을 얻었고, Google은 플래그십 Gemini 3.5 Pro가 계속 늦어지는 동안 주력 등급인 Flash를 3주 간격으로 찍어내고 있다. #54에서 본 것처럼 개선의 무게중심이 프리트레이닝 바깥으로 옮겨가는 흐름이 프런티어 랩 두 곳에서 같은 주에 확인된 셈이다.

그리고 갈아타는 입장에서 이번 두 릴리스의 공통점이 하나 더 있다. 코드가 깨지는 변화보다 청구서가 바뀌는 변화가 크다. 하나씩 보자.


Grok 4.6: 한 달 만에 +5점, 베이스는 그대로

참고로 xAI는 지난 2월 SpaceX에 인수돼 지금은 SpaceXAI라는 이름을 쓴다. 다만 도메인·API·법인명은 전부 x.ai와 X.AI LLC 그대로라, 이 글에서는 익숙한 대로 xAI로 쓴다.

xAI가 발표문에서 밝힌 개선 방법은 이렇다. Grok 4.5보다 긴 보충 학습(개선된 옵티마이저와 학습 레시피, 큐레이션된 모델 생성 데이터), Grok 4.5 자신을 시켜 SFT 궤적을 전부 다시 생성, 그리고 지식 노동·코딩·도메인 환경에서 돌린 에이전틱 RL. 새 아키텍처 이야기는 한 줄도 없다. 파라미터 수나 구조는 공개하지 않았다(돌아다니는 “1.5T”는 4.5 시절 보도에서 이월된 추정치다).

그 결과가 이 숫자들이다. 컨텍스트는 500K로 그대로, 지식 컷오프는 2026년 2월 1일.

벤치마크 Grok 4.6 Grok 4.5 비고
Artificial Analysis Index 61 56 GPT-5.6 Sol과 동점, Opus 5(63)·Fable 5(62) 다음 3위
AA-Briefcase (Elo) 1577 1313 최대 상승. 장시간 지식 노동
GDPVal-AA v2 (Elo) 1753 1526 이 부문은 Opus 5 다음 2위
DeepSWE v1.1 65.9% 54% 올랐지만 GPT-5.6 Sol Max(73%)에는 뒤짐
APEX-Agents 57.5% 47.1%
Terminal-Bench v3.0 26% 15.7% 여전히 GPT-5.6 Sol Max(34.6%)에 크게 뒤짐
CursorBench v3.2 69.9% 66.7% 상승 폭이 가장 작은 항목

발표문이 강조하는 건 “장시간 에이전트”다. 긴 궤적에서 모델이 스스로 테스트와 검증을 더 하기 시작했다고 하는데, 설계했다기보다 관찰됐다는 투로 쓰여 있다. 이 주장을 뒷받침하는 제3자 수치가 하나 있다. Artificial Analysis의 AA-Briefcase 측정에서 Grok 4.6은 과제당 약 53턴, 입력 5억 토큰을 쓰고 끝냈다. 같은 과제를 Claude Opus 5는 약 103턴, 입력 20억 토큰을 썼다. 토큰 단가가 낮은데 쓰는 토큰 수까지 절반 이하니 실비용 격차는 곱으로 벌어진다. AA가 측정한 인텔리전스 인덱스 실행 비용은 과제당 $0.84.

정리하면 Grok 4.6이 노리는 건 “제일 똑똑한 모델” 타이틀이 아니다. 순수 코딩 벤치마크에서는 GPT-5.6과 Claude에 밀린다. 대신 긴 에이전트 루프를 적은 턴, 낮은 단가로 완주하는 실행자 역할을 잡았고, 실제로 개발자 커뮤니티에서는 비싼 모델에게 계획을 시키고 구현은 Grok에게 넘기는 분업 패턴이 보고된다.


Grok 4.6으로 갈아타기 전에 확인할 것 셋

모델명을 grok-4.5에서 grok-4.6으로 바꾸는 것 자체로는 아무 일도 안 생긴다. 발표된 breaking change가 없고, 4.5도 은퇴하지 않았다. 문제는 그다음이다.

첫째, xhigh가 이제 진짜로 작동한다. 4.6은 reasoning_effort에 최고 단계 xhigh를 새로 얹었다(기본값은 high). 함정은 구버전의 동작이다. 4.5는 xhigh를 받으면 에러 없이 조용히 high로 처리했다. “혹시 몰라서” xhigh를 박아둔 코드가 있었다면 지금까지는 없는 설정이었는데, 모델명을 바꾸는 순간 그 줄이 실제로 돈과 지연시간을 쓰기 시작한다. 실제 사고 사례도 이미 나왔다 — Hermes Agent는 4.5 시절 만든 호환 코드가 xhighhigh로 몰래 바꿔치기하고 있었고, 같은 프롬프트의 reasoning 토큰이 362 대 1767로 갈리는 걸 확인하고서야 잡았다. 확인 방법이 여기서 나온다. 설정 파일 말고 응답의 usage.reasoning_tokens를 보라. 설정이 실제로 반영됐는지는 토큰 회계 층에서만 확인된다.

그럼 xhigh를 쓸 가치는 있나. 외부 집계 기준 CursorBench에서 high 69.9% 대 xhigh 70.8% — 0.9%p 올리는 데 과제당 비용이 20%쯤 는다. 전역 기본값으로 걸 설정이 아니라, 유난히 실패하는 특정 스텝(어려운 계획 턴, 까다로운 리팩터링)에서만 한 단계 올려 쓰는 옵션이다. 하나 더 — reasoning_effortstop·presencePenalty·frequencyPenalty와 동시에 못 쓴다. stop을 쓰던 코드에 effort를 추가하는 순간 에러가 나니 미리 확인할 것.

둘째, 캐시 읽기 단가가 67% 올랐다. 기본 단가는 입력 $2 / 출력 $6(백만 토큰당)으로 4.5와 동일해서 “가격 동결”로 보도됐다. 그런데 요금표를 한 줄 더 읽으면 캐시된 입력이 $0.30에서 $0.50으로 올랐다(200K 이상 구간은 $0.60에서 $1.00). 이게 왜 큰일이냐면, 장시간 에이전트 루프는 매 턴 누적 대화를 다시 보내고 그 대부분이 캐시 히트로 처리되기 때문이다. 이 모델이 겨냥한 워크로드일수록 청구서에서 캐시 읽기 비중이 크고, 그 단가만 골라서 오른 것이다. 대응책은 문서에 있다. prompt_cache_key로 대화를 같은 서버에 고정해 캐시 히트를 안정시키라는 것 — 이걸 안 잡으면 요청이 캐시 없는 서버에 떨어져 정가를 낸다. #48에서 캐시 히트율이 프롬프트 설계 성적표라고 했는데, Grok에서는 라우팅 설정까지 성적표에 들어간다.

셋째, 컨텍스트는 500K지만 예산은 200K로 잡아야 한다. 요금표가 프롬프트 200K를 경계로 갈리고, 넘는 순간 요청 전체가 입력 $4 / 출력 $12로 계산된다. 공개 단가로 계산해 보면 프롬프트 180K + 출력 20K는 약 $0.48인데, 프롬프트가 200K를 넘으면 같은 출력에 약 $1.04 — 입력 2만 토큰 더 넣었다고 청구액이 두 배가 된다. xAI 문서도 에이전트 워크플로에는 컨텍스트 컴팩션을 권한다. 500K 창을 믿고 대화를 쌓지 말고, 200K 안쪽에서 요약·압축하며 도는 설계를 처음부터 하라는 뜻이다. #55에서 파티션 키 설계가 곧 비용 설계라고 했는데, Grok에서는 컨텍스트 길이가 그 역할을 한다.

덧붙여 하나. 4.5는 은퇴하지 않았지만, xAI는 지난 5월 레거시 8종을 은퇴시킬 때 옛 모델명을 404로 만들지 않고 새 모델로 리다이렉트하면서 새 단가로 청구한 전례가 있다. 언젠가 4.5가 은퇴해도 빌드는 안 깨진다. 청구서가 바뀔 뿐이다.


Gemini 3.7 Flash: 3주 만에 또 나온 주력 모델, 계속 늦어지는 Pro

Google 쪽 이야기는 출시 간격부터 봐야 한다. 3.5 Flash가 5월 19일, 3.6 Flash가 7월 21일, 3.7 Flash가 8월 13일. 3.6과 3.7 사이가 3주다. 그동안 6월에 내겠다던 Gemini 3.5 Pro는 아직도 없다. Bloomberg 보도로는 코딩 성능이 내부 기대에 못 미쳐서고, Pichai는 실적 발표에서 Pro 일정 대신 “거의 월간 캐던스로 모델을 내겠다”는 말로 넘어갔다. 플래그십이 막힌 사이 주력 모델을 반복해 내며 버티는 중이다.

3.7 Flash 자체는 코딩·에이전트 특화 업그레이드가 맞다. Google 자체 벤치마크에서 3.6 Flash 대비:

벤치마크 3.7 Flash 3.6 Flash
DeepSWE v1.1 65.3% 49.0%
FrontierCode 1.1 (Main) 43.6% 34.4%
AutomationBench 30.4% 17.0%
Terminal-bench 2.1 85.8% 78.0%
WebDev Arena (Elo) 1588 1538
GDP.pdf (금융·법률·바이오) 34.0% 22.0%

WebDev Arena에서는 Claude Sonnet 5(1541)와 GPT-5.6 Terra(1523)를 앞선다. 다만 DeepSWE에서는 GPT-5.6 Terra(69.6%)에 여전히 뒤지고, Artificial Analysis 인덱스로는 56(high 기준)으로 프런티어급은 아니다. 컨텍스트 1M, 출력 64K, 컷오프 2026년 3월. 어디까지나 주력 등급 안에서 크게 오른 것이다.

가격이 이번 릴리스의 헤드라인인데, 여기 만료일이 붙어 있다. 입력 $0.75 / 출력 $3.75는 12월 31일까지고, 1월 1일부터 $1.50 / $7.50으로 돌아온다. 그리고 그 복귀 가격은 3.6 Flash의 현행 가격과 정확히 같다. 즉 영구 인하가 아니라 4.5개월짜리 프로모션이고, 내년 예산은 지금 청구서가 아니라 $1.50/$7.50 기준으로 잡아야 한다. 토큰 효율도 짚을 게 있다. 3.6 Flash는 출력 토큰을 17% 줄였다는 게 세일즈 포인트였는데, 3.7 발표문에는 효율 주장이 없다. 오히려 한 외부 리뷰(eesel)는 3.7이 과제당 토큰을 3.6보다 40%쯤 더 쓴다고 측정했다 — 단일 소스라 확정은 아니지만, 사실이라면 반값 스티커의 실효 할인율은 그보다 작고 프로모션이 끝나는 순간 실효 단가는 3.6보다 비싸진다.


Gemini 3.7 Flash 마이그레이션: 지우는 것부터

Opus 5 때 마이그레이션의 첫 항목이 “무엇을 지울까”였는데, Gemini도 같은 방향이다. 다만 Opus 5가 프롬프트 지시문을 지우라고 했다면 Gemini는 API 파라미터를 지우라고 한다.

지울 것: temperature, top_p, top_k, candidate_count, 프리필된 모델 턴. 최신 Gemini 모델군에서 샘플링 파라미터가 통째로 deprecated 됐다(7월 21일 변경분부터). 특히 temperature는 기본값 1.0을 건드리면 루핑과 품질 저하가 생긴다고 공식 문서가 경고한다. “출력이 이상하면 temperature부터 만진다”는 수년 된 습관이 이 모델군에서는 금지 항목이 됐다.

바꿀 것: thinking_budget 숫자를 thinking_level 문자열로. low / medium / high 세 단계고 기본값은 medium, 둘을 같이 보내면 에러다. 등급별 공식 가이드는 low가 지연 민감한 작업(실시간 챗, 초안 작성), medium이 대부분의 작업과 에이전트 용도, high가 어려운 수학·최난도 코딩이다.

없어진 것: minimal. 이게 실무에서 제일 아픈 변화다. 3.5 Flash·3.5 Flash-Lite·3.6 Flash까지 있던 최저 사고 단계가 3.7에서 사라졌고, 보내면 에러가 난다. minimal은 OCR, 티켓 분류, 태깅 같은 대량 파이프라인의 단가를 떠받치던 최저 등급이었다. 3.7에서는 그 최저선이 low로 올라갔으니, 그 워크로드는 3.7로 이주하지 않고 3.5 Flash-Lite($0.30/$2.50, 기본값 minimal)에 남겨두는 게 답일 수 있다. 다행히 강제 이주는 없다 — 3.5·3.6 계열 모두 은퇴 일정이 공지되지 않았다. 압박은 프로모션 가격 하나뿐이다.

프롬프트에서 바꿀 것. Gemini 3 계열 공식 가이드의 방향은 한 줄로 줄이면 “정교한 프롬프트 대신 다이얼”이다. 몇 년간 쌓은 chain-of-thought 비계를 넣는 대신 thinking_level을 올리고 프롬프트 자체는 짧고 직접적으로 쓰라고 한다. 긴 컨텍스트에서는 질문을 데이터 뒤에 배치하고, 기본 말투가 건조하니 대화형 톤을 원하면 페르소나를 명시하라는 것도 문서에 있다. 도구 호출 쪽은 감사가 필요하다. FunctionResponsecall_idname이 필수가 됐고, 멀티모달 자산은 응답 페이로드 안에 넣어야 한다(별도 전송 불가).


벤치마크 표를 믿기 전에

이번 두 릴리스에서는 벤치마크 숫자를 어떻게 읽어야 하는지 보여주는 사례가 유난히 많이 나왔다.

같은 모델이 26%이면서 88.4%다. Grok 4.6의 Terminal-Bench 점수는 xAI 표에서 26%(v3.0), Artificial Analysis 측정에서 88.4%(v2.1)다. 버전이 다르면 난이도가 다르고, 버전 표기 없이 도는 숫자는 어느 쪽이든 무의미하다. 심지어 같은 v2.1에서도 측정 주체(AA와 Vals)에 따라 10%p가 벌어졌다 — 하네스만으로 그만큼 움직인다는 뜻이다. #38에서 하네스 비교에 괄호를 치자고 했는데, 이제 벤치마크 버전에도 쳐야 한다.

“1753 ELO”의 정체. Musk가 맥락 없이 “Grok 4.6 reaches 1753 ELO”라고 올린 숫자는 LMArena가 아니라 GDPval-AA v2의 Elo다. 출처 없이 도는 숫자가 더 유명한 지표로 오독되는, 딱 그런 경우다.

각주를 읽을 것. xAI 표의 각주에는 “타사 점수는 self-report 또는 공개 결과 중 최고치”라고 적혀 있다. 자사는 단일 설정, 타사는 최고치 선별이라 애초에 같은 조건의 비교가 아니다. Google 표는 전부 발표자 셀프 리포트다. 이건 #40에서 한 말 그대로라 반복만 해둔다 — 제3자 재현을 기다릴 것.


어떤 작업에 어느 모델을 쓰나

두 모델 다 프런티어 등급은 아니다. 어디에 뭘 쓸지 비용 기준으로 정리하면:

  • 대량 분류·태깅·OCR — 3.7 Flash로 가지 말 것. minimal이 없어져 최저 단가가 올랐다. 3.5 Flash-Lite에 남기거나, 이미 3.6에 있다면 그대로 둬도 된다(은퇴 일정 없음).
  • 코딩·에이전트 주력 모델 — 3.7 Flash가 이 등급에서는 가장 강해졌고 연말까지는 $0.75/$3.75로 확실히 싸다. 단 2027년 예산은 $1.50/$7.50 기준으로 잡고, 프로모션 종료 시점에 3.6 잔류·타사 이동과 다시 비교할 것.
  • 장시간 에이전트 루프의 구현 담당 — Grok 4.6이 노리는 용도이고 숫자(과제당 $0.84, 절반의 턴 수)도 받쳐준다. 계획·설계는 프런티어 모델, 구현 실행은 Grok이라는 분업이 실제 사용 패턴으로 보고된다. 단 prompt_cache_key와 200K 예산 설계를 갖춘 다음의 이야기다.
  • 최고 품질이 필요한 작업 — 둘 다 아니다. 종합 지능은 여전히 Opus 5, Fable 5, GPT-5.6 순이고, Grok 4.6은 3위(61점), 3.7 Flash는 56점이다.

정리

이번 주의 두 릴리스는 같은 이야기의 두 버전이다. 새 파운데이션이 바로 안 나오는 시기에, xAI는 학습 레시피를 갈아 한 달 만에 5점을 얻었고 Google은 주력 등급을 3주 주기로 갱신하고 있다. 이제 점수는 프리트레이닝이 끝난 다음 단계에서 갈린다.

그리고 개발자에게 실질적인 변화는 이번에도 발표문 헤드라인 바깥에 있었다. Gemini의 반값에는 만료일이 있고, Grok의 “가격 동결”은 캐시 단가 67% 인상과 같이 왔다. 지워야 할 파라미터(temperature 계열), 조용히 작동을 시작하는 파라미터(xhigh), 사라진 등급(minimal), 넘으면 두 배가 되는 경계(200K)까지 — 전부 모델명 한 줄 바꾸는 diff에는 안 보이는 것들이다. #40에서 남긴 질문이 “이번엔 내 프롬프트에서 뭘 지워야 하는가”였다면, 이번 주가 하나 더 얹었다. 요금표에서 뭐가 조용히 바뀌었는가.


참고: Grok 4.6 발표 (xAI, 2026-08-12), Grok 4.6 문서, xAI 모델·요금표, xAI reasoning 문서, Artificial Analysis — Grok 4.6 분석, Hermes Agent 이슈 #84799, Gemini 3.7 Flash 발표 (Google, 2026-08-13), Gemini 3.7 Flash 모델 카드, Gemini API 요금표, Gemini API 변경 로그, Gemini 3 개발자 가이드, InfoWorld, Bloomberg. 벤치마크 수치는 2026-08-16 기준이며 별도 표기가 없으면 발표자 주장이다. Grok 4.6의 xhigh 벤치마크 수치와 3.7 Flash의 토큰 사용량 증가 측정은 각각 외부 집계·단일 리뷰 출처로, 공식 확인은 아직 없다.