AI

Grok 4.7 나왔다, 벤치마크는 올랐는데 왜 평가는 갈릴까

Grok 4.7은 코딩·장시간 에이전트 작업 성능을 크게 끌어올렸습니다. 다만 더 높은 추론 설정과 많은 토큰을 쓰는 경향까지 함께 봐야 해서, 숫자만큼 체감 평가가 한쪽으로 모이지는 않습니다.

Grok 4.7의 장시간 에이전트 작업과 주요 수치를 표현한 그래픽
Grok 4.7의 장시간 에이전트 작업 특성을 설명하려고 만든 생성 그래픽이며 실제 제품 화면이 아닙니다.

이번 4.7에서 xAI가 실제로 바꾼 것은 무엇일까

xAI는 2026년 9월 21일 Grok 4.7을 공개했습니다. 공식 설명에서 가장 강조한 변화는 단순히 “더 똑똑해졌다”가 아니라, 어려운 문제를 더 오래 붙잡고 작업하고 자신의 결과를 더 자주 검증하도록 훈련했다는 점입니다.

Grok 4.6보다 큰 새 베이스 모델을 사용했고, 강화학습도 여러 시간이 걸리는 문제에 더 큰 비중을 둔 어려운 작업 조합으로 길게 진행했다고 밝혔습니다. 긴 컨텍스트 관리와 Grok Bot 하네스 이해도 함께 강화했습니다.

공식 API 사양은 50만 토큰 컨텍스트, 텍스트·이미지 입력과 텍스트 출력, low·medium·high·xhigh 추론 단계를 지원합니다. 지식 기준일은 2026년 5월입니다.

벤치마크 숫자는 실제로 많이 올랐다

xAI가 공개한 비교에서 Grok 4.7은 코딩과 장시간 도구 사용 계열에서 Grok 4.6보다 높은 점수를 냈습니다. 특히 Terminal-Bench 4.0은 20.3%에서 38.0%로 올라 변화폭이 큽니다.

Grok 4.6과 Grok 4.7의 CursorBench, Terminal-Bench, HealthBench, EEBench 비교 차트
xAI가 공개한 Grok 4.6·4.7 수치를 바탕으로 직접 만든 비교 차트입니다. 4.7은 xhigh, 4.6은 high 설정이므로 동일 추론량 비교는 아닙니다.
평가Grok 4.6 highGrok 4.7
CursorBench 4.040.4%46.3% (xhigh)
DeepSWE v1.165.2%71.0% (high)
Terminal-Bench 4.020.3%38.0% (xhigh)
AA Briefcase v1.11,5461,657 (xhigh)
EEBench53.0%64.0% (xhigh)

여기서 가장 중요한 단서는 설정입니다. xAI의 대표 표는 대부분 Grok 4.7의 xhigh와 Grok 4.6의 high를 비교합니다. DeepSWE의 4.7 점수만 high로 별도 표시돼 있습니다. 따라서 “같은 계산량에서 이만큼 향상됐다”고 읽으면 정확하지 않습니다.

독립 평가에서는 ‘조금 더 똑똑하지만 훨씬 많이 생각한다’는 그림이 보인다

Artificial Analysis의 초기 독립 평가에서도 Grok 4.7은 개선됐습니다. Intelligence Index에서 Grok 4.7 high와 xhigh는 모두 46점을 기록했고, Grok 4.6 high는 44점입니다.

다만 토큰 사용량 차이가 큽니다. Artificial Analysis의 Intelligence Index 전체 평가에서 Grok 4.6 high는 약 9,400만 출력 토큰을 사용한 반면, Grok 4.7 high는 약 2억 토큰, xhigh는 약 2억4,000만 토큰을 사용했습니다.

설정Intelligence Index평가 전체 출력 토큰
Grok 4.6 high4494M
Grok 4.7 high46200M
Grok 4.7 xhigh46240M

이 수치는 곧바로 실제 API 비용이나 모든 작업의 효율을 뜻하지는 않습니다. 평가 구성과 추론 설정이 다르기 때문입니다. 그래도 “성공률은 올랐는데 왜 더 오래 생각하는 느낌이지?”라는 초기 사용자 반응을 이해하는 데는 중요한 단서입니다.

가격은 그대로지만, 긴 프롬프트에는 조건이 있다

xAI는 Grok 4.7을 Grok 4.6과 같은 기본 가격으로 내놨습니다. 20만 토큰 미만 프롬프트 기준으로 입력은 100만 토큰당 2달러, 캐시 입력은 0.50달러, 출력은 6달러입니다.

하지만 프롬프트가 20만 토큰을 넘으면 입력 4달러, 캐시 입력 1달러, 출력 12달러로 두 배가 됩니다. 50만 토큰 컨텍스트를 장시간 에이전트 작업에 적극적으로 쓰는 경우라면 이 구간을 반드시 함께 계산해야 합니다. 비슷한 시기 Opus 5.5·GPT-6 Sol·Luna의 가격 흐름은 따로 정리했습니다.

또 Grok 4.7 Fast는 같은 모델을 더 빠른 인프라에서 제공하지만 토큰 단가도 두 배입니다. 현재 Fast는 공개 xAI API가 아니라 Cursor와 Grok Build에서 제공됩니다.

그래서 개발자 평가는 왜 갈릴까

코딩 에이전트 관점에서는 방향이 명확합니다. 저장소를 읽고, 터미널을 실행하고, 결과를 검증하고, 실패하면 다시 고치는 긴 작업에서 성능 향상이 공식 수치와 독립 평가 양쪽에서 확인됩니다.

반대로 짧은 수정이나 빠른 질답에서는 xhigh가 과할 수 있습니다. 성능이 44에서 46으로 오른 독립 평가에서 토큰 사용량은 두 배 이상 늘어난 만큼, “최고 추론 설정을 항상 켜는 것이 이득인가”는 별도 문제입니다.

Cursor 공식 포럼에서도 출시 직후 토론의 초점이 긴 작업 지속력, 비코딩 지식 작업, 실제 일상 코딩에서 4.6과 얼마나 다른지에 모이고 있습니다. 아직 출시 하루도 지나지 않은 초기 반응이라 성공 사례와 실패 사례를 일반화하기에는 이릅니다. Grok 4.6이 Cursor와 Build에서 다르게 보였던 이야기는 따로 정리했습니다.

창작·역할극 사용자는 다른 모델을 보고 있는 셈이다

Grok 커뮤니티에서는 몇 세대 전부터 창작 글쓰기와 역할극의 자연스러움이 떨어졌다는 불만이 이어졌습니다. 그래서 4.7 공개 직후에도 “코딩과 knowledge work만 더 좋아진 것 아니냐”는 반응이 나옵니다.

반대로 일부 초기 사용자는 4.7이 4.6보다 긴 장면의 맥락을 더 잘 유지한다고 평가했습니다. 다만 이쪽은 현재 Reddit의 소수 사용 후기 수준입니다. 공식 벤치마크처럼 반복 가능한 근거로 보기는 어렵고, 기존 4.6에 대한 불만과 4.7의 실제 체감이 섞여 있다는 점도 감안해야 합니다.

즉 “Grok 4.7의 평이 나쁘다”기보다는 사용 목적이 갈라져 있다고 보는 편이 정확합니다. 장시간 코딩·도구 사용자는 이번 개선의 직접 수혜자이고, 짧은 대화·창작 중심 사용자는 같은 업그레이드를 체감하지 못할 수 있습니다.

어디에서 쓸 수 있나

현재 확실하게 확인되는 제공처는 xAI API, Grok Build, Cursor, OpenRouter·Vercel·Cloudflare 같은 모델 게이트웨이입니다. GitHub도 9월 21일부터 GitHub Copilot에 Grok 4.7을 순차 배포하기 시작했습니다.

Copilot에서는 VS Code, Visual Studio, Copilot CLI, 클라우드 에이전트, JetBrains, Xcode, Eclipse 등에서 모델 선택이 가능해집니다. GitHub는 순차 배포라고 명시했기 때문에 계정에 바로 보이지 않을 수도 있습니다.

‘2.1조 파라미터’는 정식 사양으로 쓰기 어렵다

출시 전부터 Grok 4.7을 2.1조 파라미터 모델이라고 부르는 글이 많았습니다. 하지만 현재 xAI의 정식 Grok 4.7 발표와 개발자 문서에는 파라미터 수가 적혀 있지 않습니다.

Artificial Analysis 역시 모델 크기를 미공개로 표시합니다. 따라서 2.1T는 사전 발언과 공개 전 정보로 구분해서 보는 것이 안전하며, 현재 공식 모델 사양으로 확정해 적기는 어렵습니다.

그래서, Grok 4.7은 무엇이 달라진 모델인가

Grok 4.7의 핵심은 모든 답변을 조금씩 더 잘하는 범용 업그레이드라기보다, 오래 걸리는 문제를 끝까지 붙잡고 도구를 쓰며 검증하는 능력을 강하게 끌어올린 데 있습니다.

그래서 벤치마크 상승과 엇갈린 체감은 동시에 성립할 수 있습니다. 긴 에이전트 작업에서는 큰 개선이 보이지만, 짧은 작업에서는 더 많은 추론과 토큰이 오히려 부담이 될 수 있습니다.

개발자가 실제로 비교하려면 같은 저장소 작업을 low·medium·high로 각각 돌려 성공 여부, 총 토큰, 작업 시간까지 같이 보는 편이 낫습니다. 4.7에서는 “최고 점수”보다 내 작업에 필요한 추론량을 어디까지 낮출 수 있느냐가 비용과 체감 품질을 가르는 변수가 될 가능성이 큽니다.

출처

확인한 자료

01SpaceXAI — Introducing Grok 4.7https://x.ai/news/grok-4-702SpaceXAI Docs — Grok 4.7https://docs.x.ai/developers/grok-4-703SpaceXAI Docs — Release Noteshttps://docs.x.ai/developers/release-notes04Artificial Analysis — Grok 4.7 xhighhttps://artificialanalysis.ai/models/grok-4-7/05Artificial Analysis — Grok 4.7 highhttps://artificialanalysis.ai/models/grok-4-7-high06GitHub Changelog — Grok 4.7 in Copilothttps://github.blog/changelog/2026-09-21-grok-4-7-is-now-available-in-github-copilot/07Cursor Forum — Grok 4.7 is now Livehttps://forum.cursor.com/t/grok-4-7-is-now-live/17252608Cursor Forum — Share your Thoughts on Grok 4.7https://forum.cursor.com/t/share-your-thoughts-on-grok-4-7/17252709Reddit r/grok — creative writing initial feedbackhttps://www.reddit.com/r/grok/comments/1wmhnab/grok_47_is_better_at_creative_writing_than_46/10Reddit r/grok — release reactionshttps://www.reddit.com/r/grok/comments/1wmguoy/grok_47_is_out/

글 검색