[뉴스스페이스=김정영 기자] 스페이스XAI는 8월 12일(현지시간) Grok 4.6을 공개하며, 최신 최첨단 AI 모델이 오픈AI의 GPT-5.6 Sol 및 앤트로픽의 Fable 5와 정면으로 경쟁할 수 있는 수준이라고 밝혔다. 가격은 경쟁 모델의 약 절반 수준이다. 해당 모델은 Cursor, Grok Build, Grok Bot, 스페이스XAI API를 통해 즉시 이용 가능하다.
61점의 의미와 한계
9to5mac.com, tradingkey.com, officechai.com, basenor.com에 따르면, Grok 4.6은 12일 공개된 Artificial Analysis Intelligence Index에서 61점을 기록했다. 벤치마크의 세부 항목과 실제 업무비용까지 고려하면 ‘절대 성능 1위’보다는 비용 효율을 앞세운 에이전트 모델로 보는 것이 더 정확하다.
이는 직전 Grok 4.5보다 5점, Grok 4.3보다 23점 오른 수치이며, GPT-5.6 Sol Max와 동률이다. 다만 같은 평가에서 Claude Fable 5는 62점, Claude Opus 5는 63점으로 Grok 4.6보다 각각 1점과 2점 높았다. 따라서 ‘GPT-5.6 Sol과 동급’이라는 표현은 해당 종합지수에 한정하면 성립하지만, 현 시점 전체 최상위권은 앤트로픽 모델들이 근소하게 앞서는 구도다.
특히 Grok 4.6의 강점은 정적인 질의응답보다 여러 단계의 도구 사용과 업무 수행이 필요한 에이전트 작업에서 나타났다. Artificial Analysis에 따르면 실제 지식노동형 에이전트 업무를 측정하는 GDPval-AA v2에서 Grok 4.6은 Elo 1753점을 기록했다. Claude Opus 5 다음 수준이지만 Claude Fable 5 및 Qwen3.8 Max와는 신뢰구간이 겹쳐 통계적으로 우열을 단정하기 어렵다. 금융 고객지원형 도구 사용 평가인 τ³-Banking에서는 50.7%, 터미널 기반 소프트웨어 작업을 평가하는 Terminal-Bench v2.1에서는 88.4%를 얻었다.
장기 업무 수행을 평가하는 AA-Briefcase에서는 Elo 1577점을 받아 Claude Fable 5급 성능권에 진입했다. 더욱 주목할 대목은 효율이다. Artificial Analysis는 Grok 4.6이 해당 작업을 평균 약 53회 대화 턴, 약 5억 개 입력 토큰으로 끝낸 반면 Claude Opus 5 Max는 평균 약 103회 턴과 약 20억 개 입력 토큰을 사용했다고 분석했다. 장기 에이전트 업무에서는 토큰 단가뿐 아니라 작업 완료까지 필요한 대화 횟수와 누적 컨텍스트가 비용을 좌우한다는 점에서 의미 있는 지표다.
‘반값’의 실제 계산법
Grok 4.6의 기본 API 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러다. 캐시 입력은 100만 토큰당 0.50달러이며, 고속 버전은 기본 가격의 두 배로 책정됐다. 반면 오픈AI의 GPT-5.6 Sol은 입력 5달러, 출력 30달러다. 단순 토큰 단가 기준으로 Grok 4.6은 GPT-5.6 Sol보다 입력은 60%, 출력은 80% 저렴하다.
Artificial Analysis는 실제 평가 환경에서 Grok 4.6의 작업당 비용을 0.84달러로 추산했고, 이 모델을 성능 대비 비용의 ‘파레토 프런티어’에 위치한 모델로 평가했다. 다만 이 수치는 특정 벤치마크의 프롬프트 길이, 추론 설정, 도구 호출 방식, 캐시 적중률을 반영한 추정치다. 기업 사용자가 실제로 지불할 비용은 코드베이스 규모, 문서량, 재시도 횟수, 출력 길이와 작업 자동화 방식에 따라 크게 달라질 수 있다.
모델 확장보다 후속 학습
이번 버전은 완전히 새로운 초대형 기반모델이라기보다 Grok 4.5의 후속 학습(post-training) 강화판에 가깝다. Cursor와 스페이스XAI는 고품질 엔지니어링 데이터, 추론 및 고급 기술 개념을 위한 선별 데이터, 지도 미세조정(SFT), 강화학습(RL)을 적용했다고 설명했다. 강화학습 범위도 일반 코딩과 지식업무를 넘어 커널 최적화, 웹 개발, 컴퓨터 지원 설계(CAD) 등으로 확대했다.
회사는 Grok 4.6이 낯선 분야를 조사하고, 애플리케이션 구조를 설계하며, 핵심 상호작용을 구현한 뒤, 피드백에 따라 반복 개선하는 작업에 강점을 보인다고 주장했다. 그러나 이는 출시사가 제시한 사용성 평가이므로, 실제 기업 도입 단계에서는 보안성, 환각률, 코드 취약점 생성 가능성, 장기 작업의 중단·복구 능력 등을 별도 검증해야 한다. Cursor는 사전 배포 테스트와 사후 제3자 테스트를 확대했다고 밝혔지만, 세부 안전성 수치와 평가 원문은 제한적으로 공개됐다.
유통망과 시장의 분리
스페이스X 주가가 Grok 4.6 발표 직후 6% 이상 뛰었다는 식의 인과 해석에는 주의가 필요하다. 로이터와 블룸버그 보도에 따르면 이달 6일 스페이스X 주가가 약 6% 상승한 직접 계기는 대규모 보호예수 해제였다. 당시 약 9억1150만 주가 거래 가능해졌고, 시장은 유통주식 확대와 내부자 매도 가능성을 소화하는 과정에 있었다.
모건스탠리는 12일 스페이스X에 대해 투자의견 ‘비중확대’와 목표주가 300달러를 유지하면서, 강세 시나리오로 600달러를 제시했다. 당시 주가는 142.52달러, 시가총액은 약 1조8800억달러로 집계됐다. 그러나 이 보고서는 Grok 4.6의 단기 매출보다 Cursor 인수와 소비자·기업 AI 플랫폼 확장 가능성에 가치를 부여한 것이다. 모델 하나의 벤치마크 성적을 곧바로 기업가치 상승의 근거로 연결하기보다는, 유료 API 사용량과 기업 고객 확보, AI 투자비 회수 속도를 확인해야 한다.
Grok 4.6은 최상위 모델 간 성능 격차가 1~2점 수준으로 좁아진 시점에 등장했다. 스페이스XAI가 겨냥한 시장은 ‘가장 높은 단일 벤치마크 점수’가 아니라, 긴 업무를 덜 자주 멈추고 더 적은 토큰으로 끝내는 개발·지식노동 에이전트 시장이다. 향후 경쟁의 핵심은 파라미터 수나 홍보성 순위보다, 동일한 실제 업무를 얼마나 안정적으로 수행하고 그 과정에서 얼마의 추론비용을 발생시키느냐가 될 전망이다.

































































